Gemini 3.7 Flash: o que é, o que muda em relação ao 3.6 Flash e para quem serve

O Gemini 3.7 Flash é a iteração mais recente da série Gemini 3, lançada pelo Google três semanas depois do 3.6 Flash e apresentada como o modelo workhorse (eficiente e econômico) da família, com foco em programação e agentes. Ele aceita texto, imagem, áudio e vídeo, tem 1 milhão de tokens de contexto, devolve texto em até 64K tokens e traz níveis de raciocínio configuráveis (low, medium e high). O identificador na API é gemini-3.7-flash e o status é GA, com preço introdutório de US$ 0,75 por 1M de tokens de entrada e US$ 3,75 por 1M de saída
Fala aí, beleza? O Google acabou de soltar o Gemini 3.7 Flash, e olha o detalhe: TRÊS semanas depois do 3.6 Flash
O ritmo tá insano…
Esse é o modelo mais recente da série Gemini 3, e o Google posiciona ele como o "workhorse" da família: o cavalo de batalha, aquele que é eficiente e barato o suficiente pra rodar o dia inteiro
Aqui a gente vai só entender O QUE o modelo é: linhagem, ficha técnica, números divulgados e onde ele roda
Decisão de usar ou não vem depois, com a informação na mão =)
O que é o Gemini 3.7 Flash e de onde ele vem
O anúncio oficial no blog do Google veio com um título bem direto: "Gemini 3.7 Flash: our most intelligent workhorse model", ou seja, o modelo workhorse mais inteligente da empresa
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
O alvo declarado é programação e agentes
E tem um ponto no model card do 3.7 Flash que muda como você lê esse lançamento: ele é um REFINAMENTO do 3.6 Flash, com inovações algorítmicas na base de raciocínio
Não é um novo pré-treinamento do zero
E o que isso significa na prática?
Significa que a base é a mesma família, e o que mudou foi o trabalho em cima do raciocínio do modelo
É tipo pegar um carro que já roda bem e mexer no motor e na eletrônica, em vez de projetar um chassi novo
Isso também explica a janela de três semanas entre um e outro: quando não tem pré-treinamento do zero, o ciclo encurta
Se você acompanhou o lançamento do Gemini 3 Flash, é a mesma linhagem seguindo em frente
Ficha técnica: entradas, saída, contexto e corte de conhecimento
Bora pro que é verificável, sem enrolação
O identificador na API é gemini-3.7-flash, e ele já está em GA (generally available), ou seja, liberado pra produção, não é preview
- Entradas: texto, imagem, áudio e vídeo (nativamente multimodal)
- Saída: só texto, com limite de 64K tokens
- Janela de contexto: até 1 milhão de tokens de entrada
- Ferramentas nativas: o mesmo conjunto de built-in tools do 3.6 Flash
- Corte de conhecimento: março de 2026
Repara numa assimetria que confunde muita gente: a ENTRADA aceita imagem, áudio e vídeo, mas a SAÍDA é texto e só
Ele lê o vídeo, ele não gera vídeo, beleza?
Tome cuidado com o corte de conhecimento
O corte é março de 2026, MAS o Google coloca uma ressalva importante: em alguns domínios o conhecimento pode ficar limitado a janeiro de 2025, em linha com o resto da família Gemini 3
Ou seja, aquele "até março de 2026" não é uniforme em tudo
Se o seu caso depende de informação fresca em um nicho específico, vale considerar isso antes de confiar cegamente na resposta
Níveis de raciocínio: low, medium e high
Esse aqui é o botão que você mais vai mexer
O 3.7 Flash tem thinking levels configuráveis, e cada um equilibra qualidade, custo e latência de um jeito diferente
- low: reduz o tempo de resposta, pra tarefas sensíveis a latência
- medium: é o padrão, e é o recomendado pela maioria dos casos, incluindo código complexo e cenários agênticos
- high: maximiza raciocínio e uso de ferramentas, indicado pra raciocínio difícil, matemática e as tarefas mais duras de código e agente
O high tem preço: consome mais tokens e sai mais caro
Então a leitura é simples, o medium não é o "modo econômico", é o modo RECOMENDADO
Subir pra high é escolha consciente pra tarefa dura, não o default de todo dia
Gemini 3.7 Flash vs Gemini 3.6 Flash: o que mudou nos números
O Google divulgou comparativos diretos entre as duas versões
Se liga na tabela:
| Avaliação | 3.7 Flash | 3.6 Flash | O que mede |
|---|---|---|---|
| FrontierCode 1.1 Main | 43,6% | 34,4% | Código (benchmark da Cognition, empresa do Devin) |
| DeepSWE v1.1 | 65,3% | 49,0% | Engenharia de software de horizonte longo (operado pela Datacurve) |
| AutomationBench | 30,4% | 17,0% | Fluxos de trabalho de negócio do mundo real |
| GDP.pdf | 34,0% | 22,0% | Compreensão de documentos complexos |
| Code Arena | Elo 1588 | Elo 1538 | Desenvolvimento web |
| Preço por 1M de tokens | Metade do 3.6 Flash | Referência | Custo |
O salto do DeepSWE v1.1 é o que mais chama atenção: de 49,0% pra 65,3% em tarefas de engenharia de software de horizonte longo, que é justamente onde agente de código costuma se perder no meio do caminho
O AutomationBench quase dobrou também, de 17,0% pra 30,4%
E tudo isso pela METADE do preço por milhão de tokens do 3.6 Flash
vale lembrar que benchmark é benchmark: mede o que se propõe a medir, não substitui o seu caso real
Quanto custa o Gemini 3.7 Flash e onde usar
O preço de lançamento é introdutório, com data pra acabar
| Período | Entrada (1M tokens) | Saída (1M tokens) |
|---|---|---|
| Introdutório, até 31/12/2026 | US$ 0,75 | US$ 3,75 |
| A partir de 01/01/2027 | US$ 1,50 | US$ 7,50 |
Ou seja, depois de 31 de dezembro de 2026 o valor dobra
Anota aí na agenda se você tá montando previsão de custo pra um produto
Onde o modelo está disponível:
Pra quem desenvolve, o acesso é via Gemini API, e ele aparece no Google AI Studio, Google Antigravity, Gemini CLI, Android Studio, Vertex AI e Gemini Enterprise
Já do lado de quem não escreve código, a coisa fica dividida em duas superfícies diferentes, e é aqui que muita gente se embanana
O 3.7 Flash está sendo liberado no Spark, o serviço de agente por assinatura do Google, pra assinantes Google AI Pro e Ultra em mais de 160 países
E o Spark é o chatbot? Não
O Spark é uma superfície própria, separada da conversa padrão do Gemini, mesmo que as duas convivam no mesmo guarda-chuva do app
Por isso a ressalva que evita frustração: no lançamento, o modelo NÃO chegou ao chatbot do Gemini na web, no Android e no iOS
Então se você abriu a conversa comum do Gemini no navegador ou no celular e não achou o modelo na lista, não é problema seu: o caminho hoje é o Spark (pra assinante Pro ou Ultra) ou as ferramentas de desenvolvedor
Para que esse modelo foi feito
O foco declarado pelo Google é programação, tarefas agênticas e trabalho de conhecimento complexo, com ganhos em depuração, resolução de issues e desenvolvimento web
Traduzindo em cenários:
- Depuração e resolução de issues: é o território do DeepSWE v1.1 e do FrontierCode 1.1, as duas avaliações de código onde o salto foi maior
- Agentes: o próprio Google recomenda o nível medium pra casos agênticos, e o AutomationBench mede exatamente fluxo de trabalho de negócio do mundo real
- Desenvolvimento web: é o que o Code Arena avalia, onde o Elo subiu de 1538 pra 1588
- Leitura de documentos complexos: o GDP.pdf mede isso, e a entrada multimodal com 1M de tokens de contexto conversa direto com esse uso
- Trabalho de conhecimento complexo: entra aqui a combinação de contexto grande com entrada de texto, imagem, áudio e vídeo
Repara que cada cenário tem uma avaliação correspondente atrás dele
Não é promessa solta, é o que foi divulgado
Se você tá comparando alternativas rápidas e baratas de outras famílias, o DeepSeek V4 Flash segue a mesma lógica de modelo enxuto pra tarefa de volume
Vale a pena para você? Para quem esse modelo serve
Veredito curto e honesto, baseado só no que dá pra verificar:
Faz sentido pra quem escreve código ou monta agentes e precisa de custo baixo com contexto grande
1M de tokens de entrada por US$ 0,75 no preço introdutório, com salto medido em benchmark de código e de agente, é uma combinação difícil de ignorar
Ainda não serve pra quem só quer conversar no chatbot do Gemini: no lançamento o modelo não está lá, só no Spark (pra assinante Pro e Ultra) e nas ferramentas de desenvolvedor
Merece atenção de quem depende de informação muito recente: o corte é março de 2026, com a ressalva de domínios onde o conhecimento fica em janeiro de 2025
E tem o relógio do preço: até 31/12/2026 é introdutório, depois dobra
Conclusão: o próximo passo
Recapitulando o essencial: o Gemini 3.7 Flash é um refinamento do 3.6 Flash com inovações algorítmicas na base de raciocínio, está em GA, e responde pelo identificador gemini-3.7-flash na API
Entrada multimodal, 1M de tokens de contexto, saída de texto até 64K, três níveis de raciocínio e metade do preço por milhão de tokens do 3.6 Flash
O próximo passo depende do seu perfil
Se você programa, o caminho é o Google AI Studio ou o Gemini CLI
Se você é assinante Google AI Pro ou Ultra e quer usar sem código, é o Spark, lembrando que ele é uma superfície separada da conversa padrão do Gemini
E uma dica pra fechar: comece no nível medium
É o padrão e é o recomendado pelo próprio Google, inclusive pra código complexo
Só sobe pro high quando a tarefa realmente pedir, porque lá o custo em tokens é maior
massa demais ver esse ritmo de lançamento, né? 😀
até o próximo post!
Perguntas frequentes
Quanto custa usar o Gemini 3.7 Flash pela API?
O preço introdutório é de US$ 0,75 por 1 milhão de tokens de entrada e US$ 3,75 por 1 milhão de tokens de saída, valendo até 31 de dezembro de 2026. Depois dessa data, o valor sobe para US$ 1,50 (entrada) e US$ 7,50 (saída) por 1 milhão de tokens. Esse preço introdutório equivale à metade do custo por milhão de tokens do Gemini 3.6 Flash.
O Gemini 3.7 Flash já apareceu no chatbot do Gemini?
Não, no lançamento o modelo ainda não chegou ao chatbot do Gemini na web, no Android e no iOS. Ele está sendo liberado no Spark, o serviço de agente por assinatura do Google, para assinantes Google AI Pro e Ultra em mais de 160 países. O Spark é uma superfície separada da conversa padrão do Gemini, então quem quer usar fora dele precisa acessar via API ou pelas ferramentas de desenvolvimento.
Qual thinking level usar no 3.7 Flash para código complexo?
O nível medium é o padrão e o recomendado para a maioria dos casos, incluindo código complexo e cenários agênticos. O nível high maximiza raciocínio e uso de ferramentas, indicado para as tarefas mais duras de código e agente, mas consome mais tokens e sai mais caro. Já o low prioriza latência baixa, para quando a velocidade de resposta importa mais que a profundidade do raciocínio.
O modelo consegue gerar imagem ou vídeo como saída?
Não. Ele aceita texto, imagem, áudio e vídeo como entrada, mas a saída é só em texto, com limite de 64 mil tokens. Ou seja, ele lê e interpreta conteúdo multimodal, mas não gera vídeo nem imagem como resposta.
O Gemini 3.7 Flash é um modelo novo treinado do zero?
Não, segundo o model card do Google ele é um refinamento do Gemini 3.6 Flash, com inovações algorítmicas na base de raciocínio, e não um novo pré-treinamento. Isso explica o intervalo curto entre os dois lançamentos, de apenas três semanas.
Onde posso usar o 3.7 Flash como desenvolvedor?
O acesso é via Gemini API, disponível no Google AI Studio, Google Antigravity, Gemini CLI, Android Studio, Vertex AI e Gemini Enterprise. O identificador do modelo na API é gemini-3.7-flash, já em disponibilidade geral (GA) e pronto para uso em produção.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
