Gemini 3.7 Flash: o que é, o que muda em relação ao 3.6 Flash e para quem serve

ilustração representando o Gemini 3.7 Flash, modelo da família Gemini 3
Resposta rápida

O Gemini 3.7 Flash é a iteração mais recente da série Gemini 3, lançada pelo Google três semanas depois do 3.6 Flash e apresentada como o modelo workhorse (eficiente e econômico) da família, com foco em programação e agentes. Ele aceita texto, imagem, áudio e vídeo, tem 1 milhão de tokens de contexto, devolve texto em até 64K tokens e traz níveis de raciocínio configuráveis (low, medium e high). O identificador na API é gemini-3.7-flash e o status é GA, com preço introdutório de US$ 0,75 por 1M de tokens de entrada e US$ 3,75 por 1M de saída

Fala aí, beleza? O Google acabou de soltar o Gemini 3.7 Flash, e olha o detalhe: TRÊS semanas depois do 3.6 Flash

O ritmo tá insano…

Esse é o modelo mais recente da série Gemini 3, e o Google posiciona ele como o "workhorse" da família: o cavalo de batalha, aquele que é eficiente e barato o suficiente pra rodar o dia inteiro

Aqui a gente vai só entender O QUE o modelo é: linhagem, ficha técnica, números divulgados e onde ele roda

Decisão de usar ou não vem depois, com a informação na mão =)

O que é o Gemini 3.7 Flash e de onde ele vem

O anúncio oficial no blog do Google veio com um título bem direto: "Gemini 3.7 Flash: our most intelligent workhorse model", ou seja, o modelo workhorse mais inteligente da empresa

Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

O alvo declarado é programação e agentes

E tem um ponto no model card do 3.7 Flash que muda como você lê esse lançamento: ele é um REFINAMENTO do 3.6 Flash, com inovações algorítmicas na base de raciocínio

Não é um novo pré-treinamento do zero

E o que isso significa na prática?

Significa que a base é a mesma família, e o que mudou foi o trabalho em cima do raciocínio do modelo

É tipo pegar um carro que já roda bem e mexer no motor e na eletrônica, em vez de projetar um chassi novo

Isso também explica a janela de três semanas entre um e outro: quando não tem pré-treinamento do zero, o ciclo encurta

Se você acompanhou o lançamento do Gemini 3 Flash, é a mesma linhagem seguindo em frente

Ficha técnica: entradas, saída, contexto e corte de conhecimento

Bora pro que é verificável, sem enrolação

O identificador na API é gemini-3.7-flash, e ele já está em GA (generally available), ou seja, liberado pra produção, não é preview

  • Entradas: texto, imagem, áudio e vídeo (nativamente multimodal)
  • Saída: só texto, com limite de 64K tokens
  • Janela de contexto: até 1 milhão de tokens de entrada
  • Ferramentas nativas: o mesmo conjunto de built-in tools do 3.6 Flash
  • Corte de conhecimento: março de 2026

Repara numa assimetria que confunde muita gente: a ENTRADA aceita imagem, áudio e vídeo, mas a SAÍDA é texto e só

Ele lê o vídeo, ele não gera vídeo, beleza?

Tome cuidado com o corte de conhecimento

O corte é março de 2026, MAS o Google coloca uma ressalva importante: em alguns domínios o conhecimento pode ficar limitado a janeiro de 2025, em linha com o resto da família Gemini 3

Ou seja, aquele "até março de 2026" não é uniforme em tudo

Se o seu caso depende de informação fresca em um nicho específico, vale considerar isso antes de confiar cegamente na resposta

Níveis de raciocínio: low, medium e high

Esse aqui é o botão que você mais vai mexer

O 3.7 Flash tem thinking levels configuráveis, e cada um equilibra qualidade, custo e latência de um jeito diferente

  • low: reduz o tempo de resposta, pra tarefas sensíveis a latência
  • medium: é o padrão, e é o recomendado pela maioria dos casos, incluindo código complexo e cenários agênticos
  • high: maximiza raciocínio e uso de ferramentas, indicado pra raciocínio difícil, matemática e as tarefas mais duras de código e agente

O high tem preço: consome mais tokens e sai mais caro

Então a leitura é simples, o medium não é o "modo econômico", é o modo RECOMENDADO

Subir pra high é escolha consciente pra tarefa dura, não o default de todo dia

Gemini 3.7 Flash vs Gemini 3.6 Flash: o que mudou nos números

O Google divulgou comparativos diretos entre as duas versões

Se liga na tabela:

Avaliação 3.7 Flash 3.6 Flash O que mede
FrontierCode 1.1 Main 43,6% 34,4% Código (benchmark da Cognition, empresa do Devin)
DeepSWE v1.1 65,3% 49,0% Engenharia de software de horizonte longo (operado pela Datacurve)
AutomationBench 30,4% 17,0% Fluxos de trabalho de negócio do mundo real
GDP.pdf 34,0% 22,0% Compreensão de documentos complexos
Code Arena Elo 1588 Elo 1538 Desenvolvimento web
Preço por 1M de tokens Metade do 3.6 Flash Referência Custo

O salto do DeepSWE v1.1 é o que mais chama atenção: de 49,0% pra 65,3% em tarefas de engenharia de software de horizonte longo, que é justamente onde agente de código costuma se perder no meio do caminho

O AutomationBench quase dobrou também, de 17,0% pra 30,4%

E tudo isso pela METADE do preço por milhão de tokens do 3.6 Flash

vale lembrar que benchmark é benchmark: mede o que se propõe a medir, não substitui o seu caso real

Quanto custa o Gemini 3.7 Flash e onde usar

O preço de lançamento é introdutório, com data pra acabar

Período Entrada (1M tokens) Saída (1M tokens)
Introdutório, até 31/12/2026 US$ 0,75 US$ 3,75
A partir de 01/01/2027 US$ 1,50 US$ 7,50

Ou seja, depois de 31 de dezembro de 2026 o valor dobra

Anota aí na agenda se você tá montando previsão de custo pra um produto

Onde o modelo está disponível:

Pra quem desenvolve, o acesso é via Gemini API, e ele aparece no Google AI Studio, Google Antigravity, Gemini CLI, Android Studio, Vertex AI e Gemini Enterprise

Já do lado de quem não escreve código, a coisa fica dividida em duas superfícies diferentes, e é aqui que muita gente se embanana

O 3.7 Flash está sendo liberado no Spark, o serviço de agente por assinatura do Google, pra assinantes Google AI Pro e Ultra em mais de 160 países

E o Spark é o chatbot? Não

O Spark é uma superfície própria, separada da conversa padrão do Gemini, mesmo que as duas convivam no mesmo guarda-chuva do app

Por isso a ressalva que evita frustração: no lançamento, o modelo NÃO chegou ao chatbot do Gemini na web, no Android e no iOS

Então se você abriu a conversa comum do Gemini no navegador ou no celular e não achou o modelo na lista, não é problema seu: o caminho hoje é o Spark (pra assinante Pro ou Ultra) ou as ferramentas de desenvolvedor

Para que esse modelo foi feito

O foco declarado pelo Google é programação, tarefas agênticas e trabalho de conhecimento complexo, com ganhos em depuração, resolução de issues e desenvolvimento web

Traduzindo em cenários:

  • Depuração e resolução de issues: é o território do DeepSWE v1.1 e do FrontierCode 1.1, as duas avaliações de código onde o salto foi maior
  • Agentes: o próprio Google recomenda o nível medium pra casos agênticos, e o AutomationBench mede exatamente fluxo de trabalho de negócio do mundo real
  • Desenvolvimento web: é o que o Code Arena avalia, onde o Elo subiu de 1538 pra 1588
  • Leitura de documentos complexos: o GDP.pdf mede isso, e a entrada multimodal com 1M de tokens de contexto conversa direto com esse uso
  • Trabalho de conhecimento complexo: entra aqui a combinação de contexto grande com entrada de texto, imagem, áudio e vídeo

Repara que cada cenário tem uma avaliação correspondente atrás dele

Não é promessa solta, é o que foi divulgado

Se você tá comparando alternativas rápidas e baratas de outras famílias, o DeepSeek V4 Flash segue a mesma lógica de modelo enxuto pra tarefa de volume

Vale a pena para você? Para quem esse modelo serve

Veredito curto e honesto, baseado só no que dá pra verificar:

Faz sentido pra quem escreve código ou monta agentes e precisa de custo baixo com contexto grande

1M de tokens de entrada por US$ 0,75 no preço introdutório, com salto medido em benchmark de código e de agente, é uma combinação difícil de ignorar

Ainda não serve pra quem só quer conversar no chatbot do Gemini: no lançamento o modelo não está lá, só no Spark (pra assinante Pro e Ultra) e nas ferramentas de desenvolvedor

Merece atenção de quem depende de informação muito recente: o corte é março de 2026, com a ressalva de domínios onde o conhecimento fica em janeiro de 2025

E tem o relógio do preço: até 31/12/2026 é introdutório, depois dobra

Conclusão: o próximo passo

Recapitulando o essencial: o Gemini 3.7 Flash é um refinamento do 3.6 Flash com inovações algorítmicas na base de raciocínio, está em GA, e responde pelo identificador gemini-3.7-flash na API

Entrada multimodal, 1M de tokens de contexto, saída de texto até 64K, três níveis de raciocínio e metade do preço por milhão de tokens do 3.6 Flash

O próximo passo depende do seu perfil

Se você programa, o caminho é o Google AI Studio ou o Gemini CLI

Se você é assinante Google AI Pro ou Ultra e quer usar sem código, é o Spark, lembrando que ele é uma superfície separada da conversa padrão do Gemini

E uma dica pra fechar: comece no nível medium

É o padrão e é o recomendado pelo próprio Google, inclusive pra código complexo

Só sobe pro high quando a tarefa realmente pedir, porque lá o custo em tokens é maior

massa demais ver esse ritmo de lançamento, né? 😀

até o próximo post!

Perguntas frequentes

Quanto custa usar o Gemini 3.7 Flash pela API?

O preço introdutório é de US$ 0,75 por 1 milhão de tokens de entrada e US$ 3,75 por 1 milhão de tokens de saída, valendo até 31 de dezembro de 2026. Depois dessa data, o valor sobe para US$ 1,50 (entrada) e US$ 7,50 (saída) por 1 milhão de tokens. Esse preço introdutório equivale à metade do custo por milhão de tokens do Gemini 3.6 Flash.

O Gemini 3.7 Flash já apareceu no chatbot do Gemini?

Não, no lançamento o modelo ainda não chegou ao chatbot do Gemini na web, no Android e no iOS. Ele está sendo liberado no Spark, o serviço de agente por assinatura do Google, para assinantes Google AI Pro e Ultra em mais de 160 países. O Spark é uma superfície separada da conversa padrão do Gemini, então quem quer usar fora dele precisa acessar via API ou pelas ferramentas de desenvolvimento.

Qual thinking level usar no 3.7 Flash para código complexo?

O nível medium é o padrão e o recomendado para a maioria dos casos, incluindo código complexo e cenários agênticos. O nível high maximiza raciocínio e uso de ferramentas, indicado para as tarefas mais duras de código e agente, mas consome mais tokens e sai mais caro. Já o low prioriza latência baixa, para quando a velocidade de resposta importa mais que a profundidade do raciocínio.

O modelo consegue gerar imagem ou vídeo como saída?

Não. Ele aceita texto, imagem, áudio e vídeo como entrada, mas a saída é só em texto, com limite de 64 mil tokens. Ou seja, ele lê e interpreta conteúdo multimodal, mas não gera vídeo nem imagem como resposta.

O Gemini 3.7 Flash é um modelo novo treinado do zero?

Não, segundo o model card do Google ele é um refinamento do Gemini 3.6 Flash, com inovações algorítmicas na base de raciocínio, e não um novo pré-treinamento. Isso explica o intervalo curto entre os dois lançamentos, de apenas três semanas.

Onde posso usar o 3.7 Flash como desenvolvedor?

O acesso é via Gemini API, disponível no Google AI Studio, Google Antigravity, Gemini CLI, Android Studio, Vertex AI e Gemini Enterprise. O identificador do modelo na API é gemini-3.7-flash, já em disponibilidade geral (GA) e pronto para uso em produção.



Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares