Gemini 3.7 Flash em fluxos agentivos: por que latência e pensamento ajustável mudam o resultado?

fluxos agentivos com Gemini 3.7 Flash e pensamento ajustável
Resposta rápida

O Gemini 3.7 Flash chegou em 13 de agosto de 2026, três semanas depois do 3.6 Flash e já em disponibilidade geral (GA), com o model ID gemini-3.7-flash na Gemini API. O ponto do post é o uso agentivo: o Google descreve o modelo como refinamento algorítmico sobre a base do 3.6, com 30,4% no AutomationBench contra 17,0% da versão anterior, e expõe o parâmetro thinking_level (LOW, MEDIUM padrão e HIGH). Como tokens de pensamento são cobrados como tokens de saída, em cadeia longa a escolha do nível mexe direto na latência e na conta

Fala aí, beleza? O Google soltou em 13 de agosto de 2026 o Gemini 3.7 Flash, e o recorte que interessa aqui não é a manchete: é o que muda quando esse modelo roda dentro de um agente, disparando chamada atrás de chamada

O lançamento veio três semanas depois do 3.6 Flash, e o modelo novo já chega em disponibilidade geral (GA), ou seja, liberado pra produção e não em preview

E ele veio com duas coisas que pesam muito em fluxo agentivo: pensamento ajustável por parâmetro e um preço promocional de entrada

O que o Google lançou no Gemini 3.7 Flash

O model card descreve o 3.7 Flash como melhoria algorítmica sobre a base de raciocínio da versão 3.6 Flash, e não como um novo pré-treino

Ou seja: é refinamento, não modelo do zero

Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Os ganhos citados ficam concentrados em três frentes: engenharia de software, trabalho com documentos e desenvolvimento web

O modelo é nativamente multimodal e aceita texto, imagens, áudio e vídeo de entrada

A janela é de 1 milhão de tokens de contexto, com até 64 mil tokens de saída

A suíte de ferramentas embutidas é a MESMA do 3.6 Flash, então quem já tinha algo montado não precisa reaprender o ferramental

E o posicionamento oficial é bem direto: o Google apresenta o 3.7 Flash como o modelo mais inteligente dele pra código e agentes, otimizado pra orquestração multi-etapa, refatoração de código e raciocínio geral, com mais esforço em planejamento multi-etapa e chamadas de ferramenta

Onde ele já está disponível:

  • Gemini API, via Google AI Studio e Android Studio
  • Google Antigravity
  • Gemini Enterprise Agent Platform e app Gemini Enterprise
  • app Gemini, em rollout no Spark, exigindo assinatura AI Pro ou Ultra

O identificador na API é gemini-3.7-flash

Gemini 3.7 Flash x Gemini 3.6 Flash: o que mudou na prática

Item 3.7 Flash 3.6 Flash
AutomationBench 30,4% 17,0%
Preço no lançamento (Gemini API) US$ 0,75 por 1M de entrada e US$ 3,75 por 1M de saída, promocional até 31/12/2026 preço de lançamento usado como referência do corte de 50%
Controle de pensamento thinking_level, enum de string no generation_config thinking_budget, o parâmetro legado que foi substituído
Origem do modelo refinamento algorítmico sobre a base de raciocínio do 3.6 base de raciocínio de referência
Ferramentas embutidas mesma suíte mesma suíte

Leitura rápida: de todos esses números, o AutomationBench é o que mais fala com quem monta agente, porque ele mede fluxos de trabalho reais de negócio, e não uma pergunta isolada

Sair de 17,0% pra 30,4% em tarefa de fluxo é um salto que aparece justamente no cenário onde o modelo precisa encadear passos sem se perder no meio

Por que um agente faz dezenas de chamadas em cadeia

Aqui vale explicar o PORQUÊ antes do como

Um agente não responde de uma vez só: ele planeja, chama uma ferramenta, lê o retorno, decide o próximo passo, chama de novo, e por aí vai

Cada um desses passos é uma chamada nova ao modelo

Então latência e custo por chamada não ficam sozinhos: eles se MULTIPLICAM pelo número de etapas

E tem o efeito colateral clássico: um erro no meio da cadeia não morre ali, ele contamina todos os passos seguintes, porque o agente continua raciocinando em cima de uma conclusão errada

Se você já montou fluxos n8n com GPT-4o e Gemini, já viu esse filme: o nó 3 quebra e os nós 4 a 10 entregam bobagem com toda a confiança do mundo 😅

E como o modelo mantém o fio da meada?

É aí que entram as thought signatures

Elas preservam o estado de raciocínio em conversas multi-turno e multi-etapa

No generateContent elas vêm como metadado anexado a partes, inclusive dentro de partes functionCall

Traduzindo: o raciocínio não se perde toda vez que o agente para pra chamar uma ferramenta e volta

Sobre velocidade, a página viva do Artificial Analysis mede a variante 3.7 Flash (high) na API do Google assim: índice de inteligência 56 contra mediana 34 da faixa de preço, velocidade de saída de 340,1 tokens por segundo contra mediana 67,8, e tempo até o primeiro token de 9,83s contra mediana 2,86s

Tome cuidado com essa leitura: são medições de terceiro, em página que muda, e cobrem a variante high

Repara no contraste: a saída é bem mais rápida que a mediana, mas o primeiro token demora mais que a mediana

Em cadeia longa, esse tempo até o primeiro token é justamente o que se paga várias vezes

thinking_level: como LOW, MEDIUM e HIGH mudam o resultado do agente

O thinking_level é um enum de string que fica no generation_config, no lugar do legado thinking_budget

Ele aceita três valores: LOW, MEDIUM (padrão) e HIGH

{
  "model": "gemini-3.7-flash",
  "generation_config": {
    "thinking_level": "MEDIUM"
  }
}

O erro comum aqui: MINIMAL NÃO é suportado no 3.7 Flash e retorna erro de validação da API

Se você veio de outro setup e tentou copiar esse valor, a chamada quebra na validação, não no meio da geração

O que o Google diz de cada nível:

  • LOW: reduz o tempo até a resposta em tarefas sensíveis a latência
  • MEDIUM: é o padrão e o recomendado pra código complexo e casos agentivos
  • HIGH: maximiza raciocínio e uso de ferramentas nas tarefas mais difíceis, com maior consumo de tokens e custo

E o custo disso?

Essa é a parte que muita gente descobre tarde

Os tokens de pensamento são cobrados como tokens de SAÍDA na Gemini API

Ou seja, o preço da resposta com pensamento ativo é a soma dos tokens de saída com os tokens de pensamento

A boa notícia é que dá pra medir antes de escalar: a API devolve thoughts_token_count por chamada, e o acumulado aparece em total_thought_tokens

Então o teste honesto é rodar o mesmo fluxo em LOW, MEDIUM e HIGH e comparar esse campo, em vez de escolher o nível no feeling

Quando usar cada nível de pensamento no seu fluxo

Traduzindo os níveis pros cenários que o próprio Google cita:

LOW pra pipelines de resposta a incidente, chat em tempo real, rascunhos e análise rápida de dados

É o cenário onde o usuário (ou o alerta) está esperando, e cada segundo a mais dói

MEDIUM pra código complexo e orquestração agentiva

Como é o padrão e o recomendado justamente pro caso agentivo, ele é o ponto de partida natural: comece aqui e só mexa com dado na mão

HIGH pras tarefas mais difíceis, com planejamento multi-etapa pesado e muita chamada de ferramenta

Só lembre do combo: HIGH maximiza raciocínio e uso de ferramentas, mas com maior consumo de tokens e custo

E agora junta as duas pontas do post: nível mais alto dentro de uma cadeia de dezenas de passos multiplica tokens de pensamento em CADA passo

Por isso a conta não é "quanto custa uma chamada", é "quanto custa a cadeia inteira"

Mede com thoughts_token_count num fluxo real seu antes de fixar o nível, beleza? 🙂

O que já vimos na prática usando o Gemini no dia a dia

O material de primeira mão que eu tenho é de outro recorte, o Gemini Flash Image, o tal do Nano Banana, que eu mostrei em vídeo

Lá eu acessei o Google AI Studio pelo navegador, abri o modelo de imagem (dá pra chegar nele pelo atalho visível ou pela lista de modelos), pedi uma pessoa olhando o próprio reflexo em uma bolha de água, com pedido explícito de imagem realista, e a imagem saiu

O ponto aproveitável pra este post é outro: depois de gerar VÁRIAS imagens seguidas na mesma conversa, o consumo do limite de tokens mostrado na tela ficou em cerca de 10%

Ou seja, eu só descobri que o limite era generoso porque o número estava ali, visível, enquanto eu usava

É exatamente esse hábito que vira obrigatório em fluxo agentivo: acompanhar consumo de token deixa de ser detalhe de curioso quando o fluxo é longo e repetitivo, e é pra isso que o thoughts_token_count existe

Veja no vídeo

Pra começar do zero no ecossistema Gemini, este vídeo do canal mostra o modelo de imagem do Google dentro do AI Studio: como chegar na tela, onde escolher o modelo, o primeiro prompt rodando e como o limite de uso aparece enquanto você gera

Conclusão

Recapitulando sem hype: o Gemini 3.7 Flash é refinamento algorítmico sobre a base do 3.6 Flash, não um modelo novo em folha, e já chega em disponibilidade geral (GA)

O número que sustenta a conversa agentiva é o AutomationBench, 30,4% contra 17,0% da versão anterior, porque ele mede fluxo de trabalho real, que é o que o agente faz o dia inteiro

Mas quem decide mesmo é o SEU fluxo, com as suas ferramentas e o seu número de etapas

Próximo passo concreto: testa o model ID gemini-3.7-flash na Gemini API ainda dentro da janela promocional, que vale até 31/12/2026 com US$ 0,75 por 1M de entrada e US$ 3,75 por 1M de saída

A partir de 1º de janeiro de 2027 passa a valer US$ 1,50 por 1M de entrada e US$ 7,50 por 1M de saída, então dá pra usar essa janela como laboratório

Começa no MEDIUM, roda a mesma cadeia em LOW e HIGH e compara o thoughts_token_count dos três

Aí sim você escolhe o nível com dado, não com achismo 😀

até o próximo post!

Perguntas frequentes

O que é o thinking_level no Gemini 3.7 Flash e quais valores ele aceita?

É um parâmetro em enum de string, definido no generation_config, que substitui o antigo thinking_budget. Ele aceita três valores: LOW, MEDIUM (padrão) e HIGH, cada um ajustando o quanto o modelo raciocina antes de responder.

Por que o valor MINIMAL dá erro no thinking_level do 3.7 Flash?

Porque esse valor simplesmente não é suportado nessa versão do modelo, e a API retorna erro de validação assim que recebe a chamada. Quem migrou um setup de outro modelo esperando MINIMAL precisa trocar para LOW, que é o nível mais rápido disponível aqui.

Como são cobrados os tokens de pensamento na Gemini API?

Os tokens de pensamento entram na conta como tokens de saída, então o preço final da resposta é a soma dos tokens de saída com os tokens de pensamento. A API devolve esse gasto no campo thoughts_token_count por chamada, com o acumulado em total_thought_tokens.

Qual é o preço do Gemini 3.7 Flash na Gemini API?

No lançamento, o preço promocional é de US$ 0,75 por 1M de tokens de entrada e US$ 3,75 por 1M de tokens de saída, válido até 31 de dezembro de 2026. A partir de 1º de janeiro de 2027 passa a valer US$ 1,50 por 1M de entrada e US$ 7,50 por 1M de saída.

Qual thinking_level usar em fluxo agentivo?

O próprio Google recomenda MEDIUM, que já é o padrão, para código complexo e casos agentivos. HIGH fica reservado pras tarefas mais difíceis, quando vale pagar mais tokens por mais raciocínio e uso de ferramentas, enquanto LOW serve pra reduzir latência em cenários como chat em tempo real.

Onde o Gemini 3.7 Flash já está disponível?

Ele roda na Gemini API (via Google AI Studio e Android Studio), no Google Antigravity, na Gemini Enterprise Agent Platform e no app Gemini Enterprise. No app Gemini, está em rollout no Spark, exigindo assinatura AI Pro ou Ultra.




Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares