Thinking level no Gemini 3.7 Flash: como escolher entre qualidade, custo e latência?

O Gemini 3.7 Flash thinking level é o parâmetro que decide quanto o modelo pensa antes de responder, e ele vem em três níveis: LOW, MEDIUM (padrão) e HIGH. LOW reduz o time-to-answer em tarefas sensíveis a latência, MEDIUM entrega a melhor qualidade na maioria das tarefas e HIGH libera mais tokens de pensamento pra raciocínio profundo. Como os tokens de pensamento são cobrados como tokens de saída, subir o nível mexe direto na fatura e no relógio. A régua é simples: fique no padrão e só mude quando a tarefa mostrar o porquê
Qualidade parou de ser um dado do modelo e virou uma escolha de quem chama a API
O Google lançou o Gemini 3.7 Flash em 13 de agosto de 2026, três semanas depois do 3.6 Flash, e a mudança que mais mexe no seu dia a dia não é um número de benchmark: o modelo veio com configurações de pensamento customizáveis pra controlar a mistura de qualidade, custo e latência
Ou seja, o quanto ele pensa antes de responder agora é parâmetro
E parâmetro é decisão sua, beleza?
Bora entender o que essa chave decide de verdade…
O que o thinking_level controla (e por que ele substituiu o thinking_budget):
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Nos modelos Gemini 3 o parâmetro se chama thinking_level
Ele é um enum de string que fica dentro do generation_config, e entrou no lugar do antigo thinking_budget, que era numérico
A troca muda a cabeça de quem configura: antes tu tentava adivinhar uma quantidade de tokens, agora tu escolhe um PATAMAR
"generation_config": {
"thinking_level": "medium"
}
E o que essa chave decide na prática?
Quantos tokens de raciocínio interno o modelo gera antes de te entregar a resposta
Analogia de aproximação: pensa naquele colega que responde de bate pronto e naquele outro que pede cinco minutos pra rascunhar no papel antes de falar
Os dois acertam bastante, só que em tipos diferentes de pergunta =)
Então o caminho é escrever thinking_level no generation_config e seguir a vida
LOW, MEDIUM e HIGH: o que muda em cada nível
São três níveis suportados, e a documentação é bem econômica no que promete de cada um
Vou repetir só o que ela afirma, sem inventar percentual de ganho nem de latência:
| Nível | O que a documentação afirma | Onde ele é indicado |
|---|---|---|
| LOW | Reduz o time-to-answer | Tarefas latency-critical |
| MEDIUM (padrão) | Melhor qualidade para a maioria das tarefas | Default do modelo |
| HIGH | Mais tokens de pensamento | Prompts complexos que exigem raciocínio profundo |
Tome cuidado com um detalhe: o valor MINIMAL NÃO está disponível no Gemini 3.7 Flash
Se você definir MINIMAL explicitamente, a API devolve erro de validação
Ou seja, a régua de baixo do modelo é o LOW, não tem degrau abaixo dele
Qual nível de pensamento combina com cada tipo de tarefa
Agora traduzindo isso pra tarefa de verdade, que é onde a decisão acontece
LOW é o nível de quando o relógio manda: pipeline de resposta a incidentes, chat em tempo real, rascunho e análise rápida de dados
São os casos em que uma resposta boa agora vale mais que uma resposta ótima daqui a pouco
MEDIUM é o padrão, e padrão bom existe justamente pra você não ficar mexendo em botão sem motivo
É o nível que a doc aponta como melhor qualidade pra maioria das tarefas, então ele é o seu daily driver
HIGH é quando o raciocínio manda: planejamento multi-etapas, geração de código verificado e function calling avançado
Aquela tarefa que tem passo dependendo de passo, sabe? É ali que liberar mais tokens de pensamento faz sentido
A régua de decisão que eu usaria é essa: comece no padrão e só mude quando a tarefa mostrar por que
Mudar nível "por garantia" é o jeito mais fácil de pagar mais caro sem ganhar nada
Quanto o pensamento pesa na conta e no relógio
Aqui mora a parte que muita gente descobre tarde
Os tokens gerados durante o processo de pensamento SÃO cobrados
Eles aparecem no campo thoughts_token_count e contam como Token Output, ou seja, entram na conta como saída
Traduzindo: subir o nível de pensamento mexe direto na fatura, mesmo que a resposta final que o usuário vê continue do mesmo tamanho
Pra você ancorar o cálculo, o preço introdutório do Gemini 3.7 Flash na API é de US$ 0,75 por 1M de tokens de entrada e US$ 3,75 por 1M de tokens de saída
O cache de contexto no período introdutório sai por US$ 0,075 por 1M de tokens
E tem prazo: esse preço vale até 31 de dezembro de 2026
A partir de 1º de janeiro de 2027 ele dobra, indo pra US$ 1,50 na entrada e US$ 7,50 na saída por 1M de tokens
Esse valor introdutório é metade do preço inicial do 3.6 Flash por milhão de tokens, então quem for planejar orçamento de 2027 já sabe que a conta muda de patamar
Do lado do relógio, a lógica é a mesma vista pelo avesso: restringir o thinking_level reduz o tempo total de processamento, porque limita os tokens de raciocínio interno gerados antes da resposta
Menos pensamento gerado, menos tempo e menos token de saída
Mais pensamento gerado, mais tempo e mais token de saída
É o mesmo botão puxando as duas alavancas 🙂
Como decidir entre qualidade, custo e latência sem chutar
O jeito honesto de escolher é perguntar qual das três variáveis é a restrição DURA da sua aplicação
Se a restrição é o relógio (usuário esperando, incidente rolando), o nível sai de lá e não do seu gosto
Se a restrição é a conta no fim do mês, mesma coisa
Se a restrição é a qualidade do raciocínio, porque um plano errado custa retrabalho, aí HIGH deixa de ser luxo
Como referência de teto, dá pra olhar as medições públicas da Artificial Analysis, que publica o Gemini 3.7 Flash no nível HIGH: 56 no Intelligence Index (a mediana dos comparáveis é 34) e 340,1 tokens por segundo de velocidade de geração (mediana dos modelos de raciocínio em faixa de preço similar: 67,8 t/s)
Repare no detalhe que quase todo mundo pula: esses dois números são do nível HIGH
Os ganhos em código divulgados pelo Google sobre o 3.6 Flash vão na mesma direção: FrontierCode 1.1 Main com 43,6% contra 34,4%, e DeepSWE v1.1 com 65,3% contra 49,0%
A calibragem final, porém, é medição sua: no seu prompt, com a sua carga
Achar que dá pra escolher nível por achismo é o tipo de coisa que só aparece na fatura do mês seguinte…
Conclusão
A régua do Gemini 3.7 Flash cabe em uma linha: fique no MEDIUM, desça pra LOW quando o relógio mandar, suba pra HIGH quando o raciocínio mandar
O próximo passo prático é bem chato e bem eficiente: rode o MESMO prompt nos três níveis, olhando thoughts_token_count e o tempo de resposta em cada um
Com esses dois números na mão você para de decidir por opinião e passa a decidir por medição
Sobre onde rodar, o modelo está disponível na Gemini API via Google AI Studio, no Google Antigravity, no Android Studio, na Gemini Enterprise Agent Platform e no app Gemini Enterprise
Ele aceita entrada de texto, imagem, áudio e vídeo, responde em texto, e trabalha com 1M de tokens de contexto e 64k de saída máxima
E se você anda meio perdido com a quantidade de produto que leva o nome Gemini, vale entender antes a relação entre Gemini e NotebookLM, porque são coisas diferentes com o mesmo sobrenome
Testa os três níveis e me conta o que mudou no seu caso, beleza?
Até o próximo post! 😀
Perguntas frequentes
Como definir o thinking_level na API do Gemini 3.7 Flash?
Você passa o parâmetro dentro do generation_config, como uma string: "thinking_level": "medium", por exemplo. Ele substituiu o antigo thinking_budget, que era numérico, e agora aceita LOW, MEDIUM ou HIGH. MEDIUM é o padrão do modelo, então se você não definir nada é esse nível que roda.
O que acontece se eu usar thinking_level MINIMAL no Gemini 3.7 Flash?
Dá erro. O valor MINIMAL não está disponível no Gemini 3.7 Flash, e se você definir ele explicitamente a API retorna erro de validação. O degrau mais baixo suportado é o LOW mesmo.
Qual a diferença entre thinking_budget e thinking_level nos modelos Gemini 3?
O thinking_budget era um número de tokens que você tentava estimar na mão. O thinking_level entrou no lugar dele como um enum de string, com três patamares fixos (LOW, MEDIUM, HIGH) em vez de um número solto pra calibrar.
Onde aparece o custo dos tokens de pensamento na resposta da API do Gemini 3.7 Flash?
No campo thoughts_token_count, retornado junto com a resposta. Esses tokens contam como Token Output e são cobrados como saída, mesmo que o texto final que o usuário vê seja curto.
Em quais produtos o Gemini 3.7 Flash está disponível para desenvolvedores?
Ele está na Gemini API via Google AI Studio, no Google Antigravity, no Android Studio, na Gemini Enterprise Agent Platform e no app Gemini Enterprise. A entrada aceita texto, imagem, áudio e vídeo, e a saída é sempre em texto.
Até quando vale o preço introdutório do Gemini 3.7 Flash?
O preço introdutório (US$ 0,75 por 1M de tokens de entrada e US$ 3,75 por 1M de saída) vale até 31 de dezembro de 2026. A partir de 1º de janeiro de 2027 ele dobra, indo pra US$ 1,50 na entrada e US$ 7,50 na saída por 1M de tokens.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
