Contexto de 1M de tokens no Gemini 3.7 Flash: o que cabe na entrada e onde está o teto da resposta?

contexto de 1M de tokens do Gemini 3.7 Flash e o teto de 64 mil tokens na resposta
Resposta rápida

O contexto do Gemini 3.7 Flash vai até 1 milhão de tokens de entrada, com texto, imagem, áudio e vídeo na mesma janela, mas a resposta para em 64 mil tokens. É aí que quase todo plano de tarefa longa quebra: mandar muita coisa não autoriza esperar muita coisa de volta. Dá pra dimensionar antes com as taxas oficiais (1 token equivale a cerca de 4 caracteres, 258 tokens por imagem pequena, 263 tokens por segundo de vídeo, 32 tokens por segundo de áudio) e com o método countTokens. O preço introdutório é US$ 0,75 por 1M de entrada e US$ 3,75 por 1M de saída

Fala aí, beleza? O Gemini 3.7 Flash engole até 1 milhão de tokens na entrada, e devolve no máximo 64 mil na saída

Um lado da conta é gigante, o outro nem tanto, e é justamente esse segundo número que a galera esquece de olhar quando planeja tarefa longa…

O modelo foi anunciado pelo Google em 13 de agosto de 2026, três semanas depois do Gemini 3.6 Flash, e já chegou com a janela de 1M de tokens no discurso de venda

O que este post faz é te ajudar a dimensionar as DUAS pontas: o que realmente cabe na entrada (texto, imagem, áudio e vídeo) e o que dá pra esperar de volta, antes de você montar um pipeline que morre no meio 🙂

O que é o Gemini 3.7 Flash e onde ele já está disponível

Ele é o sucessor direto do 3.6 Flash, anunciado em 13 de agosto de 2026, três semanas depois do irmão mais velho

Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

O corte de conhecimento é março de 2026, e na API o identificador é gemini-3.7-flash

Onde ele roda hoje, segundo o anúncio do Google:

  • Google Antigravity
  • Google AI Studio
  • Android Studio
  • Gemini Enterprise Agent Platform
  • app Gemini Enterprise
  • no app Gemini, em rollout no Spark para assinantes Google AI Pro e Ultra

Sobre desempenho, vale separar quem está falando, beleza?

O Google reporta 43,6% no FrontierCode 1.1 Main contra 34,4% do Gemini 3.6 Flash, e 65,3% no DeepSWE v1.1 contra 49,0% da geração anterior

Já na página viva do Artificial Analysis, o 3.7 Flash na configuração high marca 56 no Artificial Analysis Intelligence Index e gera cerca de 340,1 tokens de saída por segundo na API do Google

Página viva significa que esse número pode mudar depois que você ler isso aqui, então trate como foto do momento, não como lei

O que cabe em 1 milhão de tokens: texto, imagem, áudio e vídeo

A parte massa da janela de 1M é que ela é multimodal: texto, imagem, áudio e vídeo entram no MESMO balde de 1 milhão de tokens

A saída, essa sim, é só texto

Aí vem a pergunta óbvia: quanto de material é 1 milhão de tokens? Se liga na régua oficial da documentação do Gemini:

Tipo de conteúdo Quanto vira em tokens A conta que você repete
Texto (caracteres) 1 token equivale a cerca de 4 caracteres 1M de tokens dá algo perto de 4 milhões de caracteres
Texto (palavras em inglês) 100 tokens equivalem a cerca de 60 a 80 palavras 64K de saída fica na casa de 38.400 a 51.200 palavras
Imagem até 384 pixels nas duas dimensões 258 tokens por imagem 1.000 imagens pequenas dão 258.000 tokens
Imagem maior fatiada em blocos de 768×768, cada bloco conta 258 tokens 4 blocos já são 1.032 tokens em UMA imagem
Vídeo 263 tokens por segundo 1 minuto = 60 x 263 = 15.780 tokens
Áudio 32 tokens por segundo 1 hora = 3.600 x 32 = 115.200 tokens

Repare que a régua de palavras é medida em inglês, então em português trate como aproximação, não como número redondo

E tem uma alavanca que muda essa conta antes mesmo de você mandar o arquivo: o parâmetro media_resolution, que controla quantos tokens são gastos por imagem, quadro de vídeo ou PDF enviado, com os níveis low, medium, high e ultra_high nos modelos Gemini 3

Ou seja: o mesmo lote de imagens pode custar bem diferente dependendo do nível que você escolher

Se você acompanha o assunto, essa corrida de janela grande não é exclusividade do Google: o Claude Fable 5 também trabalha com uma janela de 1 milhão de tokens, e a lógica de dimensionar a entrada é a mesma

O teto de 64K tokens de saída é o limite que quebra tarefa longa

Agora a parte que dói

Mandar 1 milhão de tokens de entrada NÃO te dá direito a 1 milhão de tokens de volta

A resposta do Gemini 3.7 Flash para em 64 mil tokens, ponto

É como contratar um caminhão pra levar o material e receber a entrega de volta numa moto: entra muita coisa, sai o que sai

E tem um detalhe a mais: esse orçamento de saída ainda divide espaço com o raciocínio do modelo

A resposta da Gemini API devolve a contagem de tokens separada por entrada, saída, pensamento (thoughts_token_count), conteúdo em cache, uso de ferramentas e total

Quer dizer: o pensamento é medido e cobrado à parte na leitura de uso, e você consegue enxergar exatamente pra onde foi cada pedaço

Como mexer no quanto ele pensa:

O parâmetro é o thinking_level, e ele aceita três valores:

  • LOW
  • MEDIUM (o padrão)
  • HIGH

Tome cuidado com um detalhe: o valor MINIMAL NÃO é suportado e retorna erro de validação da API

Se apareceu erro de validação no seu request, começa checando isso antes de sair caçando bug em outro lugar 😀

A consequência prática de tudo isso é uma só: fatie a entrega

Em vez de pedir "me escreva a documentação inteira do projeto" numa resposta só, peça por módulo, por capítulo, por arquivo

É o mesmo raciocínio de quem já aprendeu a gerenciar contexto no Claude Code: janela grande não substitui plano, ela só adia o momento em que o plano faz falta

Como dimensionar a tarefa antes de gastar o contexto

Bora ver isso em casos concretos, com os números que já estão na mesa

Base de código ou documentação longa

A entrada aguenta bastante coisa: na régua de 4 caracteres por token, 1M de tokens fica perto de 4 milhões de caracteres de texto

O problema nunca é colocar o repositório inteiro dentro, é pedir a refatoração inteira de volta

Mande a base completa como contexto, peça a entrega arquivo por arquivo

Transcrição de reunião ou aula

Áudio custa 32 tokens por segundo, então 1 hora dá 115.200 tokens

Na conta seca, 1.000.000 dividido por 115.200 mostra que cabe MUITA hora de áudio na janela

Só que a transcrição volta como texto, e texto de resposta bate no teto de 64K

Então o padrão é: áudio longo na entrada, transcrição pedida em blocos por trecho

Análise de vídeo

Vídeo custa 263 tokens por segundo, ou 15.780 tokens por minuto

Dividindo 1.000.000 por 263 você chega perto de 3.800 segundos de vídeo na janela cheia

Dá pra sentir o tamanho do balde antes de subir o arquivo, e é isso que interessa

Lote de imagens

Imagem pequena conta 258 tokens, e imagem grande é fatiada em blocos de 768×768 com 258 tokens cada bloco

Aqui o media_resolution é o seu botão de custo: se a tarefa é ler texto de print, um nível mais baixo pode bastar, se é detalhe fino, você sobe

E como eu conto isso sem chutar?

A Gemini API tem o método countTokens, que conta os tokens de um conteúdo ANTES de você mandar a requisição

No SDK JavaScript ele aparece como ai.models.countTokens

É o passo que separa quem dimensiona de quem descobre o problema na fatura, então mede primeiro e manda depois =)

Quanto custa encher a janela do Gemini 3.7 Flash

Na Gemini Developer API o preço está assim:

Período Entrada (por 1M de tokens) Saída (por 1M de tokens)
Introdutório, até 31 de dezembro de 2026 US$ 0,75 US$ 3,75
A partir de 1º de janeiro de 2027 US$ 1,50 US$ 7,50

Repara na proporção: a saída custa CINCO vezes o preço da entrada por token, nas duas faixas

Ou seja, aquele instinto de pedir resposta gigante é justamente o lado caro da conta

Encher a janela de entrada uma vez, no preço introdutório, sai por US$ 0,75

Já a resposta pesa cinco vezes mais por token, então bater no teto de 64K é sempre o lado que sobe a fatura, mesmo sendo o volume menor

E existem dois redutores oficiais que valem conhecer:

  • Cache implícito de contexto: fica ligado por padrão nos modelos Gemini 2.5 e mais novos, sem configuração nenhuma, e o desconto é aplicado automaticamente quando a requisição bate no cache
  • Batch API: o uso por ela é cobrado a 50% do custo da API interativa equivalente

Se a sua tarefa não precisa de resposta na hora, metade do preço é metade do preço, né?

Conclusão

A regra de bolso do Gemini 3.7 Flash é essa: planeje pela SAÍDA, não pela janela

1 milhão de tokens de entrada é um baita balde, mas quem manda no seu desenho de tarefa é o teto de 64 mil tokens de resposta

O próximo passo é bem objetivo:

  1. conte os tokens do seu material com countTokens antes de mandar (o erro comum aqui é estimar no olho e descobrir o tamanho real só na resposta de uso)
  2. escolha o thinking_level conforme a tarefa, lembrando que MINIMAL não existe e derruba a requisição com erro de validação
  3. ajuste o media_resolution quando tiver imagem, vídeo ou PDF no meio
  4. quebre a entrega em respostas que caibam nos 64K, em vez de pedir tudo numa tacada só

E se você for estimar custo de projeto longo, anota o prazo: o preço introdutório vale até 31 de dezembro de 2026, depois disso a conta dobra

Janela grande é ótima, mas quem entrega é o plano 😀

até o próximo post!

Perguntas frequentes

Quantos caracteres de texto cabem no contexto de 1 milhão de tokens do Gemini 3.7 Flash?

Na régua da própria documentação do Gemini, 1 token equivale a cerca de 4 caracteres. Isso coloca o teto de 1 milhão de tokens de entrada perto de 4 milhões de caracteres de texto, somando tudo que entra na mesma janela: texto, imagem, áudio e vídeo.

Por que a resposta do Gemini 3.7 Flash é bem menor que a entrada de 1M de tokens?

Porque entrada e saída seguem limites diferentes: a entrada aceita até 1 milhão de tokens, mas a saída para em 64 mil tokens por resposta. Além disso, esse orçamento de 64K ainda divide espaço com o raciocínio do modelo, medido à parte no campo thoughts_token_count.

O Gemini 3.7 Flash consegue processar áudio e vídeo, ou só texto e imagem?

Consegue os quatro: a entrada do Gemini 3.7 Flash é multimodal, aceitando texto, imagem, áudio e vídeo na mesma janela de 1M de tokens. A saída, porém, é só texto. Vídeo custa 263 tokens por segundo e áudio custa 32 tokens por segundo nessa conta.

Quanto custa usar o Gemini 3.7 Flash pela API do Google?

O preço introdutório na Gemini Developer API é de US$ 0,75 por 1 milhão de tokens de entrada e US$ 3,75 por 1 milhão de tokens de saída. Esse valor vale até 31 de dezembro de 2026, quando sobe para US$ 1,50 e US$ 7,50 por 1M, respectivamente. Quem usa a Batch API paga metade do preço padrão.

Como saber quantos tokens um arquivo vai gastar antes de mandar pro Gemini 3.7 Flash?

A Gemini API tem o método countTokens (por exemplo, ai.models.countTokens no SDK JavaScript), que conta os tokens de um conteúdo antes de você disparar a requisição. É a forma de checar o gasto real de imagem, áudio, vídeo ou texto antes de estourar a janela.

O que muda entre thinking_level e media_resolution no Gemini 3.7 Flash?

São parâmetros diferentes: thinking_level (LOW, MEDIUM padrão ou HIGH) controla quanto o modelo raciocina antes de responder, e MINIMAL não é aceito. Já media_resolution (low, medium, high, ultra_high) controla quantos tokens cada imagem, quadro de vídeo ou PDF consome na entrada.



Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares