Gemini Pro ou Gemini Flash: qual modelo usar em cada tipo de tarefa?

Gemini Pro ou Flash? A resposta curta: hoje o Flash é o padrão razoável e o Pro é escolha por perfil de tarefa, não por ser o modelo melhor. O gemini-3.6-flash custa US$ 1,50 por 1M de entrada e US$ 7,50 de saída, roda a 235,4 tokens/s e marca 52 no Artificial Analysis Intelligence Index, contra 48 e 141,1 tokens/s do gemini-3.1-pro-preview, que sai por US$ 2,00 e US$ 12,00 por 1M. Pra volume alto tem o Flash-Lite a US$ 0,25 por 1M de entrada e 350 tokens/s
Fala aí, beleza? A galera pesquisa "Gemini", acha que é um modelo só, abre a documentação oficial e dá de cara com Pro, Flash e Flash-Lite na mesma geração 😀
Ou seja: a decisão nunca foi entre dois botões
São três perfis diferentes de profundidade de raciocínio, velocidade de resposta e custo por chamada, e cada um deles ganha em um tipo de tarefa
E tem uma pegadinha boa nisso: o senso comum de que "Pro é o bom e Flash é o baratinho" não bate com os números públicos de hoje
Bora ver na prática?
Gemini Pro, Flash e Flash-Lite: comparativo lado a lado
A documentação oficial da Gemini API lista as três como modelos distintos dentro da mesma geração
Pro é posicionado pra raciocínio sustentado em tarefas agênticas e de código, Flash como equilíbrio entre qualidade e custo, e Flash-Lite como o mais rápido e barato, pensado pra alto volume
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Se liga na tabela:
| Variante | ID na API | Entrada (1M tokens) | Saída (1M tokens) | Velocidade de saída | Artificial Analysis Index | Camada gratuita na API | Posicionamento oficial |
|---|---|---|---|---|---|---|---|
| Pro | gemini-3.1-pro-preview |
US$ 2,00 | US$ 12,00 | 141,1 tokens/s | 48 | não tem | raciocínio sustentado (agêntico e código) |
| Flash | gemini-3.6-flash |
US$ 1,50 | US$ 7,50 | 235,4 tokens/s | 52 | tem | equilíbrio entre qualidade e custo |
| Flash-Lite | gemini-3.5-flash-lite |
US$ 0,25 (texto, imagem e vídeo) e US$ 0,50 (áudio) | US$ 1,50 | 350 tokens/s | não listado | não confirmado | alto volume, mais rápido e mais barato |
Duas ressalvas que mexem MUITO na conta final:
- o preço do Pro dobra de faixa em prompt gigante: acima de 200 mil tokens ele passa pra US$ 4,00 por 1M de entrada e US$ 18,00 por 1M de saída
- os tokens de saída incluem os tokens de raciocínio, então aquele "pensamento" interno do modelo entra na fatura junto com a resposta que você lê
Pra ter referência do índice: a mediana do mercado no Artificial Analysis Intelligence Index é 33, e as duas variantes do Google estão bem acima disso
Outro detalhe legal é que o Flash ficou mais barato de uma geração pra outra: a saída caiu de US$ 9,00 por 1M no 3.5 Flash pra US$ 7,50 por 1M no 3.6 Flash, e a entrada seguiu em US$ 1,50 por 1M
E olha, esse desenho de família com um irmão pesado e um irmão rápido não é invenção do Google, tem a mesma divisão Pro e Flash no DeepSeek rolando por aí
Qual modelo Gemini usar em cada tipo de tarefa
Aqui é onde a escolha para de ser papo de benchmark e vira decisão de projeto
O jeito que eu gosto de pensar: primeiro define o tipo de tarefa, depois olha qual perfil de custo e velocidade encaixa nela
Raciocínio longo e tarefas agênticas de código:
É o território que a documentação reserva pro Pro: raciocínio sustentado em tarefas agênticas e de código
Aqui vale lembrar de um parâmetro que quase ninguém mexe, o thinking_level, que controla a profundidade do raciocínio interno antes da resposta
Se você não especificar nada, o Gemini 3 usa high por padrão
No Gemini 3.1 Pro não dá pra desligar o raciocínio, mas dá pra limitar com o nível low quando latência é mais importante que profundidade
Tome cuidado com um ponto de bolso: o gemini-3.1-pro-preview não tem camada gratuita na Gemini API
Ou seja, se o seu plano era "testo de graça e depois decido", o teste sem custo do Pro acontece no Google AI Studio, não na API
Resposta rápida e uso interativo:
Chat, autocomplete, assistente que responde enquanto o usuário está olhando pra tela… aqui o Flash brilha
A velocidade de saída medida é de 235,4 tokens por segundo no 3.6 Flash contra 141,1 tokens por segundo no 3.1 Pro Preview, ambos na API do Google
E tem um ganho que não aparece no preço da tabela: o 3.6 Flash reduziu em 17% o uso de tokens de saída em relação ao 3.5 Flash pelo Artificial Analysis Index, chegando a 65% em benchmarks específicos como o DeepSWE da Datacurve
Menos token gasto pra dizer a mesma coisa é desconto silencioso na fatura, já que a saída é a parte cara 🙂
Alto volume de chamadas:
Classificação, extração, tag automática, moderação, aquelas tarefas que rodam milhares de vezes por dia
É o caso do Flash-Lite: 350 tokens de saída por segundo segundo o Artificial Analysis Index citado pelo próprio Google
O preço é o argumento principal: US$ 0,25 por 1M de tokens de entrada em texto, imagem e vídeo, US$ 0,50 por 1M no áudio, e US$ 1,50 por 1M de saída
Repara que o áudio tem faixa própria, então pipeline de transcrição em massa merece um cálculo separado antes de você jurar que "ficou barato"
Documentos e bases longas:
Aqui vem a surpresa que derruba um mito comum
Janela grande NÃO é exclusividade do Pro
A geração Gemini 3 compartilha a mesma ordem de grandeza de contexto: 1 milhão de tokens de entrada e até 64 mil tokens de saída, e o 3.6 Flash entrega exatamente isso
Então engolir um contrato inteiro, um repositório ou uma base de documentação não é motivo suficiente pra pagar Pro
O que muda em documento longo é outra coisa: a profundidade do raciocínio em cima do que foi lido, e o degrau de preço do Pro acima de 200 mil tokens
Veredito: qual escolher em 2026
Vou ser honesto com você: a resposta padrão mudou de lado
No índice vivo da Artificial Analysis, o Flash atual pontua 52 contra 48 do Pro atual, é mais rápido na saída e custa menos por milhão de token nas duas pontas
Com esse quadro, o Flash vira o default razoável e o Pro passa a ser escolha por PERFIL de tarefa, não por "ser o modelo melhor"
Mas segura a euforia: índice vivo é vivo mesmo, muda com nova rodada de medição, e benchmark agregado não é a sua tarefa
O teste que vale é o seu prompt, no seu contexto, com o seu critério de "tá bom"
Tem um contexto de calendário que ajuda a entender a foto de hoje: no lote anunciado em 21 de julho de 2026 o Google soltou três modelos Flash de uma vez (3.6 Flash, 3.5 Flash-Lite e 3.5 Flash Cyber) e nenhum Pro novo
Pro e Flash seguem calendários separados, então comparar "o Pro de hoje" com "o Flash de hoje" é comparar modelos de safras diferentes
Ah, e sobre esse terceiro nome do lote: o Gemini 3.5 Flash Cyber é construído sobre o 3.5 Flash e ajustado pra encontrar e corrigir vulnerabilidades de segurança, com acesso limitado a governos e parceiros de confiança via CodeMender em programa piloto
Ou seja, não é uma opção do seu seletor, é bom saber que existe e seguir a vida
E se a sua dúvida real for de família inteira, não de variante, aí o papo é outro e passa por qual IA usar em cada tarefa
Conclusão
Recapitulando o caminho mais curto: comece pelo Flash
No app, é só selecionar "3.6 Flash" no menu de modelos
Na API, é o identificador gemini-3.6-flash, que tem camada gratuita e te deixa validar a ideia antes de abrir a carteira
Só suba pro Pro quando a qualidade do raciocínio travar de verdade na sua tarefa, e não por ansiedade de "pegar o mais forte"
Quando esse momento chegar, lembra que o Gemini 3.1 Pro no app depende das assinaturas Google AI Pro ou Google AI Ultra, e que dá pra experimentar sem custo no Google AI Studio antes de decidir
Deixa nos comentários qual das três variantes ficou de daily driver aí no teu projeto, tô curioso pra ver o padrão 😀
até o próximo post!
Perguntas frequentes
O Gemini 3.1 Pro tem camada gratuita na API?
Não. O gemini-3.1-pro-preview não tem free tier na Gemini API, diferente do Gemini 3 Flash, que tem camada gratuita. Se quiser testar o Pro sem custo, o caminho é o Google AI Studio, não uma chamada direta de API.
Qual a diferença de velocidade entre o Gemini Flash e o Gemini Pro?
Na medição feita na API do Google, o Gemini 3.6 Flash entrega 235,4 tokens de saída por segundo contra 141,1 tokens por segundo do Gemini 3.1 Pro Preview. O Flash-Lite vai ainda mais rápido, com 350 tokens de saída por segundo segundo o Artificial Analysis Index citado pelo Google.
O Gemini Flash-Lite serve para tarefas de raciocínio complexo?
O posicionamento oficial do Flash-Lite é alto volume, velocidade e custo baixo, não raciocínio sustentado. Pra código e tarefas agênticas mais profundas, a documentação aponta o Pro; pra volume e resposta rápida, Flash e Flash-Lite entram na jogada.
Quanto custa usar o Gemini 3.1 Pro em prompts acima de 200 mil tokens?
O preço dobra de faixa: acima de 200 mil tokens de contexto, o Gemini 3.1 Pro passa de US$ 2,00 para US$ 4,00 por 1M de tokens de entrada, e de US$ 12,00 para US$ 18,00 por 1M de tokens de saída. Vale calcular esse degrau antes de mandar documentos muito longos pro Pro.
Como acessar o Gemini 3.1 Pro no app do Gemini?
No app, o modelo é escolhido pelo menu suspenso de modelos, mas o Gemini 3.1 Pro fica vinculado aos planos pagos Google AI Pro e Google AI Ultra. Já o Gemini 3.6 Flash é acessado selecionando ‘3.6 Flash’ direto nesse mesmo menu.
O que é o Gemini 3.5 Flash Cyber?
É uma variante do Flash construída sobre o 3.5 Flash e ajustada especificamente para encontrar e corrigir vulnerabilidades de segurança. Não é de acesso aberto: fica limitada a governos e parceiros de confiança via CodeMender, em programa piloto.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
