Gemini 3.7 Flash com áudio e vídeo: o que dá para fazer com entrada multimodal

O Gemini 3.7 Flash é o modelo que o Google lançou em 13 de agosto de 2026 aceitando texto, imagens, áudio e vídeo na entrada, com saída em texto, 1 milhão de tokens de contexto e até 64 mil de saída. Na prática dá pra jogar uma gravação de até 9,5 horas, um vídeo público do YouTube ou um PDF de mil páginas dentro do mesmo prompt. O áudio custa 32 tokens por segundo, o vídeo cerca de 300 por segundo na resolução padrão e cada página de PDF vale 258 tokens. O preço introdutório é US$ 0,75 por 1M de tokens de entrada
O mesmo prompt que hoje leva só um bloco de texto pode levar uma reunião gravada inteira, um vídeo completo e um PDF de mil páginas 😀
O Gemini 3.7 Flash foi lançado pelo Google em 13 de agosto de 2026 e aceita quatro tipos de entrada: strings de texto, imagens, áudio e arquivos de vídeo
A saída é uma só: texto
Ou seja, ele não devolve áudio nem vídeo, ele LÊ áudio e vídeo e te responde escrevendo
E é essa diferença que muda o tipo de trabalho que dá pra empurrar pra dentro de um prompt, beleza? Bora ver o que cabe ali
De onde vem o Gemini 3.7 Flash e onde ele já está disponível
O lançamento saiu em 13/08/2026, apenas três semanas depois do Gemini 3.6 Flash
Ritmo insano de release, né?
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Na API o identificador é gemini-3.7-flash e ele já saiu em versão geral (GA), então é modelo liberado pra produção, não preview
Onde ele apareceu no lançamento:
- Gemini API via Google AI Studio
- Android Studio
- Google Antigravity
- Gemini Enterprise Agent Platform
- app Gemini Enterprise
No app Gemini, o 3.7 Flash está sendo liberado no Spark, que exige assinatura Google AI Pro ou Ultra, com rollout em mais de 160 países começando em 13/08/2026
Quanto custa:
O preço introdutório é de US$ 0,75 por 1 milhão de tokens de entrada e US$ 3,75 por 1 milhão de tokens de saída
Só que introdutório é introdutório: essa taxa expira em 31/12/2026
A partir de 01/01/2027 vai pra US$ 1,50 por 1M de entrada e US$ 7,50 por 1M de saída, ou seja, dobra
Detalhe que passa batido: o Google aplicou a mesma taxa introdutória também ao Gemini 3.6 Flash
Áudio, vídeo e PDF: quanto cada tipo de entrada custa em tokens
Antes de sonhar com o caso de uso, tem que entender COMO cada mídia vira token, porque é isso que define o que cabe e quanto sai
Se você já mexeu com contagem de token em texto, é a mesma lógica: muda só a régua de conversão
| Entrada | Custo em tokens |
|---|---|
| Áudio | 32 tokens por segundo (1 minuto = 1.920 tokens) |
| Vídeo (resolução padrão) | cerca de 300 tokens por segundo |
| Vídeo (media_resolution baixa) | cerca de 100 tokens por segundo |
| 258 tokens por página (arquivo de até 50 MB ou 1.000 páginas) |
E se liga nisso: o teto de verdade não é a duração do arquivo, é a janela de contexto
Tudo que tu manda tem que caber no 1 milhão de tokens de entrada, então a conta da tabela acima é o que decide se o material entra ou não
Os formatos de áudio aceitos na Gemini API são WAV, MP3, AIFF, AAC, OGG Vorbis e FLAC
E tome cuidado com uma coisa: o áudio é tratado ANTES de ser processado
Ele é reduzido pra 16 Kbps e canais múltiplos são combinados em um único canal
Se você gravou aquele podcast lindo em estéreo separando os microfones, esquece a separação de canais, ali dentro vira mono
O vídeo enviado pela Files API também passa por um tratamento: fica armazenado a 1 quadro por segundo (FPS), com o áudio processado a 1 Kbps em canal único e timestamps a cada segundo
E o tal do media_resolution?
Nos modelos Gemini 3 dá pra configurar media_resolution por item de conteúdo
Em low, cada quadro é tokenizado com menos tokens, e é exatamente por isso que o vídeo cai de cerca de 300 pra cerca de 100 tokens por segundo
É o teu botão de volume entre "quero detalhe" e "quero economizar", item a item
O que dá para fazer mandando áudio para o 3.7 Flash
O pulo do gato aqui é que dá pra mandar o arquivo bruto
Não é mais "cola aqui a transcrição", é "toma a gravação"
O que isso destrava, sempre lembrando que a resposta volta em texto:
- transformar gravação longa em texto estruturado, com os pontos separados do blá blá
- resumo e extração de decisões de uma reunião de horas
- análise de entrevista, de call de vendas, de aula gravada
- varrer episódio de podcast atrás de um assunto específico
E a conta de custo tu faz ANTES de rodar, o que é mto bom pra não tomar susto
Uma hora de áudio dá 60 minutos vezes 1.920 tokens, ou seja, 115.200 tokens de entrada
Ou seja, uma fração da janela de contexto, sobra espaço de sobra pro prompt
Com o preço introdutório de US$ 0,75 por 1 milhão de tokens de entrada, essa hora de gravação sai por volta de nove centavos de dólar de entrada
Faça a conta com o teu material real antes de subir arquivo, é literalmente multiplicação
Quem já monta esteira automatizada consegue plugar isso num fluxo, tipo o processamento multimodal no n8n, e deixar a gravação cair no prompt sozinha
O que dá para fazer mandando vídeo: timestamp, YouTube e vídeo longo
Aqui mora a parte mais divertida
A Gemini API aceita URL do YouTube como entrada de vídeo, com uma restrição importante: apenas vídeos públicos
Privado e não listado NÃO valem, então nem tenta com aquele vídeo interno da empresa
Dá também pra referenciar um momento específico no prompt, no formato MM:SS
Algo como "explica o que acontece em 01:15" e ele vai lá naquele trecho
E isso funciona porque os timestamps são gravados a cada segundo quando o vídeo é processado
O que significa esse 1 quadro por segundo?
Boa pergunta, porque esse detalhe define o que tu ganha e o que tu perde
O vídeo é armazenado a 1 FPS
Ganho: dá pra passar material longo sem estourar tudo, porque dez minutos de vídeo viram 600 quadros e não os milhares de quadros do arquivo original
Perda: o que acontece ENTRE dois quadros não chega no modelo
Movimento rápido, um frame de erro que pisca na tela, uma animação curtinha, isso pode simplesmente não existir pro modelo
Pra aula gravada, gravação de tela, demo de produto e webinar isso quase não incomoda
Pra análise quadro a quadro de coisa rápida, incomoda muito
Um sinal de que ele aguenta material longo: o modelo lidera o LVBench, benchmark de compreensão de vídeo longo, com 85,4%
E a conta de token segue simples: dez minutos de vídeo na resolução padrão dão 600 segundos vezes cerca de 300 tokens, algo perto de 180 mil tokens de entrada
Se apertar, joga em media_resolution baixa e cai pra cerca de 100 tokens por segundo
Como enviar os arquivos: inline, Files API e contexto de 1 milhão
Beleza, e como o arquivo chega lá?
São dois caminhos, e a régua é o tamanho
- Inline, mandando os dados junto do prompt: a requisição total (prompt mais arquivos) pode ter até 20 MB
- Files API, pra qualquer coisa acima disso: aceita arquivos de até 2 GB e guarda por 48 horas
O erro comum aqui é achar que o limite de 20 MB é do arquivo
Não é: é da requisição INTEIRA, prompt junto
E o outro tropeço clássico é esquecer as 48 horas da Files API e tentar reusar semana que vem o mesmo arquivo já subido, aí não tem mais nada lá
E o contexto de 1 milhão de tokens aguenta?
O modelo tem 1 milhão de tokens de contexto de entrada e até 64 mil tokens de saída
Só que "caber" e "achar a informação" são coisas diferentes, e o número que fala disso é o GDM-MRCR v2, de recuperação em contexto longo
Ele marca 97,0% em 128k tokens e 62,5% em 1M de tokens
Traduzindo: quanto mais tu enche o contexto, mais a recuperação cai
Então evite empilhar cinco gravações no mesmo prompt só porque cabe, prefira separar por arquivo quando a precisão importa
Outro botão útil é o de raciocínio: o modelo tem thinking levels LOW, MEDIUM (padrão) e HIGH
Usa LOW pra extração burocrática de transcrição e sobe pra HIGH quando a pergunta exige juntar pontas de partes distantes do material
O que o Gemini 3.7 Flash não faz (e quando usar outro modelo)
Agora a parte honesta, porque ficha técnica boa também serve pra dizer não
A saída é texto
Nada de resposta em áudio, nada de voz, nada de vídeo gerado
Pra voz em tempo real, aquele papo de áudio pra áudio com baixa latência, o modelo do Google é outro: o Gemini 3.1 Flash Live, com saída de áudio nativa via Live API
Se o teu objetivo é o caminho contrário, transformar material em som, o rolê é outro também, tipo gerar um resumo em áudio e ouvir depois
Mais dois fatores que pesam na decisão:
- o corte de conhecimento é março de 2026, então coisa nova do mundo ele não sabe por conta própria
- o preço introdutório expira em 31/12/2026 e depois dobra, o que muda qualquer planilha de custo de projeto longo
E pra quem está avaliando trocar de modelo pensando em código, os ganhos sobre o 3.6 Flash foram:
| Benchmark | Gemini 3.6 Flash | Gemini 3.7 Flash |
|---|---|---|
| DeepSWE v1.1 | 49,0% | 65,3% |
| FrontierCode 1.1 Main | 34,4% | 43,6% |
| WebDev Arena (Elo) | 1538 | 1588 |
A WebDev Arena é operada pela Arena.ai, e o salto de Elo ali é o tipo de sinal que combina com o pulo do DeepSWE
Por onde começar com a entrada multimodal
Recapitulando o que importa: o 3.7 Flash aceita texto, imagem, áudio e vídeo na entrada, responde em texto, tem 1 milhão de tokens de contexto e está GA na API como gemini-3.7-flash
Áudio a 32 tokens por segundo, vídeo a cerca de 300 tokens por segundo na resolução padrão, PDF a 258 tokens por página
O próximo passo é bem simples e não precisa de PC da Nasa pra fazer 🙂
- escolhe UM arquivo que já está parado aí: uma gravação de reunião, um vídeo público do YouTube ou um PDF
- calcula o custo em tokens pela tabela lá de cima antes de rodar qualquer coisa
- roda o primeiro teste no Google AI Studio com o model ID
gemini-3.7-flashe só depois pensa em levar pra produção
O erro comum de quem começa é ir direto pro código de produção e descobrir o custo depois, quando a fatura já rodou
Faz o teste pequeno primeiro, mede, aí sim automatiza
até o próximo post!
Perguntas frequentes
Quanto custa usar o Gemini 3.7 Flash na API?
O preço introdutório é de US$ 0,75 por 1 milhão de tokens de entrada e US$ 3,75 por 1 milhão de tokens de saída. Essa taxa vale até 31/12/2026. A partir de 01/01/2027 dobra, indo para US$ 1,50 por 1M de entrada e US$ 7,50 por 1M de saída.
O 3.7 Flash consegue gerar áudio ou vídeo como resposta?
Não. Ele aceita texto, imagens, áudio e vídeo como entrada, mas a saída é só texto. Ou seja, ele lê o arquivo multimodal e responde escrevendo, nunca devolvendo áudio ou vídeo.
Quanto custa em tokens mandar vídeo para o Gemini 3.7 Flash?
Na resolução padrão o vídeo custa cerca de 300 tokens por segundo. Em media_resolution baixa cai para cerca de 100 tokens por segundo. O limite prático do que cabe é a janela de 1 milhão de tokens de contexto de entrada.
Dá pra mandar link do YouTube pro Gemini 3.7 Flash analisar?
Dá, a Gemini API aceita URL do YouTube como entrada de vídeo. A única restrição é que o vídeo precisa ser público, links privados ou não listados não funcionam.
Qual a diferença entre o Gemini 3.7 Flash e o Gemini 3.1 Flash Live?
O 3.7 Flash lê áudio, vídeo, imagem e texto e responde em texto, sem saída de voz. Pra conversa por voz em tempo real, com áudio para áudio de baixa latência, o modelo certo é o Gemini 3.1 Flash Live, via Live API.
Onde o Gemini 3.7 Flash já está disponível?
No lançamento ele saiu na Gemini API via Google AI Studio, Android Studio, Google Antigravity, Gemini Enterprise Agent Platform e no app Gemini Enterprise. No app Gemini ele está no Spark, liberado para assinantes AI Pro e Ultra em mais de 160 países.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
