Gemini API: o que dá para construir com a IA do Google além do chat

A Gemini API é o Gemini sem a caixa de chat: entrada multimodal nativa (texto, imagem, áudio, vídeo e documentos como PDF) na mesma requisição, ferramentas nativas que rodam dentro de uma única chamada (Google Search, Maps, URL Context, File Search e Code Execution), RAG gerenciado, saída estruturada em JSON Schema, Live API bidirecional em Preview e geração de imagem e vídeo. Contas novas já começam no Free Tier, limitadas pelos rate limits do modelo, e o Google GenAI SDK é a biblioteca recomendada, com versões para Python, JavaScript/TypeScript, Go e Java
Fala aí, beleza? O Gemini que a maioria conhece é uma caixa de texto no navegador, e o Gemini que o desenvolvedor acessa por API é praticamente outro produto: busca do Google resolvida server-side, execução de código, RAG gerenciado, voz em tempo real e geração de vídeo, tudo atrás de uma chave
Uma chave, um SDK oficial, e o resto é decidir QUAL recurso resolve o teu caso
Quem pesquisa "Gemini" encontra um monte de conteúdo sobre o chatbot, e a pergunta de quem escreve código (o que eu ponho no meu backend com isso?) fica sem resposta. Se o teu caso for chatbot mesmo, já existe o caminho de integrar Gemini em chatbots no n8n
Bora ver na prática?
Entrada multimodal: aplicações que nascem de mandar imagem, áudio e vídeo na mesma requisição
A Gemini API aceita prompt multimodal com texto, imagem, áudio e vídeo na mesma chamada, sem precisar de um modelo separado por modalidade
Parece detalhe, mas muda a arquitetura inteira: documentos (incluindo PDF), visão sobre imagem, compreensão de áudio e análise de vídeo entram pela MESMA porta
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Aí você deixa de montar aquele pipeline frankenstein com um serviço de transcrição, outro de OCR e outro de visão, e passa a montar um prompt só
Agora as regras operacionais, que são o que realmente decide o desenho do teu código:
- Arquivo maior que 20 MB, vídeo com mais de cerca de 1 minuto ou reuso do mesmo arquivo em várias requisições: sobe pela File API antes do
generateContent - Abaixo disso: dá pra mandar o vídeo inline na própria requisição
- Quando o prompt precisa apontar pra um momento específico do vídeo, a documentação orienta o formato
MM:SS(tipo01:15) - A recomendação é um vídeo por requisição
E tem um detalhe que já derruba projeto: arquivo bruto enviado pela File API é apagado depois de 48 horas
Ou seja, a fonte da verdade fica do TEU lado, sempre. A File API é passagem, não storage 🙂
Ferramentas nativas: busca, mapas, URL e execução de código sem orquestrar nada
Esse é o bloco que mais separa API de chat
Google Search, Google Maps, URL Context, File Search e Code Execution executam dentro de uma única chamada de API, nos servidores do Google
Traduzindo pro dia a dia: você não escreve o loop de "o modelo pediu a ferramenta, eu chamo, eu devolvo o resultado, ele responde". Isso resolve lá dentro e volta pronto
Com a ferramenta google_search habilitada, o modelo cuida do fluxo inteiro de buscar, processar e citar a informação, conectando a resposta a conteúdo atual da web com fontes verificáveis
Aplicação óbvia: qualquer coisa que precise de informação fresca e rastreável, tipo monitoramento de mercado, resumo de notícia, assistente de pesquisa
A ferramenta de URL context vai por outro caminho: você passa URLs no pedido e o modelo acessa o conteúdo daquelas páginas pra usar como contexto
Link vira contexto, sem crawler seu no meio
O grounding com Google Maps passou a ser suportado nos modelos Gemini 3, e a ferramenta Computer Use (que deixa o modelo interagir com tela, teclado e mouse de um computador virtual pra executar tarefas) é acessível de forma nativa no Gemini 3 Pro e no Gemini 3 Flash, diferente da série 2.5, que exigia um modelo separado pra isso
File Search: RAG gerenciado sem montar pipeline de embeddings
Quem já fez RAG na mão sabe a novela: escolher chunker, gerar embedding, subir vector store, cuidar da busca, cuidar da atualização
A Gemini API oferece RAG gerenciado pela ferramenta File Search, que importa, divide em chunks e indexa os dados para busca semântica
Se você precisa dos embeddings soltos pra outra coisa, o modelo estável de embedding de texto é o gemini-embedding-001. Tome cuidado com código antigo: o text-embedding-004 foi desligado em 14 de janeiro de 2026
E aqui tem a diferença de retenção que define o desenho:
- File API: o arquivo bruto some em 48 horas
- File Search store: os dados importados ficam guardados até você apagar manualmente
Casos que caem certinho nisso: base de conhecimento interna, suporte respondendo em cima da documentação do próprio produto, busca semântica dentro do teu app
Saída estruturada e function calling: quando a resposta vira dado de sistema
Modelo que devolve texto solto é ótimo pra ler, péssimo pra processar
A saída estruturada resolve isso forçando a resposta a seguir um JSON Schema, e os SDKs do Google GenAI aceitam definir esse schema com Pydantic no Python e Zod no JavaScript
Ou seja, você define o tipo uma vez, na linguagem que já usa, e a resposta chega no formato
"E function calling, é a mesma coisa?" Não, e o próprio Google separa bem:
- Function calling: pro momento em que o modelo precisa de um passo intermediário, conectando às suas ferramentas ou aos seus sistemas de dados
- Saída estruturada: pro momento em que a resposta final precisa obedecer estritamente a um schema
Um é meio de caminho, o outro é o formato da entrega
E nos modelos Gemini 3 dá pra combinar saída estruturada com as ferramentas nativas, incluindo Grounding com Google Search, URL Context, File Search, Code Execution e function calling
Isso é MUITO bom pra extração e classificação com dado fresco: o modelo busca na web, lê a página, e ainda assim te devolve o JSON no schema que o teu banco espera 😀
Voz e tempo real: o que a Live API viabiliza
A Live API processa entrada de texto, áudio e vídeo e devolve saída de texto e áudio, com interação bidirecional de baixa latência
É o que sustenta atendimento por voz, copiloto que escuta a tela, tutor que conversa em vez de digitar
Aviso honesto de maturidade: ela está em Preview
Então dá pra prototipar e mostrar, mas coloque isso no teu cálculo de risco antes de prometer pro cliente
O gemini-3.1-flash-live-preview é o modelo audio-to-audio de baixa latência voltado a diálogo em tempo real e aplicações voice-first
Geração de imagem e vídeo pela mesma API
A geração de imagem fica com a linha Nano Banana, que hoje tem quatro modelos:
- Nano Banana 2 Lite (
gemini-3.1-flash-lite-image) - Nano Banana 2 (
gemini-3.1-flash-image) - Nano Banana Pro (
gemini-3-pro-image) - Nano Banana (
gemini-2.5-flash-image)
Já o vídeo é com o Veo 3.1, que gera vídeo com áudio nativo e suporta extensão de vídeo, geração a partir de frames específicos e direção por imagem. Os IDs de preview incluem veo-3.1-generate-preview e veo-3.1-fast-generate-preview
O uso típico disso não é brincar de gerar wallpaper, é criativo em escala DENTRO do teu produto: variação de banner, thumb, vídeo curto de campanha, sem o usuário sair pra outra plataforma
Custo e limites: camada gratuita, camada paga, Batch API e cache
Antes de escolher recurso, decide conta 🙂
Contas novas começam no Free Tier, com acesso a determinados modelos até os limites de taxa da camada gratuita
A linha Flash é justamente onde mora esse acesso gratuito, e ela anda rápido, vale acompanhar as novidades do Flash mais novo do Google pra não ficar preso num ID velho
| Decisão | Como funciona | Número oficial |
|---|---|---|
| Camada gratuita | Contas novas já entram nela, com acesso a determinados modelos | Limitada pelos rate limits da camada gratuita do modelo |
| Modelos com free tier | Onde dá pra começar sem cartão | gemini-3-flash-preview e gemini-3.1-flash-lite |
| Camada paga | Exige vincular uma conta de faturamento | Limites maiores e prompts e respostas fora do treino de produtos do Google |
| Gemini 3.1 Flash-Lite (pago) | Entrada de texto, imagem e vídeo | US$ 0,25 por 1M de tokens de entrada e US$ 1,50 por 1M de saída |
| Batch API | Lote assíncrono, pro que não é interativo | 50% do preço da API interativa padrão do modelo equivalente, conclusão prevista em até 24 horas |
| Envio do lote | Inline ou arquivo | Inline para lotes abaixo de 20 MB no total; JSONL no Google Cloud Storage até 2 GB |
| Cache de contexto | Pra contexto inicial grande referenciado por requisições curtas | Cache implícito automático nos modelos 2.5 e mais novos; cache explícito com TTL e reuso via cached_content |
| Janela dos Gemini 3 | Quanto cabe por chamada | 1.000.000 tokens de entrada e até 64.000 de saída |
| Janela do Gemini 3.5 Flash | Quanto cabe por chamada | 1.000.000 tokens de entrada e até 65.000 de saída |
Duas leituras práticas dessa tabela
A primeira: se o teu processamento não é interativo (classificar 50 mil registros, enriquecer catálogo, rodar análise noturna), a Batch API corta metade do preço só por você aceitar a janela de até 24 horas
A segunda: prompt gigante repetido é dinheiro jogado fora, e o cache de contexto existe exatamente pra esse padrão de contexto grande e pergunta curta
SDK do Google ou camada de compatibilidade com OpenAI?
O Google GenAI SDK é a biblioteca recomendada para acessar a Gemini API, e está disponível para Python, JavaScript/TypeScript, Go e Java
Mas existe também uma camada de compatibilidade com OpenAI: dá pra usar as bibliotecas da OpenAI (Python e TypeScript/JavaScript) trocando poucas linhas e usando a chave da Gemini API, apontando pra este endpoint:
https://generativelanguage.googleapis.com/v1beta/openai/
Sedutor, né? Migração de uma linha, código legado inteiro continua de pé
Só que o veredito aqui é o do próprio Google, e é bem direto: esse caminho é recomendado pra quem está preso ao SDK da OpenAI e não precisa de recursos avançados
Usar a API direta é o que libera File API, cache de contexto e a Live API bidirecional
Traduzindo: compatibilidade é fallback de migração, não é destino. Se o teu roadmap tem vídeo longo, contexto cacheado ou voz em tempo real, vai de SDK oficial desde o começo e evita a refatoração dobrada
Por onde começar
O salto do chat pra Gemini API não é aprender uma sintaxe nova, é escolher QUAL recurso resolve o teu caso
Multimodal na mesma requisição? Ferramenta nativa resolvendo busca e código server-side? File Search pra RAG sem pipeline? Saída estruturada pra resposta virar dado? Live API pra voz? Nano Banana e Veo 3.1 pra geração?
Escolhe UM, o que dói mais no teu produto hoje
Depois o caminho concreto é curto: começa no Free Tier com um modelo que tem camada gratuita (gemini-3-flash-preview ou gemini-3.1-flash-lite), pega o SDK oficial da tua linguagem, e só vincula faturamento quando o limite de taxa apertar ou quando os teus dados precisarem ficar fora do treino de produtos do Google
Protótipo primeiro, cartão depois 😀
até o próximo post!
Perguntas frequentes
Quanto custa usar o Gemini 3.1 Flash-Lite pela Gemini API?
Na camada paga, o Gemini 3.1 Flash-Lite custa US$ 0,25 por 1 milhão de tokens de entrada (texto, imagem e vídeo) e US$ 1,50 por 1 milhão de tokens de saída. Pra acessar esse preço e limites maiores, é preciso vincular uma conta de faturamento, o que também garante que prompts e respostas não sejam usados pra melhorar produtos do Google.
Dá pra testar a Gemini API sem vincular cartão de crédito?
Dá sim: toda conta nova começa automaticamente no Free Tier, com acesso a determinados modelos dentro dos limites de taxa da camada gratuita. O Gemini 3 Flash (gemini-3-flash-preview) e o Gemini 3.1 Flash-Lite (gemini-3.1-flash-lite) têm camada gratuita, então dá pra prototipar bastante coisa antes de pensar em faturamento.
O que é a Batch API da Gemini e quando compensa usar?
A Batch API é pensada pra volume: ela cobra 50% do preço da API interativa padrão do modelo equivalente, com prazo de conclusão previsto de até 24 horas. Lotes que cabem em menos de 20 MB no total podem ir inline na requisição; acima disso, o caminho é subir um arquivo JSONL no Google Cloud Storage, que suporta até 2 GB.
Pra que serve o cache de contexto na Gemini API?
Ele compensa quando um contexto inicial grande, tipo um documento longo ou um system prompt extenso, é referenciado repetidamente por requisições curtas. Nos modelos Gemini 2.5 em diante o cache implícito já vem habilitado automaticamente, e ainda dá pra criar cache explícito com TTL e reuso via cached_content.
A Gemini API gera imagem e vídeo, ou só texto?
Gera os dois. Imagem fica com a linha Nano Banana, que tem quatro modelos (do Nano Banana 2 Lite ao Nano Banana Pro), e vídeo fica com o Veo 3.1, que gera com áudio nativo e suporta extensão de vídeo, geração a partir de frames específicos e direção por imagem.
Dá pra usar o SDK da OpenAI pra acessar a Gemini API?
Dá, existe uma camada de compatibilidade no endpoint v1beta/openai/, onde você troca poucas linhas nas bibliotecas da OpenAI (Python e TypeScript/JavaScript) e usa a sua chave da Gemini API. Mas o próprio Google recomenda esse caminho só pra quem já está preso ao SDK da OpenAI: a API direta é o que libera File API, cache de contexto e a Live API bidirecional.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
