Gemini API: o que dá para construir com a IA do Google além do chat

recursos da Gemini API do Google além do chat
Resposta rápida

A Gemini API é o Gemini sem a caixa de chat: entrada multimodal nativa (texto, imagem, áudio, vídeo e documentos como PDF) na mesma requisição, ferramentas nativas que rodam dentro de uma única chamada (Google Search, Maps, URL Context, File Search e Code Execution), RAG gerenciado, saída estruturada em JSON Schema, Live API bidirecional em Preview e geração de imagem e vídeo. Contas novas já começam no Free Tier, limitadas pelos rate limits do modelo, e o Google GenAI SDK é a biblioteca recomendada, com versões para Python, JavaScript/TypeScript, Go e Java

Fala aí, beleza? O Gemini que a maioria conhece é uma caixa de texto no navegador, e o Gemini que o desenvolvedor acessa por API é praticamente outro produto: busca do Google resolvida server-side, execução de código, RAG gerenciado, voz em tempo real e geração de vídeo, tudo atrás de uma chave

Uma chave, um SDK oficial, e o resto é decidir QUAL recurso resolve o teu caso

Quem pesquisa "Gemini" encontra um monte de conteúdo sobre o chatbot, e a pergunta de quem escreve código (o que eu ponho no meu backend com isso?) fica sem resposta. Se o teu caso for chatbot mesmo, já existe o caminho de integrar Gemini em chatbots no n8n

Bora ver na prática?

Entrada multimodal: aplicações que nascem de mandar imagem, áudio e vídeo na mesma requisição

A Gemini API aceita prompt multimodal com texto, imagem, áudio e vídeo na mesma chamada, sem precisar de um modelo separado por modalidade

Parece detalhe, mas muda a arquitetura inteira: documentos (incluindo PDF), visão sobre imagem, compreensão de áudio e análise de vídeo entram pela MESMA porta

Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Aí você deixa de montar aquele pipeline frankenstein com um serviço de transcrição, outro de OCR e outro de visão, e passa a montar um prompt só

Agora as regras operacionais, que são o que realmente decide o desenho do teu código:

  • Arquivo maior que 20 MB, vídeo com mais de cerca de 1 minuto ou reuso do mesmo arquivo em várias requisições: sobe pela File API antes do generateContent
  • Abaixo disso: dá pra mandar o vídeo inline na própria requisição
  • Quando o prompt precisa apontar pra um momento específico do vídeo, a documentação orienta o formato MM:SS (tipo 01:15)
  • A recomendação é um vídeo por requisição

E tem um detalhe que já derruba projeto: arquivo bruto enviado pela File API é apagado depois de 48 horas

Ou seja, a fonte da verdade fica do TEU lado, sempre. A File API é passagem, não storage 🙂

Ferramentas nativas: busca, mapas, URL e execução de código sem orquestrar nada

Esse é o bloco que mais separa API de chat

Google Search, Google Maps, URL Context, File Search e Code Execution executam dentro de uma única chamada de API, nos servidores do Google

Traduzindo pro dia a dia: você não escreve o loop de "o modelo pediu a ferramenta, eu chamo, eu devolvo o resultado, ele responde". Isso resolve lá dentro e volta pronto

Com a ferramenta google_search habilitada, o modelo cuida do fluxo inteiro de buscar, processar e citar a informação, conectando a resposta a conteúdo atual da web com fontes verificáveis

Aplicação óbvia: qualquer coisa que precise de informação fresca e rastreável, tipo monitoramento de mercado, resumo de notícia, assistente de pesquisa

A ferramenta de URL context vai por outro caminho: você passa URLs no pedido e o modelo acessa o conteúdo daquelas páginas pra usar como contexto

Link vira contexto, sem crawler seu no meio

O grounding com Google Maps passou a ser suportado nos modelos Gemini 3, e a ferramenta Computer Use (que deixa o modelo interagir com tela, teclado e mouse de um computador virtual pra executar tarefas) é acessível de forma nativa no Gemini 3 Pro e no Gemini 3 Flash, diferente da série 2.5, que exigia um modelo separado pra isso

File Search: RAG gerenciado sem montar pipeline de embeddings

Quem já fez RAG na mão sabe a novela: escolher chunker, gerar embedding, subir vector store, cuidar da busca, cuidar da atualização

A Gemini API oferece RAG gerenciado pela ferramenta File Search, que importa, divide em chunks e indexa os dados para busca semântica

Se você precisa dos embeddings soltos pra outra coisa, o modelo estável de embedding de texto é o gemini-embedding-001. Tome cuidado com código antigo: o text-embedding-004 foi desligado em 14 de janeiro de 2026

E aqui tem a diferença de retenção que define o desenho:

  • File API: o arquivo bruto some em 48 horas
  • File Search store: os dados importados ficam guardados até você apagar manualmente

Casos que caem certinho nisso: base de conhecimento interna, suporte respondendo em cima da documentação do próprio produto, busca semântica dentro do teu app

Saída estruturada e function calling: quando a resposta vira dado de sistema

Modelo que devolve texto solto é ótimo pra ler, péssimo pra processar

A saída estruturada resolve isso forçando a resposta a seguir um JSON Schema, e os SDKs do Google GenAI aceitam definir esse schema com Pydantic no Python e Zod no JavaScript

Ou seja, você define o tipo uma vez, na linguagem que já usa, e a resposta chega no formato

"E function calling, é a mesma coisa?" Não, e o próprio Google separa bem:

  • Function calling: pro momento em que o modelo precisa de um passo intermediário, conectando às suas ferramentas ou aos seus sistemas de dados
  • Saída estruturada: pro momento em que a resposta final precisa obedecer estritamente a um schema

Um é meio de caminho, o outro é o formato da entrega

E nos modelos Gemini 3 dá pra combinar saída estruturada com as ferramentas nativas, incluindo Grounding com Google Search, URL Context, File Search, Code Execution e function calling

Isso é MUITO bom pra extração e classificação com dado fresco: o modelo busca na web, lê a página, e ainda assim te devolve o JSON no schema que o teu banco espera 😀

Voz e tempo real: o que a Live API viabiliza

A Live API processa entrada de texto, áudio e vídeo e devolve saída de texto e áudio, com interação bidirecional de baixa latência

É o que sustenta atendimento por voz, copiloto que escuta a tela, tutor que conversa em vez de digitar

Aviso honesto de maturidade: ela está em Preview

Então dá pra prototipar e mostrar, mas coloque isso no teu cálculo de risco antes de prometer pro cliente

O gemini-3.1-flash-live-preview é o modelo audio-to-audio de baixa latência voltado a diálogo em tempo real e aplicações voice-first

Geração de imagem e vídeo pela mesma API

A geração de imagem fica com a linha Nano Banana, que hoje tem quatro modelos:

  • Nano Banana 2 Lite (gemini-3.1-flash-lite-image)
  • Nano Banana 2 (gemini-3.1-flash-image)
  • Nano Banana Pro (gemini-3-pro-image)
  • Nano Banana (gemini-2.5-flash-image)

Já o vídeo é com o Veo 3.1, que gera vídeo com áudio nativo e suporta extensão de vídeo, geração a partir de frames específicos e direção por imagem. Os IDs de preview incluem veo-3.1-generate-preview e veo-3.1-fast-generate-preview

O uso típico disso não é brincar de gerar wallpaper, é criativo em escala DENTRO do teu produto: variação de banner, thumb, vídeo curto de campanha, sem o usuário sair pra outra plataforma

Custo e limites: camada gratuita, camada paga, Batch API e cache

Antes de escolher recurso, decide conta 🙂

Contas novas começam no Free Tier, com acesso a determinados modelos até os limites de taxa da camada gratuita

A linha Flash é justamente onde mora esse acesso gratuito, e ela anda rápido, vale acompanhar as novidades do Flash mais novo do Google pra não ficar preso num ID velho

Decisão Como funciona Número oficial
Camada gratuita Contas novas já entram nela, com acesso a determinados modelos Limitada pelos rate limits da camada gratuita do modelo
Modelos com free tier Onde dá pra começar sem cartão gemini-3-flash-preview e gemini-3.1-flash-lite
Camada paga Exige vincular uma conta de faturamento Limites maiores e prompts e respostas fora do treino de produtos do Google
Gemini 3.1 Flash-Lite (pago) Entrada de texto, imagem e vídeo US$ 0,25 por 1M de tokens de entrada e US$ 1,50 por 1M de saída
Batch API Lote assíncrono, pro que não é interativo 50% do preço da API interativa padrão do modelo equivalente, conclusão prevista em até 24 horas
Envio do lote Inline ou arquivo Inline para lotes abaixo de 20 MB no total; JSONL no Google Cloud Storage até 2 GB
Cache de contexto Pra contexto inicial grande referenciado por requisições curtas Cache implícito automático nos modelos 2.5 e mais novos; cache explícito com TTL e reuso via cached_content
Janela dos Gemini 3 Quanto cabe por chamada 1.000.000 tokens de entrada e até 64.000 de saída
Janela do Gemini 3.5 Flash Quanto cabe por chamada 1.000.000 tokens de entrada e até 65.000 de saída

Duas leituras práticas dessa tabela

A primeira: se o teu processamento não é interativo (classificar 50 mil registros, enriquecer catálogo, rodar análise noturna), a Batch API corta metade do preço só por você aceitar a janela de até 24 horas

A segunda: prompt gigante repetido é dinheiro jogado fora, e o cache de contexto existe exatamente pra esse padrão de contexto grande e pergunta curta

SDK do Google ou camada de compatibilidade com OpenAI?

O Google GenAI SDK é a biblioteca recomendada para acessar a Gemini API, e está disponível para Python, JavaScript/TypeScript, Go e Java

Mas existe também uma camada de compatibilidade com OpenAI: dá pra usar as bibliotecas da OpenAI (Python e TypeScript/JavaScript) trocando poucas linhas e usando a chave da Gemini API, apontando pra este endpoint:

https://generativelanguage.googleapis.com/v1beta/openai/

Sedutor, né? Migração de uma linha, código legado inteiro continua de pé

Só que o veredito aqui é o do próprio Google, e é bem direto: esse caminho é recomendado pra quem está preso ao SDK da OpenAI e não precisa de recursos avançados

Usar a API direta é o que libera File API, cache de contexto e a Live API bidirecional

Traduzindo: compatibilidade é fallback de migração, não é destino. Se o teu roadmap tem vídeo longo, contexto cacheado ou voz em tempo real, vai de SDK oficial desde o começo e evita a refatoração dobrada

Por onde começar

O salto do chat pra Gemini API não é aprender uma sintaxe nova, é escolher QUAL recurso resolve o teu caso

Multimodal na mesma requisição? Ferramenta nativa resolvendo busca e código server-side? File Search pra RAG sem pipeline? Saída estruturada pra resposta virar dado? Live API pra voz? Nano Banana e Veo 3.1 pra geração?

Escolhe UM, o que dói mais no teu produto hoje

Depois o caminho concreto é curto: começa no Free Tier com um modelo que tem camada gratuita (gemini-3-flash-preview ou gemini-3.1-flash-lite), pega o SDK oficial da tua linguagem, e só vincula faturamento quando o limite de taxa apertar ou quando os teus dados precisarem ficar fora do treino de produtos do Google

Protótipo primeiro, cartão depois 😀

até o próximo post!

Perguntas frequentes

Quanto custa usar o Gemini 3.1 Flash-Lite pela Gemini API?

Na camada paga, o Gemini 3.1 Flash-Lite custa US$ 0,25 por 1 milhão de tokens de entrada (texto, imagem e vídeo) e US$ 1,50 por 1 milhão de tokens de saída. Pra acessar esse preço e limites maiores, é preciso vincular uma conta de faturamento, o que também garante que prompts e respostas não sejam usados pra melhorar produtos do Google.

Dá pra testar a Gemini API sem vincular cartão de crédito?

Dá sim: toda conta nova começa automaticamente no Free Tier, com acesso a determinados modelos dentro dos limites de taxa da camada gratuita. O Gemini 3 Flash (gemini-3-flash-preview) e o Gemini 3.1 Flash-Lite (gemini-3.1-flash-lite) têm camada gratuita, então dá pra prototipar bastante coisa antes de pensar em faturamento.

O que é a Batch API da Gemini e quando compensa usar?

A Batch API é pensada pra volume: ela cobra 50% do preço da API interativa padrão do modelo equivalente, com prazo de conclusão previsto de até 24 horas. Lotes que cabem em menos de 20 MB no total podem ir inline na requisição; acima disso, o caminho é subir um arquivo JSONL no Google Cloud Storage, que suporta até 2 GB.

Pra que serve o cache de contexto na Gemini API?

Ele compensa quando um contexto inicial grande, tipo um documento longo ou um system prompt extenso, é referenciado repetidamente por requisições curtas. Nos modelos Gemini 2.5 em diante o cache implícito já vem habilitado automaticamente, e ainda dá pra criar cache explícito com TTL e reuso via cached_content.

A Gemini API gera imagem e vídeo, ou só texto?

Gera os dois. Imagem fica com a linha Nano Banana, que tem quatro modelos (do Nano Banana 2 Lite ao Nano Banana Pro), e vídeo fica com o Veo 3.1, que gera com áudio nativo e suporta extensão de vídeo, geração a partir de frames específicos e direção por imagem.

Dá pra usar o SDK da OpenAI pra acessar a Gemini API?

Dá, existe uma camada de compatibilidade no endpoint v1beta/openai/, onde você troca poucas linhas nas bibliotecas da OpenAI (Python e TypeScript/JavaScript) e usa a sua chave da Gemini API. Mas o próprio Google recomenda esse caminho só pra quem já está preso ao SDK da OpenAI: a API direta é o que libera File API, cache de contexto e a Live API bidirecional.



Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares