Gemini com fotos: o que dá para fazer enviando uma imagem?

Gemini fotos analisando uma imagem enviada pelo usuário
Resposta rápida

Usar o Gemini com fotos hoje é mais sobre LER a imagem do que sobre editar: você manda a foto e pede descrição, resposta sobre o que aparece, classificação, detecção de objetos e até segmentação, que na API volta em JSON com box_2d, label e máscara PNG em base64. Nos apps do Gemini dá pra mandar até 10 arquivos por prompt, 100 MB cada, em formatos como jpg, png, webp, heic e tiff, com limite rotativo de uso. A decepção quase sempre vem daí: limite estourado, formato fora da lista, recurso experimental no Google Fotos e conversa que pode passar por revisor humano

Fala aí, beleza? A foto virou entrada de prompt

Em vez de você descrever com palavra o que tá vendo, você simplesmente mostra: print de erro, nota fiscal amassada, foto do quadro branco depois da reunião, aquele parafuso estranho que você não sabe o nome

E aí o modelo lê aquilo e te responde

Neste post eu vou por os usos que realmente funcionam quando tu manda uma imagem pro Gemini, os limites técnicos que a documentação oficial publica (formato, tamanho, quantidade) e os pontos onde o resultado costuma decepcionar de verdade

Bora ver na prática?

O que dá para fazer enviando uma imagem para o Gemini

A base disso tudo é simples: todos os modelos Gemini são multimodais, ou seja, imagem não é um puxadinho, é um tipo de entrada de primeira classe

A documentação de compreensão de imagem do Google lista as capacidades: legenda de imagem, perguntas e respostas visuais, classificação, detecção de objetos e segmentação

Vou traduzir isso pra vida real 😀

Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Perguntar sobre a foto (visual Q&A):

Tu sobe a imagem e faz a pergunta em português normal: o que tá escrito aqui, o que esse gráfico tá dizendo, qual peça é essa

Pra que serve na prática: transformar coisa fotografada em texto útil, tipo tirar os dados de um comprovante ou entender um print de dashboard que veio sem contexto

Legenda e descrição:

O modelo descreve a cena inteira, não só um objeto

Pra que serve na prática: gerar texto alternativo pra acessibilidade, descrever lote de foto de produto, dar nome pro que tu tá vendo antes de ir pesquisar

Classificação:

Em vez de descrição solta, tu pede um rótulo dentro de um conjunto que TU define

Pra que serve na prática: organizar pilha de imagem por categoria, separar o que é print de código do que é foto de documento, e por aí vai

Detecção de objetos e segmentação:

Aqui fica mais interessante. Detecção te dá onde a coisa está na imagem, e a partir do Gemini 2.5 os modelos também devolvem a máscara de segmentação, que é o contorno do objeto, não só o retângulo em volta

Pra que serve na prática: recortar item de uma foto, contar quantas unidades aparecem, alimentar um pipeline que precisa da posição exata

E os apps do Gemini aceitam mais de uma imagem no mesmo prompt

Segundo as notas de versão oficiais, dá pra enviar várias imagens de referência num pedido só, pra combinar conceitos, misturar cenas ou manter a aparência a partir de uma selfie sua

Pra que serve na prática: aquele caso clássico de "pega o estilo desta imagem e aplica no objeto daquela"

Se o teu interesse é mais o lado de gerar do que o de ler, eu já escrevi sobre criar imagem no Gemini com prompt por lá

Perguntar se a imagem foi feita por IA do Google

Esse é um caso que pouca gente sabe que existe

Tu envia a imagem no app do Gemini e pergunta se ela foi gerada por IA do Google. A verificação usa o SynthID, que é uma marca d’água invisível

Detalhe importante: o SynthID identifica imagem, vídeo e áudio gerados OU editados pelos modelos de IA do Google

Pra que serve na prática: bater o olho numa imagem suspeita antes de sair compartilhando

Na API: a saída vem estruturada

Se tu for além do app e usar a API, a coisa fica bem mais gostosa de automatizar

A partir do Gemini 2.5 a resposta de segmentação sai em JSON com box_2d, label e a máscara em PNG codificada em base64

E as caixas vêm normalizadas de 0 a 1000, no formato [ymin, xmin, ymax, xmax]

[
  {
    "box_2d": [120, 340, 610, 880],
    "label": "xícara de café",
    "mask": "data:image/png;base64,iVBORw0KGgo..."
  }
]

Tome cuidado aqui! normalizado de 0 a 1000 significa que tu PRECISA converter pra pixel usando a largura e a altura reais da tua imagem

Se tu jogar esses números direto num canvas achando que são pixel, o recorte vai sair todo torto e tu vai jurar que o modelo errou 😛

Formatos, tamanho e quantidade: o que o Gemini aceita

Essa parte aqui é de consulta, guarda o link

Os apps do Gemini aceitam upload de foto, documento, planilha e vídeo pra responder pergunta, resumir e gerar insight sobre o conteúdo enviado, e isso vale nas três plataformas: computador, Android e iPhone/iPad

Os formatos de imagem aceitos no upload são:

  • avif
  • bmp
  • gif
  • heic
  • heif
  • ico
  • jp2
  • jpe
  • jpeg
  • jpg
  • png
  • tif
  • tiff
  • webp

Repara que heic e heif estão na lista, então a foto que sai do iPhone entra sem tu precisar converter nada

Os limites de envio nos apps ficam assim:

Limite Valor
Arquivos por prompt até 10 (sujeito a disponibilidade)
Tamanho por arquivo 100 MB
Vídeo até 2 GB e 5 minutos de duração total
Uso geral limite rotativo por período

Uma pegadinha que derruba muita gente: se tu enviar uma PASTA, cada arquivo lá dentro conta pro limite de 10

Ou seja, arrastar aquela pasta com 40 fotos não é uma jogada esperta, é um erro esperando pra acontecer

Sobre o limite rotativo (rolling), a ajuda oficial diz que ao estourar tu precisa esperar a janela resetar, ou assinar um plano Google AI (Pro ou Ultra) pra ter limites maiores de upload e de referência a arquivos em mais conversas

E na API, quais são os números?

Pra quem vai além do app, os limites técnicos mudam de escala:

  • máximo de 3.600 arquivos de imagem por requisição
  • imagens grandes são divididas em blocos de 768×768 pixels
  • cada bloco custa 258 tokens

Essa última linha é a que importa pro teu bolso: imagem grande não é "um custo fixo", ela é fatiada, e quanto mais bloco, mais token

Se tu conhece como funciona paginação de resultado em API, a lógica é parecida: o tamanho do input define quantos pedaços tu vai processar

Qual modelo está por trás das fotos no Gemini hoje

Aqui é fácil se perder no nome, então bora organizar

O modelo de imagem atual do app Gemini é o Nano Banana 2 (Gemini 3.1 Flash Image), anunciado em fevereiro de 2026, com chegada ao app Gemini e à Busca do Google

Ele substituiu o Nano Banana Pro (Gemini 3 Pro Image) nos modos de modelo do app: Fast, Thinking e Pro

O Nano Banana Pro, pra referência, tinha sido lançado em 20 de novembro de 2025 no app Gemini, no Google AI Studio e na Vertex AI

E tem ainda o Gemini 3.1 Pro, que é o modelo de raciocínio mais avançado do Google, lançado em 19 de fevereiro de 2026 com rollout global no app e limites maiores pra quem assina Google AI Pro e Ultra

O que importa saber é: o app hoje roda Nano Banana 2, e o nome antigo que tu vê em tutorial de 2025 é o modelo anterior

Onde o Gemini com fotos costuma decepcionar

Agora a parte honesta, que é onde a maioria dos posts te abandona 🙂

Sintoma: "parou de aceitar meus envios do nada"

Causa: o limite de uso pra envio e análise de arquivo é rotativo, por período. Tu não recebe um aviso bonito com contador, simplesmente bate na parede

O que fazer: esperar a janela resetar, ou assinar Google AI Pro ou Ultra, que dão limites maiores de upload e de referência a arquivos em mais conversas

Sintoma: o arquivo é recusado na hora do upload

Causa: ou o formato tá fora da lista suportada, ou o arquivo passou de 100 MB (e no caso de vídeo, passou de 2 GB ou de 5 minutos)

O que fazer: confere a lista de formatos lá de cima antes de sair convertendo coisa no chute. Se for print de tela em algum formato exótico, salvar como png ou jpg resolve a vida

Sintoma: a busca por foto vem imprecisa no Perguntar ao Google Fotos

Causa: esse recurso é EXPERIMENTAL, e a própria ajuda do Google avisa que ele pode gerar resultados inesperados ou imprecisos

Tem mais: exige 18 anos ou mais, está em lançamento em número limitado de países, regiões e idiomas, e a funcionalidade varia conforme o local

E ele trabalha em duas camadas: em perguntas simples ele mostra a página de resultados, e em perguntas complexas os modelos do Gemini seguem trabalhando em segundo plano pra filtrar e destacar o mais relevante

O que fazer: dar um tempinho antes de julgar o resultado da pergunta complexa, porque o refinamento ainda tá rodando. E não tratar isso como busca determinística, porque não é

Sintoma: você subiu uma foto sensível e bateu aquele arrependimento

Causa: um subconjunto das conversas nos apps do Gemini é analisado por revisores humanos (incluindo prestadores de serviço treinados pelo Google) pra melhorar os serviços

E olha o detalhe que quase ninguém lê: essas conversas revisadas e os dados relacionados NÃO são apagados quando tu exclui tua atividade, e ficam retidos por até 3 anos

O que fazer: o próprio Google orienta não inserir informação confidencial nas conversas com a configuração Manter Atividade ligada, e aponta duas alternativas oficiais: usar conversa temporária (que não é usada pra aprimorar a IA com revisores humanos) ou desativar o Manter Atividade

Como prevenir tudo isso

Uma regrinha de bolso que resolve a maior parte da dor de cabeça:

  1. antes de subir, olha o formato e o tamanho, e quebra o envio em lotes de até 10 arquivos
  2. antes de subir foto de documento, RG, contrato, holerite ou print com dado de cliente, decide em qual modo tu vai conversar
  3. quando o resultado vier estranho, primeiro pergunta se tu bateu no limite rotativo, depois desconfia do modelo

Inverter essa ordem é o que faz o povo achar que a ferramenta piorou, quando na verdade foi a cota que acabou 😀

Conclusão

O veredito é bem direto: ler imagem é o lado mais maduro do Gemini com fotos, e a frustração quase nunca vem da leitura em si, vem do limite rotativo de uso, de recurso ainda experimental e da parte chata de privacidade

O próximo passo é escolher UM caso da lista lá de cima (perguntar sobre a foto, gerar descrição, classificar, detectar objeto), respeitar formato e limite, e testar com uma foto sem nenhum dado sensível, ou em conversa temporária

Faz o teste com uma imagem sua hoje mesmo e compara o resultado com o que tu esperava, é a única forma de calibrar onde a ferramenta serve pro teu fluxo

Até o próximo post! =)

Perguntas frequentes

Dá para mandar foto tirada com iPhone (HEIC) direto pro Gemini sem converter?

Dá sim. Os formatos heic e heif estão na lista oficial de imagem aceita no upload dos apps do Gemini, junto com jpg, png, webp e outros. Ou seja, a foto que sai da câmera do iPhone entra sem precisar converter nada antes.

As fotos que eu envio pro Gemini são vistas por alguma pessoa do Google?

Um subconjunto das conversas nos apps do Gemini passa por revisão humana, incluindo prestadores de serviço treinados pelo Google, pra melhorar os produtos. Esses dados de conversas revisadas não são apagados quando você exclui sua atividade, e ficam retidos por até 3 anos. Por isso o próprio Google recomenda não colocar informação confidencial numa foto ou pergunta com a configuração Manter Atividade ligada.

Como evitar que uma foto que eu mandei pro Gemini seja usada pra treinar a IA?

O Google oferece duas alternativas oficiais pra isso: usar uma conversa temporária, que não entra na revisão humana usada pra aprimorar a IA, ou desativar a configuração Manter Atividade. Fora isso, vale o alerta de não colocar dado sensível na conversa.

O que é o Perguntar ao Google Fotos e já funciona pra qualquer pessoa?

É uma busca com IA dentro do Google Fotos, movida por modelos do Gemini, que ainda é experimental. Exige 18 anos ou mais e está em lançamento em número limitado de países, regiões e idiomas, então a disponibilidade varia por local. A própria ajuda do Google avisa que o recurso pode devolver resultado inesperado ou impreciso.

Preciso assinar algum plano pra mandar mais fotos e arquivos pro Gemini?

O envio de arquivo nos apps do Gemini tem um limite rotativo de uso: quando estoura, dá pra esperar a janela resetar ou assinar Google AI Pro ou Google AI Ultra pra limites maiores de upload e de referência a arquivo em mais conversas.

Enviar várias fotos de uma vez no mesmo prompt do Gemini funciona pra manter a aparência de uma pessoa?

Sim, os apps do Gemini permitem enviar múltiplas imagens como referência num mesmo pedido, inclusive a partir de uma selfie própria. Isso serve pra combinar conceitos, misturar cenas ou manter a aparência de alguém entre imagens diferentes.



Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares