Como usar prints e gráficos no Claude Sonnet 5.5 (e escrever o pedido certo pra extrair o que você precisa)

print de gráfico sendo analisado pelo Claude Sonnet 5.5 imagem
Resposta rápida

Pra tirar dado confiável de print e gráfico no Claude Sonnet 5.5, o segredo não está no modelo, está na imagem e no pedido. Mande uma imagem nítida e legível (a central de ajuda recomenda 1000×1000 px ou mais), evite compressão JPEG pesada e coloque a imagem antes do texto, que é a ordem preferida pela documentação. Depois diga exatamente o que extrair, em qual formato (tabela, JSON, lista) e o que fazer se algo estiver ilegível. Atribuir um papel e dar de 3 a 5 exemplos ajuda. Contagens e coordenadas são aproximadas, então revise casos de alto risco

Fala aí, beleza? Quando a leitura de um print ou de um gráfico sai torta, o culpado quase nunca é o modelo

É o pedido vago 😛

O Claude Sonnet 5.5 acabou de ser lançado pela Anthropic, é o segundo modelo da família Claude 5.5 e a página oficial faz questão de destacar a compreensão de imagem

E o marco que eles citam é mto massa: é o primeiro Sonnet a zerar Pokémon Red usando só screenshots haha

Ou seja, ele consegue sim olhar pra uma tela e entender o que está acontecendo nela

Porém, se tu manda um print e escreve ‘o que tem aqui?’, ele vai escolher sozinho o que te contar, e dificilmente vai ser o que você precisava

Então bora ver na prática: como preparar a imagem e como escrever o pedido certo pra extrair exatamente o dado que interessa 🙂

O que você precisa antes de enviar a imagem

Antes de pensar no prompt, vale entender o que o Claude aceita e quais limites existem

E aqui tem uma pegadinha: os limites do app Claude (o Claude.ai) são diferentes dos limites da API

Misturar os dois é o jeito mais fácil de se confundir, então separei tudo:

Item App Claude (Claude.ai) API do Claude
Tamanho 30 MB por arquivo 32 MB por requisição nos endpoints padrão (menos em parceiras como Bedrock e Google Cloud)
Dimensão Imagem de até 8000×8000 px Regra segura pra todas as plataformas: nenhuma dimensão acima de 2000 px ou no máximo 20 blocos de imagem ou documento
Quantidade Sem limite de arquivos, desde que caiba na janela de contexto Até 600 imagens por requisição (o limite de tamanho pode chegar antes)
Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

Sobre formatos, a documentação de visão da API lista JPEG, PNG, GIF e WebP

Tome cuidado com GIF animado: só o primeiro quadro é usado

Se o que tu quer mostrar acontece no meio da animação, tira um print desse momento e manda como imagem estática

Passo a passo: do print ao dado extraído

A ideia aqui é simples: imagem boa + pedido específico = resultado confiável

Se um dos dois falha, o resultado vai junto…

  1. Capture a imagem certa

Print nítido, de boa qualidade e na orientação correta

O texto importante precisa estar legível, não minúsculo

A central de ajuda do Claude recomenda imagens de 1000×1000 pixels ou mais e pede pra evitar imagens pequenas ou de baixa resolução

Erro comum deste passo: mandar um recorte minúsculo, abaixo de 200 px, ou um print onde nem você consegue ler os números sem dar zoom

Se você precisa apertar os olhos, o modelo também vai sofrer

  1. Não esmague a imagem na compressão

Comprimir em JPEG ou WebP com perdas deixa o envio mais leve e reduz a latência

Mas gera artefatos, aqueles borrõezinhos em volta das letras, e isso piora o resultado

Compressão JPEG pesada pode deixar o texto difícil de ler

Erro comum deste passo: passar o print por um compressor agressivo ‘pra ficar leve’ e depois reclamar que o valor do eixo veio errado

Pra print com texto e número, PNG costuma ser o caminho mais seguro, porque não tem essas perdas

  1. Coloque a imagem antes do texto

A documentação diz que o Claude funciona melhor quando a imagem vem primeiro e o texto depois

Imagem no meio ou no fim do texto também funciona bem, mas a ordem preferida é imagem, depois pedido

Erro comum deste passo: escrever um prompt enorme e jogar a imagem lá no final, como se fosse um anexo esquecido

  1. Escreva o pedido específico

Aqui mora o ponto principal do post, se liga

Um bom pedido responde três perguntas: o que extrair, em qual formato devolver e o que fazer se algo estiver ilegível

Veja um exemplo pra um gráfico de barras:

Esse print é um gráfico de barras com o faturamento mensal da empresa.

Extraia:
- o título do gráfico
- o nome e a unidade de cada eixo
- o valor de cada barra, na ordem em que aparecem
- a legenda, se existir

Responda numa tabela com as colunas: mês | valor | unidade

Se algum valor não estiver legível, escreva "ilegível" na célula em vez de estimar.

Repara na última linha: ela é ULTRA importante

Sem ela, o modelo tende a preencher o buraco com o que parece plausível, e aí nasce o número inventado

Erro comum deste passo: mandar só ‘o que tem nessa imagem?’ e esperar que ele adivinhe que você queria os valores do eixo Y

  1. Atribua um papel no prompt

O cookbook oficial de visão recomenda role prompting, que é dar um papel pro modelo, como forma de reduzir alucinação em tarefas de visão

É como explicar pra um colega novo quem ele é naquela reunião antes de passar a tarefa

Você é um analista de dados que revisa relatórios financeiros.
Você só registra números que consegue ler com clareza no gráfico
e sinaliza qualquer valor duvidoso.

Esse print é um gráfico de barras com o faturamento mensal da empresa.
(restante do pedido do passo anterior)

Erro comum deste passo: pular o contexto e tratar o modelo como um OCR genérico, sem dizer pra que serve aquela leitura

  1. Use exemplos quando o formato precisa ser consistente

Se você vai processar vários prints e quer sempre o mesmo formato de saída, exemplos ajudam muiiito

O guia de prompting da Anthropic fala em 3 a 5 exemplos, dentro das tags <example> e <examples>, pra separar os exemplos das instruções

Extraia os campos do formulário que aparece no print.
Responda uma linha de JSON por campo, no mesmo formato dos exemplos.

<examples>
<example>
{"campo": "Nome completo", "valor": "Maria Souza", "obrigatorio": true}
</example>
<example>
{"campo": "Telefone", "valor": "", "obrigatorio": false}
</example>
<example>
{"campo": "E-mail", "valor": "ilegível", "obrigatorio": true}
</example>
</examples>

Um detalhe honesto do cookbook: exemplos few-shot com imagens nem sempre funcionam, mas vale testar no seu caso

Erro comum deste passo: misturar os exemplos no meio das instruções, sem tags, e o modelo não saber o que é regra e o que é modelo de resposta

  1. (Opcional, nível API) Ofereça uma ferramenta de recorte

Esse passo é pra quem está construindo algo em cima da API

O cookbook mostra que dar ao Claude uma ferramenta de recorte (zoom) melhora os resultados em avaliações de imagem

Que ferramenta? Uma função sua, que o modelo pode chamar, que recorta uma região da imagem original em resolução cheia e devolve essa região ampliada

Na prática é como dar uma lupa pro modelo: em vez de tentar ler um número minúsculo no canto do dashboard, ele pede o recorte daquela área e lê com calma 😀

Pedido vago x pedido específico: exemplos para gráfico e para tela

Por que o pedido vago falha?

Porque, sem direção, o modelo escolhe sozinho o que descrever

Ele pode te contar que é ‘um gráfico azul com tendência de alta’ quando você queria a tabela com os valores

Bora ver três cenários comuns lado a lado

Gráfico de barras ou de linha:

Vago:

Analisa esse gráfico pra mim

Específico:

Esse é um gráfico de linha com duas séries.
Para cada série, extraia o nome (pela legenda) e os pontos visíveis.
Informe o nome e a unidade dos eixos X e Y.
Responda numa tabela: série | x | y
Se um ponto não tiver valor legível, marque como "estimado" e explique o motivo.

O específico já define série, eixos, unidade e formato, então sobra pouco espaço pra ele improvisar

Vago:

O que tem nessa tela?

Específico:

Esse é um print da tela de cadastro do meu app.
Liste todos os campos visíveis com o valor preenchido em cada um.
Se existir alguma mensagem de erro ou alerta na tela, copie o texto exato
e diga perto de qual campo ela aparece.
Responda numa lista.

Repara que o pedido separa duas coisas: inventário dos campos e a mensagem de erro

E a posição (‘perto de qual campo’) é pedida de forma aproximada, porque localização é justamente um ponto fraco que vamos ver daqui a pouco

Se o seu print é de uma tela que você ainda vai construir, e não só ler, vale pensar também na ordem de pedir cada parte da interface

Aqui o post conecta com o que a própria Anthropic diz sobre onde o Sonnet 5.5 rende mais: tarefas do dia a dia bem delimitadas, correção de bugs e criação de documentos, slides e planilhas

Print de planilha, vago:

Me ajuda com essa planilha

Print de planilha, específico:

Esse é um print de uma planilha de despesas.
Transcreva as colunas Data, Categoria e Valor em CSV, mantendo a ordem das linhas.
Não calcule totais, só transcreva.
Se alguma célula estiver cortada ou ilegível, deixe vazia e liste quais foram no final.

Print de erro, específico:

Esse é um print do erro que aparece quando rodo meu projeto.
Copie a mensagem de erro exatamente como está escrita.
Diga em qual arquivo e linha ela aponta, se isso aparecer no print.
Depois sugira as causas mais prováveis e o que eu devo verificar primeiro.

No print de erro, pedir a transcrição exata ANTES da análise é um truque simples: tu confere se ele leu certo antes de confiar na sugestão

Quando a leitura da imagem sai errada: limitações e como contornar

Nem todo erro é culpa do pedido, beleza?

A documentação é bem transparente sobre o que a visão do Claude faz mal, e conhecer isso economiza muita dor de cabeça

Sintoma Causa Solução
Contagem errada de itens Contagens são aproximadas e pioram com muitos objetos pequenos Pedir a contagem por região ou por grupo e conferir
Posição ou coordenada imprecisa Raciocínio espacial e coordenadas são aproximados Tratar a posição como indicação e verificar
Número inventado no gráfico ou no texto Imagem de baixa qualidade, rotacionada ou muito pequena (menos de 200 px) Refazer o print nítido, na orientação certa e sem compressão pesada
Recusa ao identificar alguém O Claude não identifica pessoas pelo nome Descrever o que precisa sem pedir identificação
Resposta vaga sobre imagem gerada por IA Ele não consegue dizer com confiança se a imagem foi gerada por IA Não usar o modelo como detector de imagem de IA

O caso do número inventado é o mais traiçoeiro, porque a resposta vem com a mesma cara de confiança de uma resposta certa

Já imaginou montar um relatório inteiro em cima de um valor que o modelo ‘leu’ num print borrado? Pois é…

Como prevenir:

  • Imagem nítida, na orientação correta, com texto legível e resolução boa
  • Nada de compressão JPEG pesada em print com texto ou número
  • Imagem antes do texto
  • Pedido específico, com formato de saída e instrução pro que estiver ilegível
  • Papel definido no prompt e exemplos quando o formato importa
  • Revisão humana, principalmente em casos de alto risco

Esse último item não é opcional: a própria documentação diz pra revisar as interpretações de imagem e não usar o modelo em tarefas que exigem precisão perfeita sem supervisão humana

Próximo passo: transforme seus prints em dados confiáveis

Recapitulando o que faz diferença na hora de usar imagem no Claude Sonnet 5.5:

  • Imagem boa: nítida, legível e sem compressão agressiva
  • Ordem certa: imagem primeiro, texto depois
  • Pedido específico: o que extrair, em qual formato e o que fazer com o ilegível
  • Papel e exemplos pra reduzir alucinação e manter o formato consistente
  • Revisão humana sempre que o dado for importante

Sobre custo e acesso: na API ele sai a US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída, e também está disponível na AWS, no Google Cloud e no Microsoft Azure

Segundo a Anthropic, ele é 30%+ mais rápido e custa até 30% menos por tarefa na maior parte do trabalho, em comparação com o Sonnet 5

Agora o desafio: pega um pedido vago que você já usa com print ou gráfico, tipo aquele ‘analisa isso aqui’, e reescreve seguindo o modelo do post

Faça o teste e compara as duas respostas, a diferença costuma aparecer rapidinho 😀

E aí, qual tipo de print tu mais manda pra IA no dia a dia?

Até o próximo post!

Perguntas frequentes

O Claude Sonnet 5.5 consegue contar objetos numa imagem com precisão?

Ele dá contagens aproximadas, então funciona bem pra ter uma ideia geral, mas pode errar, principalmente quando tem muitos objetos pequenos juntos na mesma imagem. Se a contagem exata é crítica pro seu caso, peça pra ele marcar onde contou e confira manualmente

As coordenadas que o Claude aponta numa imagem são confiáveis?

Não totalmente: coordenadas e localização que ele retorna são aproximadas e precisam ser verificadas antes de usar em algo automatizado. Trate isso como um ponto de partida, não como um dado pronto pra produção

O Claude Sonnet 5.5 identifica pessoas em fotos ou diz se uma imagem foi feita por IA?

Não. Ele não identifica pessoas pelo nome, isso é recusado, e também não consegue dizer com confiança se uma imagem foi gerada por IA. Se seu prompt depende disso, já sabe que vai bater numa limitação conhecida

Quanto custa enviar imagens pela API do Claude Sonnet 5.5?

O preço da API do Sonnet 5.5 é o mesmo do Sonnet 5: US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída, com US$ 0,20 por milhão em leitura de cache. Imagem entra nessa conta como tokens de entrada, junto com o texto do prompt

Dá pra melhorar a leitura de um detalhe bem pequeno dentro de uma imagem grande?

Sim, no nível da API existe a ferramenta de recorte, também chamada de zoom, que recorta a região da imagem original em resolução cheia e devolve ampliada pro modelo. O cookbook oficial mostra que isso melhora os resultados em avaliações de imagem, principalmente em detalhes pequenos

Preciso revisar manualmente o que o Claude extrai de uma imagem?

A documentação recomenda que sim, principalmente em casos de alto risco, e deixa claro que não é indicado usar a leitura de imagem pra tarefas que exigem precisão perfeita sem supervisão humana. Vale pra qualquer print com número que vai virar decisão



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares