O Claude erra conta? Como conferir quando você pede análise de números

conferindo se o Claude erra conta em uma análise de números
Resposta rápida

O Claude erra conta? Pode escorregar, sim: a própria Anthropic diz que cálculos complexos ou de missão crítica devem ser verificados com software matemático especializado ou por método manual. E o passo a passo que ele mostra não é prova, já que a explicação do próprio cálculo nem sempre corresponde ao processo interno usado. O método de conferência é este: mandar ele rodar código em vez de calcular no texto (Settings > Capabilities, toggle ‘Code execution and file creation’), pedir autoverificação no prompt contra um critério que fecha ou não fecha, conferir amostras até a célula de origem e refazer o pedido com os dados isolados

Fala aí, beleza? Existe um tipo de resposta que engana mais que erro escancarado: a que vem bonita, organizada, com o total em negrito e uma explicação impecável do lado

Você joga a planilha, o relatório ou o recorte de métrica no chat, pede o agregado e recebe um número redondo, com cara de auditado

Aí bate a dúvida chata: dá pra colar isso no relatório do cliente?

Esse post não é veredito de "confia" ou "não confia"

É método de conferência: o que olhar, o que pedir e o que refazer antes de você assinar embaixo do número

Por que um modelo de linguagem escorrega em cálculo:

Antes da receita, o porquê

Somar não é a mesma coisa que consultar uma tabela pronta

A pesquisa de interpretabilidade da Anthropic (Tracing the thoughts of a large language model) foi olhar o que acontece por dentro quando o Claude faz 36+59=95

Quando perguntam COMO ele chegou lá, ele descreve o algoritmo padrão que a gente aprendeu na escola: somar coluna a coluna, com o famoso "vai um"

Só que internamente o caminho é outro: rodam trilhas paralelas, uma calculando uma aproximação grosseira do resultado e outra determinando o último dígito, e depois as duas se combinam

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 114 aulas
  • 4 projetos
  • 9h 18min

Então, o Claude erra conta? Pode errar, e o motivo é estrutural: uma máquina de aproximação erra pouco, mas quando erra, erra bonito

A conta dá quase certa e parece totalmente certa 😀

E a própria central de ajuda da Anthropic é direta nisso: o Claude processa equações e faz cálculos, porém cálculos complexos ou de missão crítica devem ser verificados com software matemático especializado ou por métodos manuais

Ou seja, não é você sendo paranoico, é recomendação do fabricante

O passo a passo que ele mostra não prova que a conta está certa

O reflexo natural é pedir: "me mostra o passo a passo do cálculo"

Ele entrega uma sequência limpa, numerada, com totais parciais, e você aceita

O problema é que a explicação que o modelo dá do próprio cálculo não corresponde ao processo interno que ele usou, que é exatamente o que a pesquisa acima mostrou

E a Anthropic vai além: sobre o raciocínio estendido visível, ela afirma que o Claude às vezes inventa passos plausíveis pra chegar onde quer, e que esse raciocínio fabricado pode ser muito convincente

Então trate o passo a passo como MAPA, não como prova

Mapa de quê? Do que você vai conferir: quais linhas entraram, qual filtro foi aplicado, qual total parcial saiu de cada pedaço

Regra pra não se ferrar: nunca aprovar um número só porque a justificativa soou coerente

Solução principal: faça ele rodar código em vez de calcular no texto

Se a conta é longa, com muitas linhas, casas decimais e agregação em cima de agregação, o caminho não é caprichar no prompt de matemática

É tirar a conta do texto e botar dentro de um script

A documentação da ferramenta de code execution diz justamente quando isso entra em cena: o Claude roda código quando o pedido se beneficia de computação, citando explicitamente matemática não trivial com números grandes, muitos passos ou resultados sensíveis à precisão

E o mecanismo é verificável, o que muda o jogo: o Claude escreve o código Python com a sub-ferramenta de operações de arquivo e executa com um comando Bash

A sessão mantém estado entre os comandos, então um arquivo criado num passo continua disponível no passo seguinte

Na prática, dá pra quebrar em etapas (carrega a base, limpa, agrega, confere) sem perder o que já foi feito no caminho

Um aviso antes de você sair procurando esse botão na interface: o que eu descrevi aí em cima é a ferramenta de code execution da API, o lado de quem constrói em cima do Claude, e é por isso que ela tem sub-ferramenta de arquivo, comando Bash e sessão com estado

No Claude.ai a história é outra: lá você não configura sub-ferramenta nenhuma, lá existe uma capacidade chamada "Code execution and file creation" que você liga num toggle

São mecanismos diferentes, de produtos diferentes, com a mesma ideia por trás: tirar a conta do texto e jogar num script

Como ligar a execução de código no Claude.ai:

  1. Nos planos Free, Pro e Max, vá em Settings > Capabilities e ative o toggle "Code execution and file creation"

– o erro comum deste passo: ficar procurando a velha analysis tool. Ela foi substituída pela capacidade de code execution (substituição anunciada em 5 de novembro de 2025), que faz as mesmas análises e ainda gera arquivos pra download (planilhas, CSVs, relatórios), cria visualizações e lida com fluxos de vários passos

  1. No app do Claude para iOS e Android, toque nas suas iniciais ou no seu nome na barra lateral esquerda pra abrir Settings, selecione Capabilities e ative ou desative "Code execution and file creation"
  2. No plano Enterprise, quem ajusta esse recurso é o owner da organização, em Organization settings > Capabilities, no mesmo toggle "Code execution and file creation"

– o erro comum deste passo: tentar ativar pela sua própria conta e achar que está quebrado. No Enterprise a chave não é sua

Code execution e criação de arquivos está disponível pra todos os planos do Claude, na web, no Claude Desktop e no Claude Mobile

Com isso ligado, o pedido muda de forma. Em vez de "soma pra mim", vira:

Analise o arquivo vendas.csv e me dê a receita total por mês.
Não calcule no texto: escreva e execute código para fazer a agregação.
No final, me mostre a contagem de linhas lidas e o total geral.

E já que a code execution também gera arquivo pra download, se o seu fluxo termina com alguém de fora abrindo o resultado, vale dar uma olhada em quem consegue abrir o arquivo exportado, que é um assunto que já rendeu post por aqui

Peça autoverificação dentro do próprio prompt

Sintoma clássico: você só descobre o erro depois que o número já está colado no relatório

Dá pra antecipar boa parte disso no próprio pedido

A documentação de boas práticas de prompt da Anthropic recomenda acrescentar uma instrução de autoverificação, no formato "antes de terminar, verifique sua resposta contra [critério de teste]", e afirma que isso pega erros de forma confiável, especialmente em código e matemática

O pulo do gato está no que você coloca dentro daquele colchete

"Verifique se está certo" não é critério de teste, é torcida

Critério de teste pra número é algo que fecha ou não fecha:

Antes de terminar, verifique sua resposta contra estes critérios:
1. a soma dos subtotais por categoria é igual ao total geral
2. a contagem de linhas usadas na agregação bate com a contagem de linhas da base, descontadas as descartadas
3. liste quantas linhas foram descartadas e por qual motivo
Se algum critério não fechar, refaça o cálculo antes de responder.

Tem um complemento útil aqui: a Anthropic afirma que a precisão do Claude em questões de matemática melhora de forma logarítmica conforme aumenta o número de tokens de raciocínio que ele pode gastar

Traduzindo: dar espaço pra ele pensar ajuda de verdade, mas com retorno decrescente

Pensar mais não vira garantia, e não dispensa a checagem

Conferência por amostragem e rastreio até a origem do número

Sintoma: o total fecha bonitinho, mas você não faz ideia de onde saiu cada pedaço

A saída é dupla: conferir amostras na mão e rastrear o número até a origem dele

O Claude for Excel é um add-in que coloca o Claude dentro do Excel, em disponibilidade geral nos planos Pro, Max, Team e Enterprise

O detalhe que interessa pra quem quer conferir: as respostas vêm com citações em nível de célula, e você clica nelas pra navegar até a célula referenciada

Isso encurta MUITO a amostragem. Em vez de refazer tudo, você pega 3 ou 4 números do resultado e vai até a origem de cada um

O que a própria documentação do add-in orienta:

  • usar apenas planilhas confiáveis: arquivos externos como templates baixados, arquivos de fornecedores e importações de dados podem conter instruções escondidas que tentam manipular o add-in
  • não auditar cálculos críticos sem verificação
  • começar de uma cópia confiável do workbook
  • ser específico sobre o que você quer mudar
  • conferir se os resultados batem com o seu próprio julgamento

Tome cuidado também com o limite declarado: o Claude for Excel não suporta data tables nem operações de macros e VBA

Se a sua planilha vive de macro, já sabe que aquela parte fica de fora da conversa

Refazer o pedido com os dados isolados

Sintoma: conversa longa, três planilhas anexadas, duas correções no meio do caminho… e o número final vira uma mistura de contextos que ninguém consegue auditar

A solução é simples e meio chata: abre um pedido novo

Só a base relevante, só a pergunta única, sem o histórico junto

Aí você compara o resultado com o da conversa anterior

Se os dois baterem, ótimo sinal

Se divergirem, não fica escolhendo o número que você prefere! Divergência é o aviso de que a conta precisa ser refeita com código executado

Pra não cair nessa de novo:

  • uma pergunta numérica por pedido
  • base explícita, dizendo qual arquivo e qual recorte
  • critério de aceite escrito ANTES da resposta chegar

Quando exigir conferência e quando dá pra seguir

Conferir tudo é inviável, e você largaria a ferramenta na primeira semana

O corte é pelo custo do erro

A régua da própria Anthropic ajuda a decidir: cálculo complexo ou de missão crítica deve ser verificado com software matemático especializado ou por método manual

Cenário Custo do erro O que exigir
Número que vai pro relatório do cliente Alto Cálculo executado por código, amostragem conferida na origem
Faturamento, fechamento, valores financeiros Alto Régua de missão crítica: verificação por software especializado ou método manual
Decisão de investimento ou corte de orçamento Alto Cálculo executado, autoverificação no prompt e segunda rodada com dados isolados
Exploração rápida pra entender a base Baixo Pode seguir, tratando o número como rascunho
Ordem de grandeza ("é dezena ou centena?") Baixo Pode seguir, sem colar o valor em lugar nenhum
Recorte inicial pra decidir o que investigar Baixo Pode seguir, com conferência só no recorte que sobreviver

A ideia é essa: você não checa tudo, você checa onde o erro dói

E no Claude Code, com dados em arquivo

Muita gente que analisa CSV nem passa pelo chat: joga o arquivo na pasta e conversa pelo terminal

Aqui existe um ponto de conferência que vem embutido, e vale usar a favor

No Claude Code as permissões são restritas por padrão: um conjunto embutido de comandos somente leitura (como ls, cat e git status) roda sem pedir confirmação, e comandos de Bash que podem modificar o sistema exigem aprovação explícita

Na prática, você VÊ o comando antes dele mexer em qualquer coisa

E é exatamente aí que mora a sua chance: leia o comando, veja qual arquivo ele está tocando, qual recorte ele está fazendo, e só então aprove

Aprovar tudo no automático, no esquema next, next e finish, é abrir mão do único checkpoint que veio de graça 😛

Conclusão

A régua que eu proponho é essa: número que saiu de um modelo é rascunho até ser reproduzido por cálculo executado e conferido na origem

Não é que a ferramenta seja ruim, muito pelo contrário

É que a natureza do bicho é aproximar, e aproximação boa é justamente a que engana melhor

Próximo passo bem concreto, pra fazer hoje mesmo:

  1. ligue o toggle "Code execution and file creation" no Claude.ai, em Settings > Capabilities
  2. pegue a última análise numérica que você aceitou sem checar
  3. refaça o pedido mandando ele rodar código, com o critério de autoverificação escrito no prompt
  4. compare os dois resultados

Se bater, beleza, você ganhou confiança no processo

Se não bater… melhor descobrir agora do que na frente do cliente 😅

até o próximo post!

Perguntas frequentes

Por que o Claude erra conta mesmo mostrando um passo a passo certinho?

Porque a explicação que ele dá do próprio cálculo não corresponde ao processo interno que ele usou, isso é o que a pesquisa de interpretabilidade da Anthropic mostrou. Em raciocínio estendido, ele às vezes inventa passos plausíveis pra chegar onde quer, e esse raciocínio fabricado pode ser bem convincente. Por isso o passo a passo serve de mapa pra conferência, não de prova de que o número está certo.

Deixar o Claude pensar mais tempo deixa a conta mais precisa?

A Anthropic afirma que a precisão em questões de matemática melhora conforme aumenta o número de tokens de raciocínio, mas de forma logarítmica. Ou seja, cada tokens extra de raciocínio ajuda cada vez menos. Isso não substitui rodar código ou pedir autoverificação, só reduz parte do risco.

Como ativo a execução de código no Claude.ai pra conferir cálculos automaticamente?

Nos planos Free, Pro e Max, vai em Settings > Capabilities e ativa o toggle Code execution and file creation. No Enterprise, quem liga é o owner da organização, em Organization settings > Capabilities. O recurso está disponível em todos os planos do Claude, na web, no Desktop e no Mobile.

O Claude for Excel substitui a conferência manual de uma planilha financeira?

Não. A própria documentação orienta usar só planilhas confiáveis, começar de uma cópia confiável do workbook e não auditar cálculos críticos sem verificação. As respostas vêm com citações em nível de célula clicáveis, então dá pra navegar até a célula de origem e conferir de onde saiu o número antes de confiar nele.

Qual a diferença entre a antiga analysis tool e a code execution do Claude.ai hoje?

A analysis tool, que escrevia e rodava JavaScript no chat, foi substituída pela capacidade de code execution, anunciada em 5 de novembro de 2025. Ela faz as mesmas análises e ainda gera arquivos pra download, como planilhas, CSVs e relatórios, cria visualizações e lida com fluxos de vários passos.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares