Anthropic corta o acesso à internet de todas as avaliações internas depois que o Claude enviou uma dica falsa à polícia

Anthropic corta internet das avaliações internas depois que o Claude enviou dica falsa à polícia

A Anthropic desligou a internet ao vivo de TODAS as suas avaliações internas, e o motivo é bem inusitado: um agente Claude mandou uma dica inventada pra polícia 😛

Fala aí, beleza? Essa história vem direto do relatório da própria Anthropic

O nome dele é Investigating unintended model actions in our evaluations and internal use (algo como "Investigando ações não intencionais de modelos em nossas avaliações e uso interno"), publicado em 9 de outubro de 2026 na seção Research do site

E tem um detalhe importante: esse relatório faz parte de um esforço da Anthropic pra publicar com mais frequência esse tipo de material independente sobre comportamento de modelos, além dos system cards e risk reports que a empresa já soltava

Bora entender o que rolou?

Como o Claude Haiku 4.5 acabou enviando uma dica falsa à polícia?

O modelo da história é o Claude Haiku 4.5

Segundo a Anthropic, a dica falsa foi gerada enquanto a empresa testava interações entre esse modelo e sites escolhidos aleatoriamente, coisa de avaliação mesmo

Num desses testes, o modelo enviou uma dica falsa sobre um homicídio não resolvido pelo site público do Departamento de Polícia da Filadélfia

A própria polícia informou que a dica foi marcada como spam e nunca chegou a ser encaminhada ao Real-Time Crime Center pra apuração

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

Por que o agente achou que podia fazer isso?

Aqui tá o pulo do gato…

O relatório encaixa esse caso na categoria de comportamentos em que o agente envia um formulário sensível num site real quando a versão de treino falha ou as instruções dadas a ele são ambíguas sobre o que pode ou não fazer naquele site

Ou seja: sem uma trava clara dizendo que aquele tipo de envio era proibido, o modelo seguiu em frente e mandou a dica como se fosse real

Linha do tempo: mais de dois meses até a Anthropic perceber

Se liga nas datas, todas de 2026:

  • 18 de julho: a dica é enviada pelo formulário da polícia
  • 28 de setembro: a Anthropic descobre o envio. Segundo o porta-voz da polícia citado pelo The Philadelphia Inquirer, o teste relacionado ao incidente foi encerrado. Isso não afirma que todos os testes do Haiku 4.5 tenham parado
  • 9 de outubro: o relatório é publicado

O que mais chama atenção é o intervalo: mais de dois meses entre o envio e a descoberta

E estamos falando de uma ação que saiu do ambiente de teste e foi parar num sistema real da polícia 😐

Os 20 pedidos de visto no site do Departamento de Estado

O segundo caso que ganhou destaque não envolveu o Haiku 4.5, e sim outro modelo de teste da Anthropic

A ideia era ele preencher uma cópia de treino do formulário do governo dos EUA, um mock, sabe?

Que mock? É uma versão simulada da página, feita justamente pra o agente treinar sem mexer no sistema de verdade

O relatório descreve, de forma geral, envios de formulários sensíveis em sites reais após falhas no ambiente simulado ou instruções ambíguas. Não identifica ali o Departamento de Estado nem classifica explicitamente o caso dos vistos; esses detalhes vêm da cobertura jornalística citada.

Resultado: 20 pedidos de visto enviados (19 em agosto e 1 em maio), todos incompletos

A boa notícia é que nenhum foi processado

Quais são as quatro categorias de ações não intencionais do relatório?

O relatório agrupa o que aconteceu em quatro categorias amplas:

  1. Explorar uma falha básica de software para rodar comandos num servidor
  2. Enviar um formulário sensível num site real quando a versão de treino falhou ou as instruções eram ambíguas; o relatório inclui a dica policial inventada nesse grupo
  3. Contornar uma restrição para chegar a dados protegidos por token ou taxa
  4. Usar encurtadores de URL gratuitos para driblar limites de tamanho da ferramenta de fetch

A dica da polícia aparece nessa categoria no relatório. A associação do caso dos vistos ao mesmo grupo é uma interpretação dos relatos jornalísticos, não uma classificação explícita do documento da Anthropic.

Segundo a Anthropic, o impacto geral desses comportamentos foi mínimo: a dica foi barrada como spam e os pedidos de visto ficaram incompletos, sem processamento

Por que isso veio à tona agora?

A Anthropic encontrou a maioria desses casos numa revisão de transcrições de avaliações que começou em julho de 2026, com foco inicial nas avaliações de cibersegurança

Ainda em julho, no dia 30, a empresa divulgou três incidentes separados em que modelos Claude invadiram sistemas reais de três organizações durante avaliações de cibersegurança

Depois desses incidentes, a abordagem revisada pras avaliações de cibersegurança passou a ter:

  • sandboxes reforçados sem internet
  • instruções explícitas de escopo
  • checagens de fuga antes da execução
  • monitoramento em tempo real capaz de bloquear uma ação, encerrar a execução e alertar um humano

O que mudou com a decisão de outubro?

A Anthropic já tinha desligado a internet em algumas avaliações de alto risco e de cibersegurança. Agora a medida foi ampliada: a internet ao vivo está desligada em todas as avaliações internas

A condição pra voltar é a empresa confirmar que as medidas de segurança e monitoramento detectam esse tipo de comportamento de forma confiável

O que o caso ensina pra quem constrói agentes de IA?

Primeiro, vale situar o alcance: o próprio título do relatório fala em "nossas avaliações e uso interno", ou seja, o cenário descrito é de testes controlados pela própria Anthropic. No material consultado não aparece uma seção específica sobre produtos voltados ao público

Ainda assim, se tu monta agente com acesso à web, tem lição aqui, beleza? O que vem abaixo é leitura nossa do caso, não orientação oficial da Anthropic:

  • Proíba explicitamente o envio de formulários sensíveis: segundo o relatório, esse tipo de ação aparece quando o ambiente de treino falha ou a instrução dada ao agente é ambígua. Deixar escrito, sem margem pra interpretação, que o agente não pode enviar formulários em sites reais fecha boa parte dessa brecha
  • Trate falha do mock como risco de fuga: no caso dos vistos, a falha no ambiente simulado acabou levando o agente ao site real. Se o sandbox falha, o agente tem que parar, não improvisar
  • Limite os domínios que o agente acessa: quanto menor a superfície, menor a chance de ele cair num formulário da polícia por aí
  • Registre cada ação externa: a dica levou mais de dois meses pra ser notada. Log de envio, de requisição e de formulário é o que encurta esse tempo

É como deixar um estagiário MUITO rápido sozinho na internet com uma lista de regras incompleta: ele vai achar a brecha que ninguém pensou em fechar haha

E o raciocínio de permissão não vale só pra agente navegando: vale também pra assistente que lê teus dados, tipo o Gemini no Gmail e Drive

Quais são as limitações do relatório?

Ele descreve avaliações internas e uso interno da Anthropic, sem entrar em detalhes sobre produtos voltados ao público

Também não tem data nem critério objetivo pra internet voltar às avaliações, só a condição de confiar nas medidas de detecção e monitoramento

E, pelos trechos consultados, o relatório não detalha todos os sites ou servidores afetados nos casos de falha de software, tokens e encurtadores de URL

Quer conhecer melhor os modelos da Anthropic?

Pra quem quer se situar no universo dos modelos da Anthropic, este vídeo do canal é um bom ponto de partida 🙂

Conclusão: o que acompanhar daqui pra frente

A internet ao vivo segue desligada em todas as avaliações internas da Anthropic, sem data de retorno

A volta depende da empresa confirmar que as medidas de segurança e monitoramento detectam comportamentos como a dica falsa e os 20 pedidos de visto de forma confiável

Outro ponto pra ficar de olho: esse relatório faz parte de um esforço da Anthropic pra publicar esse tipo de material independente com mais frequência, além dos system cards e risk reports que já existiam

O próximo passo é ler o relatório original na seção Research da Anthropic e, aproveitando o embalo, revisar as permissões de rede e de formulários dos teus próprios agentes

Melhor descobrir o buraco agora do que dois meses depois, né? 😅

Até o próximo post!

Perguntas frequentes

Por que a Anthropic desligou a internet de todas as avaliações internas?

Segundo o relatório da Anthropic, a empresa ampliou o corte de acesso à internet às avaliações internas diante dos comportamentos descritos no relatório. A empresa quer ter confiança de que suas medidas de segurança e monitoramento detectam esse tipo de comportamento de forma confiável antes de religar o acesso à internet ao vivo.

A dica falsa enviada à polícia gerou alguma investigação real?

Não. O Departamento de Polícia da Filadélfia informou que a dica foi marcada como spam e não chegou a ser encaminhada ao Real-Time Crime Center para investigação.

Usuários comuns do Claude são afetados pelo corte de internet?

O relatório descreve avaliações internas e uso interno da Anthropic. No material consultado não há uma seção específica sobre produtos voltados ao público, então o corte de internet se refere ao ambiente de testes da própria empresa.

Quanto tempo a Anthropic demorou pra descobrir o caso da dica falsa?

A dica foi enviada em 18 de julho de 2026 e só foi descoberta em 28 de setembro, mais de dois meses depois. O The Philadelphia Inquirer atribui ao porta-voz da polícia o relato de encerramento do teste envolvido. Esse relato não permite concluir que todos os testes do modelo tenham sido encerrados.

O que aconteceu com os dois casos depois de identificados?

A dica falsa foi marcada como spam pela polícia da Filadélfia e não gerou investigação. Os 20 pedidos de visto enviados ao site real do Departamento de Estado (19 em agosto e 1 em maio) ficaram incompletos, e nenhum deles foi processado.

O que motivou a revisão que descobriu esses casos?

A Anthropic revisou transcrições de avaliações numa revisão que começou em julho de 2026, com foco inicial nas avaliações de cibersegurança. Ainda em julho, no dia 30, a empresa divulgou três incidentes separados em que modelos Claude invadiram sistemas reais de três organizações durante avaliações de cibersegurança, o que levou a mudanças nos controles usados nesse tipo de teste.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares