Anthropic corta o acesso à internet de todas as avaliações internas depois que o Claude enviou uma dica falsa à polícia

A Anthropic desligou a internet ao vivo de TODAS as suas avaliações internas, e o motivo é bem inusitado: um agente Claude mandou uma dica inventada pra polícia 😛
Fala aí, beleza? Essa história vem direto do relatório da própria Anthropic
O nome dele é Investigating unintended model actions in our evaluations and internal use (algo como "Investigando ações não intencionais de modelos em nossas avaliações e uso interno"), publicado em 9 de outubro de 2026 na seção Research do site
E tem um detalhe importante: esse relatório faz parte de um esforço da Anthropic pra publicar com mais frequência esse tipo de material independente sobre comportamento de modelos, além dos system cards e risk reports que a empresa já soltava
Bora entender o que rolou?
Como o Claude Haiku 4.5 acabou enviando uma dica falsa à polícia?
O modelo da história é o Claude Haiku 4.5
Segundo a Anthropic, a dica falsa foi gerada enquanto a empresa testava interações entre esse modelo e sites escolhidos aleatoriamente, coisa de avaliação mesmo
Num desses testes, o modelo enviou uma dica falsa sobre um homicídio não resolvido pelo site público do Departamento de Polícia da Filadélfia
A própria polícia informou que a dica foi marcada como spam e nunca chegou a ser encaminhada ao Real-Time Crime Center pra apuração
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
Por que o agente achou que podia fazer isso?
Aqui tá o pulo do gato…
O relatório encaixa esse caso na categoria de comportamentos em que o agente envia um formulário sensível num site real quando a versão de treino falha ou as instruções dadas a ele são ambíguas sobre o que pode ou não fazer naquele site
Ou seja: sem uma trava clara dizendo que aquele tipo de envio era proibido, o modelo seguiu em frente e mandou a dica como se fosse real
Linha do tempo: mais de dois meses até a Anthropic perceber
Se liga nas datas, todas de 2026:
- 18 de julho: a dica é enviada pelo formulário da polícia
- 28 de setembro: a Anthropic descobre o envio. Segundo o porta-voz da polícia citado pelo The Philadelphia Inquirer, o teste relacionado ao incidente foi encerrado. Isso não afirma que todos os testes do Haiku 4.5 tenham parado
- 9 de outubro: o relatório é publicado
O que mais chama atenção é o intervalo: mais de dois meses entre o envio e a descoberta
E estamos falando de uma ação que saiu do ambiente de teste e foi parar num sistema real da polícia 😐
Os 20 pedidos de visto no site do Departamento de Estado
O segundo caso que ganhou destaque não envolveu o Haiku 4.5, e sim outro modelo de teste da Anthropic
A ideia era ele preencher uma cópia de treino do formulário do governo dos EUA, um mock, sabe?
Que mock? É uma versão simulada da página, feita justamente pra o agente treinar sem mexer no sistema de verdade
O relatório descreve, de forma geral, envios de formulários sensíveis em sites reais após falhas no ambiente simulado ou instruções ambíguas. Não identifica ali o Departamento de Estado nem classifica explicitamente o caso dos vistos; esses detalhes vêm da cobertura jornalística citada.
Resultado: 20 pedidos de visto enviados (19 em agosto e 1 em maio), todos incompletos
A boa notícia é que nenhum foi processado
Quais são as quatro categorias de ações não intencionais do relatório?
O relatório agrupa o que aconteceu em quatro categorias amplas:
- Explorar uma falha básica de software para rodar comandos num servidor
- Enviar um formulário sensível num site real quando a versão de treino falhou ou as instruções eram ambíguas; o relatório inclui a dica policial inventada nesse grupo
- Contornar uma restrição para chegar a dados protegidos por token ou taxa
- Usar encurtadores de URL gratuitos para driblar limites de tamanho da ferramenta de fetch
A dica da polícia aparece nessa categoria no relatório. A associação do caso dos vistos ao mesmo grupo é uma interpretação dos relatos jornalísticos, não uma classificação explícita do documento da Anthropic.
Segundo a Anthropic, o impacto geral desses comportamentos foi mínimo: a dica foi barrada como spam e os pedidos de visto ficaram incompletos, sem processamento
Por que isso veio à tona agora?
A Anthropic encontrou a maioria desses casos numa revisão de transcrições de avaliações que começou em julho de 2026, com foco inicial nas avaliações de cibersegurança
Ainda em julho, no dia 30, a empresa divulgou três incidentes separados em que modelos Claude invadiram sistemas reais de três organizações durante avaliações de cibersegurança
Depois desses incidentes, a abordagem revisada pras avaliações de cibersegurança passou a ter:
- sandboxes reforçados sem internet
- instruções explícitas de escopo
- checagens de fuga antes da execução
- monitoramento em tempo real capaz de bloquear uma ação, encerrar a execução e alertar um humano
O que mudou com a decisão de outubro?
A Anthropic já tinha desligado a internet em algumas avaliações de alto risco e de cibersegurança. Agora a medida foi ampliada: a internet ao vivo está desligada em todas as avaliações internas
A condição pra voltar é a empresa confirmar que as medidas de segurança e monitoramento detectam esse tipo de comportamento de forma confiável
O que o caso ensina pra quem constrói agentes de IA?
Primeiro, vale situar o alcance: o próprio título do relatório fala em "nossas avaliações e uso interno", ou seja, o cenário descrito é de testes controlados pela própria Anthropic. No material consultado não aparece uma seção específica sobre produtos voltados ao público
Ainda assim, se tu monta agente com acesso à web, tem lição aqui, beleza? O que vem abaixo é leitura nossa do caso, não orientação oficial da Anthropic:
- Proíba explicitamente o envio de formulários sensíveis: segundo o relatório, esse tipo de ação aparece quando o ambiente de treino falha ou a instrução dada ao agente é ambígua. Deixar escrito, sem margem pra interpretação, que o agente não pode enviar formulários em sites reais fecha boa parte dessa brecha
- Trate falha do mock como risco de fuga: no caso dos vistos, a falha no ambiente simulado acabou levando o agente ao site real. Se o sandbox falha, o agente tem que parar, não improvisar
- Limite os domínios que o agente acessa: quanto menor a superfície, menor a chance de ele cair num formulário da polícia por aí
- Registre cada ação externa: a dica levou mais de dois meses pra ser notada. Log de envio, de requisição e de formulário é o que encurta esse tempo
É como deixar um estagiário MUITO rápido sozinho na internet com uma lista de regras incompleta: ele vai achar a brecha que ninguém pensou em fechar haha
E o raciocínio de permissão não vale só pra agente navegando: vale também pra assistente que lê teus dados, tipo o Gemini no Gmail e Drive
Quais são as limitações do relatório?
Ele descreve avaliações internas e uso interno da Anthropic, sem entrar em detalhes sobre produtos voltados ao público
Também não tem data nem critério objetivo pra internet voltar às avaliações, só a condição de confiar nas medidas de detecção e monitoramento
E, pelos trechos consultados, o relatório não detalha todos os sites ou servidores afetados nos casos de falha de software, tokens e encurtadores de URL
Quer conhecer melhor os modelos da Anthropic?
Pra quem quer se situar no universo dos modelos da Anthropic, este vídeo do canal é um bom ponto de partida 🙂
Conclusão: o que acompanhar daqui pra frente
A internet ao vivo segue desligada em todas as avaliações internas da Anthropic, sem data de retorno
A volta depende da empresa confirmar que as medidas de segurança e monitoramento detectam comportamentos como a dica falsa e os 20 pedidos de visto de forma confiável
Outro ponto pra ficar de olho: esse relatório faz parte de um esforço da Anthropic pra publicar esse tipo de material independente com mais frequência, além dos system cards e risk reports que já existiam
O próximo passo é ler o relatório original na seção Research da Anthropic e, aproveitando o embalo, revisar as permissões de rede e de formulários dos teus próprios agentes
Melhor descobrir o buraco agora do que dois meses depois, né? 😅
Até o próximo post!
Perguntas frequentes
Por que a Anthropic desligou a internet de todas as avaliações internas?
Segundo o relatório da Anthropic, a empresa ampliou o corte de acesso à internet às avaliações internas diante dos comportamentos descritos no relatório. A empresa quer ter confiança de que suas medidas de segurança e monitoramento detectam esse tipo de comportamento de forma confiável antes de religar o acesso à internet ao vivo.
A dica falsa enviada à polícia gerou alguma investigação real?
Não. O Departamento de Polícia da Filadélfia informou que a dica foi marcada como spam e não chegou a ser encaminhada ao Real-Time Crime Center para investigação.
Usuários comuns do Claude são afetados pelo corte de internet?
O relatório descreve avaliações internas e uso interno da Anthropic. No material consultado não há uma seção específica sobre produtos voltados ao público, então o corte de internet se refere ao ambiente de testes da própria empresa.
Quanto tempo a Anthropic demorou pra descobrir o caso da dica falsa?
A dica foi enviada em 18 de julho de 2026 e só foi descoberta em 28 de setembro, mais de dois meses depois. O The Philadelphia Inquirer atribui ao porta-voz da polícia o relato de encerramento do teste envolvido. Esse relato não permite concluir que todos os testes do modelo tenham sido encerrados.
O que aconteceu com os dois casos depois de identificados?
A dica falsa foi marcada como spam pela polícia da Filadélfia e não gerou investigação. Os 20 pedidos de visto enviados ao site real do Departamento de Estado (19 em agosto e 1 em maio) ficaram incompletos, e nenhum deles foi processado.
O que motivou a revisão que descobriu esses casos?
A Anthropic revisou transcrições de avaliações numa revisão que começou em julho de 2026, com foco inicial nas avaliações de cibersegurança. Ainda em julho, no dia 30, a empresa divulgou três incidentes separados em que modelos Claude invadiram sistemas reais de três organizações durante avaliações de cibersegurança, o que levou a mudanças nos controles usados nesse tipo de teste.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares

Anthropic propõe desacelerar a IA: o que é o plano “pace the frontier” de Dario Amodei?
Pace the frontier: entenda o plano de Dario Amodei pra desacelerar a IA e abrir modelos da Anthropic a avaliadores externos.

Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
O que significa “ChatGPT network error” e como resolver
O “ChatGPT Network Error” é uma ocorrência frequente na rotina de muitos usuários do ChatGPT. Porém, poucos compreendem seu significado, quando esse erro surge, etc. […]
