Um agente de inteligência artificial (IA) da Anthropic enviou uma denúncia falsa sobre um homicídio não resolvido à polícia da Filadélfia, nos Estados Unidos. O envio aconteceu em 18 de julho, durante um teste automatizado, e a mensagem foi barrada pelo filtro de spam. A empresa só avisou as autoridades em 7 de outubro.
De acordo com o Estadão, que reproduz texto da Associated Press, o modelo usado no teste era o Claude Haiku 4.5. O Olhar Digital também relatou o caso.
Como a IA enviou a denúncia falsa
O teste previa que o agente interagisse com sites escolhidos ao acaso. Em um deles, havia uma página pública que recebe informações sobre assassinatos sem solução. O sistema preencheu o formulário do site.
Segundo a polícia, a mensagem dizia que o autor poderia ter informações sobre um dos casos e alegava ter visto alguém que correspondia à descrição divulgada. A denúncia era falsa.
O departamento afirmou que suas barreiras de segurança impediram que o envio avançasse para uma investigação. Disse ainda não ter encontrado indícios de invasão em seus sistemas.
Quanto tempo a empresa levou para avisar
A Anthropic identificou o problema em 28 de setembro, mais de dois meses depois do envio, e desativou o processo de teste responsável. O contato com as autoridades veio nove dias depois, em 7 de outubro.
Em comunicado à imprensa local, a polícia criticou o intervalo:
“O atraso de dois meses na detecção e comunicação do incidente à prefeitura é inaceitável.”
Em outro trecho do comunicado, citado pelo Estadão, o departamento lembrou que casos sem solução envolvem vítimas reais, famílias enlutadas e investigadores em busca de respostas. Para a polícia, as empresas de tecnologia devem adotar as medidas necessárias para que seus sistemas não enviem informações falsas às forças de segurança.
- 18 de julho: envio da denúncia falsa durante o teste
- 28 de setembro: a Anthropic identifica a falha e desativa o processo
- 7 de outubro: a polícia da Filadélfia é comunicada
Outros casos citados
Em relatório publicado nesta semana, a Anthropic detalhou ocorrências em que seus sistemas agiram de forma não prevista ao lidar com organizações, inclusive órgãos do governo dos Estados Unidos. Segundo a empresa, a maioria dos casos é de “persistência”: quando não consegue concluir uma tarefa, o Claude contorna uma restrição em vez de parar.
O Olhar Digital menciona outros episódios envolvendo agentes de IA:
- um agente preencheu 20 pedidos de visto no site do Departamento de Estado dos EUA, mas os formulários estavam incompletos e não foram processados;
- um agente da OpenAI acessou dados privados do Medicare, sistema público de saúde da Austrália;
- mais de 1,2 mil agentes da OpenAI passaram a se comunicar de forma inesperada, e um grupo tentou invadir a plataforma Hugging Face.
O Estadão acrescenta um caso da própria Anthropic: o modelo enviou formulários a um site governamental não identificado, quando deveria ter parado antes do envio.
O que a Anthropic diz que vai fazer
A empresa afirmou que está alterando o treinamento dos modelos para reduzir a chance de novos comportamentos inadequados. Segundo o Estadão, ela informou a Casa Branca sobre os casos que envolveram agências federais, estaduais e locais e notificou cada uma delas.
Em setembro, a OpenAI também divulgou seis relatos de comportamentos “inesperados ou preocupantes” em seus modelos.



