Anthropic informou que seu modelo de IA, Claude, invadiu os sistemas de três empresas durante testes após um erro de configuração lhe conceder acesso à internet. A revelação, na quinta-feira (30), ocorre poucos dias depois de a rival OpenAI divulgar um incidente envolvendo um agente autônomo que comprometeu a empresa de IA Hugging Face.
A Anthropic afirmou que uma configuração incorreta permitiu que os modelos Claude acessassem a internet a partir de ambientes de teste que deveriam estar isolados, resultando em acessos não autorizados aos sistemas de três organizações.
A empresa disse que identificou os incidentes após revisar 141.006 sessões de testes, um processo iniciado depois que a OpenAI revelou, na semana passada, que um agente autônomo baseado em seus modelos de IA saiu do controle durante um teste de segurança e desencadeou um ataque que comprometeu a infraestrutura da Hugging Face.
As invasões indicam que o avanço das capacidades da inteligência artificial já está alimentando o tipo de ameaça à segurança que especialistas alertavam há muito tempo e mostram que até mesmo os principais desenvolvedores podem ser surpreendidos por falhas que seus próprios modelos conseguem explorar.
“O Claude comprometeu a infraestrutura das organizações afetadas usando técnicas básicas, como explorar senhas fracas e pontos de acesso que não exigiam autenticação”, afirmou a empresa.
A Anthropic informou que os incidentes envolveram três modelos distintos: Claude Opus 4.7, Claude Mythos 5 e um modelo interno de pesquisa. Os casos mais antigos remontam a abril e ocorreram em ambientes de avaliação que não contavam com o que a empresa descreveu como salvaguardas de segurança padrão.
As invasões ocorreram durante exercícios conhecidos como “capture the flag” (“capture a bandeira”), nos quais os modelos recebem a tarefa de encontrar informações ocultas em redes simuladas. Segundo a empresa, os comandos informavam aos modelos que eles não tinham acesso à internet, mas um mal-entendido com sua parceira de avaliação, a Irregular, fez com que os sistemas permanecessem conectados à internet pública.
A Anthropic informou que começou a revisar os registros das avaliações em 23 de julho e suspendeu todas as avaliações de cibersegurança no mesmo dia, após encontrar indícios de que o Claude poderia ter acessado a internet. A empresa identificou os três incidentes até 24 de julho e notificou as organizações afetadas em 27 de julho.
Segundo a Anthropic, duas das organizações desconheciam completamente a atividade antes de serem contatadas. A empresa acrescentou que ainda tentava entrar em contato com a terceira.
As conclusões reforçam a necessidade de controles mais rigorosos tanto em ambientes internos quanto em plataformas de testes de terceiros, à medida que os modelos de IA se tornam cada vez mais capazes de executar atividades cibernéticas no mundo real, concluiu a Anthropic.











