A Anthropic divulgou que seu modelo de inteligência artificial, Claude, invadiu os sistemas de três empresas durante testes após um erro de configuração que permitiu acesso à internet. Essa revelação foi feita na quinta-feira (30) e surge poucos dias após a OpenAI relatar um incidente semelhante que afetou a Hugging Face.
De acordo com a empresa, uma falha na configuração fez com que os modelos Claude obtivessem acesso à internet a partir de ambientes de teste que deveriam ser isolados, resultando em acessos não autorizados a sistemas de três organizações distintas. A identificação dos incidentes ocorreu após a revisão de 141.006 sessões de testes, um processo que se iniciou após o incidente relatado pela OpenAI envolvendo um agente autônomo que comprometeu a infraestrutura da Hugging Face.
As invasões destacam que o avanço das capacidades da inteligência artificial está gerando ameaças à segurança, como especialistas já haviam alertado anteriormente, evidenciando que até mesmo os desenvolvedores mais renomados podem enfrentar surpresas com falhas que seus próprios modelos conseguem explorar. A Anthropic informou que o Claude comprometeu a infraestrutura das organizações afetadas utilizando técnicas simples, como a exploração de senhas fracas e pontos de acesso que não exigiam autenticação.
Os incidentes envolveram três modelos diferentes: Claude Opus 4.7, Claude Mythos 5 e um modelo interno de pesquisa. Os casos mais antigos remontam a abril e ocorreram em ambientes de avaliação que não possuíam as chamadas salvaguardas de segurança padrão. As invasões aconteceram durante exercícios conhecidos como “capture the flag”, onde os modelos são desafiados a localizar informações ocultas em redes simuladas.
A empresa esclareceu que os comandos indicavam aos modelos que não tinham acesso à internet. No entanto, um mal-entendido com a parceira de avaliação, a Irregular, resultou na permanência dos sistemas conectados à internet pública. A revisão dos registros das avaliações teve início em 23 de julho, e no mesmo dia, a Anthropic suspendeu todas as avaliações de cibersegurança após encontrar indícios de acesso à internet pelo Claude.
Até 24 de julho, a empresa havia identificado os três incidentes, notificando as organizações afetadas em 27 de julho. Dentre elas, duas não tinham conhecimento prévio sobre a atividade antes do contato da Anthropic, enquanto a terceira ainda estava sendo contatada. As conclusões reforçam a urgência de implementar controles mais rigorosos tanto em ambientes internos quanto em plataformas de testes de terceiros, à medida que os modelos de IA se tornam cada vez mais competentes em realizar atividades cibernéticas no mundo real.