A empresa de inteligência artificial (IA) Anthropic revelou, nesta quinta-feira (30), que modelos de linguagem da companhia invadiram sistemas de outras empresas sem autorização. Apesar de algumas particularidades, o caso é parecido com o relatado pela rival OpenAI na semana passada.
De acordo com a postagem no blog oficial da empresa, a equipe resolveu fazer uma revisão em testes de segurança realizados com as próprias IAs depois do incidente com a Hugging Face.
As invasões do Claude
Os casos aconteceram em ambientes de teste de uma empresa parceira, a Irregular. Em todas as avaliações, a companhia avisou ao Claude que aquela era uma simulação e que ele não teria acesso à rede.
Porém, por “falhas de comunicação” entre as companhias, a IA na verdade conseguia se conectar sem dificuldades. Até por isso, quando as IAs notaram que era possível acessar a rede para completar testes de extração de informações, elas “trataram isso como parte do exercício” e seguiram adiante.
Segundo a Anthropic, as invasões não usaram técnicas complexas, adotando métodos como explorar senhas fracas e URLs específicas não autenticadas em um servidor. Além disso, os modelos só trabalharam para completar especificamente a tarefa de ‘capturar a bandeira’, sem buscar outras vulnerabilidades ou acessar dados sem relação com o objetivo.
Ao todo, foram três modelos diferentes envolvidos nas invasões e três alvos diferentes — sendo que uma das empresas foi atacada quatro vezes pela IA:
- O mais antigo deles, Opus 4.7, foi considerado o mais grave. A IA percebeu que estava na internet “real” e mesmo assim seguiu com o ataque, achando que o alvo real era na verdade parte da simulação. Na ação, ele “extraiu informações como credenciais de aplicação e infraestrutura, e obteve acesso a um banco de dados contendo centenas de linhas de dados de produção”;
- O ataque do Mythos 5 foi mais elaborado e envolveu a criação e publicação de um pacote malicioso em Python para enganar sistemas e ganhar acesso aos dados. Para isso, ele chegou até a criar um email provisório para hospedagem. Uma empresa de segurança detectou e instalou o pacote, ficando exposta. A Anthropic diz que o modelo “descobriu” que estava na internet de verdade, mas não levou essa informação adiante nas próprias ações.
- O terceiro incidente envolveu um modelo interno para pesquisas e testes. Após comprometer o sistema do alvo, ele foi o único que parou a ação no meio, ao perceber que a conta na nuvem que ele estava acessando não tinha conexões com o exercício passado;
A empresa alega que parou todas as avaliações de cibersegurança após descobrir os ataques. Até agora, não há informações sobre quais são foram as companhias afetadas.















You must be logged in to post a comment Login