Pesquisar
Feche esta caixa de pesquisa.

PUBLICIDADE

De novo: IA Claude ‘escapa’ de teste e invade sistema de 3 empresas

A empresa de inteligência artificial (IA) Anthropic revelou, nesta quinta-feira (30), que modelos de linguagem da companhia invadiram sistemas de outras empresas sem autorização. Apesar de algumas particularidades, o caso é parecido com o relatado pela rival OpenAI na semana passada.

 

De acordo com a postagem no blog oficial da empresa, a equipe resolveu fazer uma revisão em testes de segurança realizados com as próprias IAs depois do incidente com a Hugging Face.

 

As invasões do Claude

 

Os casos aconteceram em ambientes de teste de uma empresa parceira, a Irregular. Em todas as avaliações, a companhia avisou ao Claude que aquela era uma simulação e que ele não teria acesso à rede.

 

Porém, por “falhas de comunicação” entre as companhias, a IA na verdade conseguia se conectar sem dificuldades. Até por isso, quando as IAs notaram que era possível acessar a rede para completar testes de extração de informações, elas “trataram isso como parte do exercício” e seguiram adiante.

 

Segundo a Anthropic, as invasões não usaram técnicas complexas, adotando métodos como explorar senhas fracas e URLs específicas não autenticadas em um servidor. Além disso, os modelos só trabalharam para completar especificamente a tarefa de ‘capturar a bandeira’, sem buscar outras vulnerabilidades ou acessar dados sem relação com o objetivo.

 

Ao todo, foram três modelos diferentes envolvidos nas invasões e três alvos diferentes — sendo que uma das empresas foi atacada quatro vezes pela IA:

 

  • O mais antigo deles, Opus 4.7, foi considerado o mais grave. A IA percebeu que estava na internet “real” e mesmo assim seguiu com o ataque, achando que o alvo real era na verdade parte da simulação. Na ação, ele “extraiu informações como credenciais de aplicação e infraestrutura, e obteve acesso a um banco de dados contendo centenas de linhas de dados de produção”;
  • O ataque do Mythos 5 foi mais elaborado e envolveu a criação e publicação de um pacote malicioso em Python para enganar sistemas e ganhar acesso aos dados. Para isso, ele chegou até a criar um email provisório para hospedagem. Uma empresa de segurança detectou e instalou o pacote, ficando exposta. A Anthropic diz que o modelo “descobriu” que estava na internet de verdade, mas não levou essa informação adiante nas próprias ações.
  • O terceiro incidente envolveu um modelo interno para pesquisas e testes. Após comprometer o sistema do alvo, ele foi o único que parou a ação no meio, ao perceber que a conta na nuvem que ele estava acessando não tinha conexões com o exercício passado;

 

A empresa alega que parou todas as avaliações de cibersegurança após descobrir os ataques. Até agora, não há informações sobre quais são foram as companhias afetadas.

COMENTE ABAIXO:

You must be logged in to post a comment Login

PUBLICIDADE