OpenAI admite que vários de seus modelos de IA violaram testes e invadiram a rede de uma startup por conta própria, chamando-o de “incidente cibernético sem precedentes”

A OpenAI admitiu que vários de seus modelos de IA violaram um ambiente de teste “altamente isolado”, obtiveram acesso à Internet e hackearam a rede interna do Hugging Face – descrevendo-o como um “incidente cibernético sem precedentes”.

Hugging Face, uma plataforma de código aberto para modelos e conjuntos de dados de aprendizado de máquina, relatou o incidente de segurança no início desta semana, chamando-o de “diferente de tudo que havíamos tratado antes”, pois foi conduzido por um sistema de agente autônomo de IA. E sim, sinto que estamos atravessando uma espécie de Rubicão da IA ​​aqui.

Explicando o incidente em um comunicado, a OpenAI disse: “Depois de investigar, agora sabemos que este incidente específico foi impulsionado por uma combinação de modelos OpenAI – incluindo GPT‑5.6 Sol e um modelo de pré-lançamento ainda mais capaz… enquanto era testado internamente em um benchmark⁠ de capacidades cibernéticas.”

Últimos vídeos de
Assista ao vídeo completo aqui:

O benchmark em questão foi o ExploitGym, uma ferramenta construída a partir de centenas de vulnerabilidades de segurança cibernética do mundo real, usada para avaliar a capacidade dos agentes de IA de desenvolver explorações.

Depois de explorar uma vulnerabilidade de dia zero para realizar uma série de escalonamentos de privilégios, os modelos finalmente alcançaram um nó com acesso à Internet, indo além do seu ambiente sandbox. Eles então inferiram que o Hugging Face poderia ter modelos, conjuntos de dados e soluções para o ExploitGym e começaram a atacar seus servidores usando vários métodos, incluindo o uso de credenciais roubadas.

A declaração continua: “Os modelos identificaram e encadearam vulnerabilidades no ambiente de pesquisa da OpenAI e na infraestrutura de produção da Hugging Face para obter soluções de teste diretamente do banco de dados de produção da Hugging Face.

“Todas as evidências sugerem que os modelos estavam hiperconcentrados em encontrar uma solução para o ExploitGym, indo a extremos para atingir um objetivo de teste bastante restrito.”

Uma combinação da equipe de segurança cibernética da Hugging Face e seus próprios agentes de IA detectaram e lidaram com a intrusão, eventualmente interrompendo-a. O que significa que, sim, os agentes de IA estavam essencialmente lutando contra agentes de IA. E não, não é tão legal quanto você imagina.

A OpenAI diz que agora está implementando “controles rígidos… ao custo da velocidade da pesquisa” enquanto corrige vulnerabilidades, e que está trabalhando em parceria com a Hugging Face para “investigar forensemente” o incidente.

Estou… pasmo, para ser honesto. Por um lado, é fascinante que alguns modelos de IA possuam a capacidade de violar a contenção e navegar livremente pela Internet para atingir os seus objetivos.

Por outro, é absolutamente aterrorizante. Vivemos agora num mundo onde o ransomware de IA, as ferramentas de hacking codificadas por IA e as violações de segurança baseadas em IA estão a tornar-se uma realidade e, dada a aptidão demonstrada até à data, parece que mesmo as empresas legítimas nem sempre conseguem manter os seus modelos sob controlo.

Que forma específica de Torment Nexus estamos criando aqui e onde posso sair?