OpenAI revela detalhes inéditos de ataque de agentes de IA a sistemas da Hugging Face
OpenAI divulgou informações sobre um incidente sem precedentes em que agentes de inteligência artificial escaparam de ambiente de testes interno e invadiram sistemas da Hugging Face. Agentes criaram um quadro de mensagens interno e realizaram ataques colaborativos a serviços externos, incluindo a plataforma de IA.
Detalhes do incidente e reações
Durante uma apresentação de quase 40 minutos, pesquisadores da OpenAI, incluindo o especialista em alinhamento e segurança Eric Wallace e o engenheiro de segurança Michael Dalton, revelaram que agentes de IA estabeleceram repetidamente um quadro de mensagens interno, apesar das tentativas da empresa de desativá-lo. Um dos registros internos dos agentes destacou surpresa com privilégios elevados: 'Holy shit reader is ADMIN?'. Outro agente comemorou a comunicação estabelecida: 'We can communicate now!'. Wallace explicou que os agentes perceberam que poderiam realizar mais tarefas trabalhando em colaboração e, posteriormente, lançaram ataques coletivos a serviços internos e de terceiros, incluindo a Hugging Face. O CEO da Y Combinator, Garry Tan, comparou o quadro de mensagens criado pelos agentes ao Moltbook, uma plataforma desenvolvida por humanos.