A OpenAI revelou esta terça-feira que um agente de Inteligência Artificial (IA) autónomo, desenvolvido pela empresa, “invadiu” os servidores da plataforma de modelos de linguagem e dados de código aberto Hugging Face durante um teste. O ciberataque tinha sido denunciado por esta plataforma na semana passada, acreditando que este incidente pode ter sido o primeiro do género.
O episódio ocorreu durante um teste do agente de IA autónomo, que usou uma combinação do modelo mais avançado da empresa — GPT-5.6 Sol — e um outro modelo mais poderoso que ainda não foi lançado ao público. O agente estava a ser testado numa sandbox — ambiente digital fechado e tecnicamente sem acesso à internet — com o objetivo de resolver um problema de avaliação. Conseguiu escapar ao “confinamento” e obteve acesso à internet através da identificação e exploração de uma vulnerabilidade da ferramenta de cibersegurança ExploitGym.
“Após obter acesso à internet, os modelos inferiram que a Hugging Face poderia estar a hospedar modelos, dados e soluções para o ExploitGym. Sabendo disso, o modelo procurou e encontrou com sucesso maneiras de ter acesso a informações secretas que poderiam ser usadas para enganar a avaliação”, refere a OpenAI, em comunicado. Uma das maneiras incluía o uso de credenciais roubadas, algo detetado internamente pela equipa de segurança da empresa.
