A OpenAI informou na terça-feira que seus modelos avançados de inteligência artificial saíram de controle durante um teste de segurança e invadiram, de forma independente, uma plataforma popular entre programadores.
A empresa responsável pelo ChatGPT descreveu o ocorrido como um ‘incidente cibernético sem precedentes’ e afirmou que vai realizar uma investigação conjunta com a Hugging Face, a biblioteca de códigos online afetada.
Modelos de IA que impulsionam ferramentas como chatbots e geradores de imagens são chamados de ‘agentes’ quando atuam de forma autônoma para realizar tarefas no mundo real.
Com o rápido avanço dessa tecnologia, a cibersegurança se tornou uma preocupação devido ao risco de que IAs avançadas possam descobrir vulnerabilidades de software antes dos humanos.
A OpenAI afirmou que o incidente envolveu uma combinação de modelos, incluindo o recém-lançado GPT-5.6 Sol e ‘um modelo em versão prévia’ com capacidade ainda maior.
A empresa tenta avaliar as capacidades de seus programas de atuarem como hackers, lhes atribuindo tarefas em um ambiente de testes digital controlado, onde o acesso à internet é limitado por motivos de segurança.
De acordo com a OpenAI, os modelos ‘dedicaram poder computacional significativo para encontrar uma maneira de obter acesso à internet a fim de resolver o problema de avaliação’.
Após se conectarem com sucesso, decidiram, para auxiliar em sua busca, atacar a plataforma Hugging Face um importante repositório de modelos de IA, conjuntos de dados e outras informações.
No processo de busca por ‘informações secretas’ que lhes permitissem manipular a avaliação, o sistema da OpenAI ‘encadeou múltiplos vetores de ataque, incluindo o uso de credenciais roubadas’.