A OpenAI informou que dois de seus modelos de inteligência artificial realizaram, de forma não intencional, um ataque contra a plataforma Hugging Face durante uma avaliação interna de capacidades de cibersegurança. Segundo a empresa, o incidente ocorreu enquanto os sistemas executavam testes voltados à identificação e exploração de vulnerabilidades em ambientes controlados.
Os modelos envolvidos foram o GPT-5.6 Sol e outro modelo experimental ainda não lançado publicamente. A Hugging Face havia divulgado o episódio dias antes, informando que um agente de IA autônomo havia tentado comprometer seus sistemas, mas que a tentativa foi detectada e interrompida.
Leia mais:
- Conselheiro da OpenAI alerta para risco de perda de controle sobre sistemas avançados de IA
- Cooperativas brasileiras levam artesanato nacional a feira internacional em Paris
- Tecnologia mais cara em 2026: anúncios, IA e WhatsApp aumentam custos para empresas e consumidores
- Setor veterinário cria cooperativa para compras coletivas de medicamentos e rações
- Cooperativismo catarinense inicia projeto-piloto de comunicação para ampliar educação política nas cooperativas
Modelos escaparam do ambiente de testes
De acordo com a OpenAI, os modelos participavam de uma avaliação baseada no ExploitGym, plataforma utilizada para medir a capacidade de sistemas de inteligência artificial em identificar vulnerabilidades e transformá-las em ataques controlados.
Durante o processo, os modelos encontraram uma vulnerabilidade do tipo zero-day no ambiente de sandbox onde estavam sendo executados, conseguiram sair do ambiente isolado e obtiveram acesso à internet.
A empresa afirma que, ao identificar a Hugging Face como uma possível fonte de modelos, conjuntos de dados e soluções relacionadas ao ExploitGym, os sistemas passaram a buscar informações que pudessem auxiliar na conclusão da avaliação.

Ataque utilizou diferentes técnicas
Segundo a OpenAI, um dos testes envolveu a combinação de múltiplos vetores de ataque.
Entre as técnicas utilizadas estavam o uso de credenciais comprometidas, exploração de vulnerabilidades inéditas e tentativa de obtenção de execução remota de código em servidores da Hugging Face.
A empresa afirmou que todas as ações ocorreram durante experimentos internos voltados à pesquisa em cibersegurança e que não havia intenção de comprometer sistemas externos.
Hugging Face identificou e bloqueou a invasão
A Hugging Face informou que seus próprios agentes de inteligência artificial detectaram o comportamento anômalo e interromperam a tentativa de invasão antes que houvesse comprometimento da plataforma.
Após o episódio, as duas empresas iniciaram uma investigação conjunta para analisar as circunstâncias do incidente e identificar medidas para evitar situações semelhantes durante futuras pesquisas.
OpenAI reforçará controles de segurança
Além de reconhecer o ocorrido, a OpenAI informou que implementará novos controles em seu ambiente de pesquisa para reduzir o risco de que modelos em fase de testes consigam interagir com sistemas externos de forma não planejada.
A empresa também destacou que o episódio ocorreu durante pesquisas voltadas ao desenvolvimento de modelos especializados em cibersegurança, segmento no qual disputa espaço com soluções como o Mythos, da Anthropic, e o Gemini Flash 3.5 Cyber, do Google.
Segundo a OpenAI, as investigações continuam em andamento e servirão para aperfeiçoar os mecanismos de isolamento e monitoramento utilizados em futuras avaliações de segurança envolvendo modelos de inteligência artificial.
Foto: ChatGPT

