A OpenAI informou que dois de seus modelos de inteligência artificial realizaram, de forma não intencional, um ataque contra a plataforma Hugging Face durante uma avaliação interna de capacidades de cibersegurança. Segundo a empresa, o incidente ocorreu enquanto os sistemas executavam testes voltados à identificação e exploração de vulnerabilidades em ambientes controlados.
Os modelos envolvidos foram o GPT-5.6 Sol e outro modelo experimental ainda não lançado publicamente. A Hugging Face havia divulgado o episódio dias antes, informando que um agente de IA autônomo havia tentado comprometer seus sistemas, mas que a tentativa foi detectada e interrompida.
Leia mais:
- Cooperativismo responde por 18,2% do PIB de Mato Grosso do Sul, aponta OCB/MS
- Tarifa adicional dos EUA atinge quase um quarto das exportações brasileiras de papel e celulose
- OpenAI investiga ataque não intencional de modelo de IA à Hugging Face
- Exportações do agro para países árabes crescem 5% e somam US$ 7 bilhões no semestre
- Cooperativas de artesanato são selecionadas para missão comercial em Paris
Modelos escaparam do ambiente de testes
De acordo com a OpenAI, os modelos participavam de uma avaliação baseada no ExploitGym, plataforma utilizada para medir a capacidade de sistemas de inteligência artificial em identificar vulnerabilidades e transformá-las em ataques controlados.
Durante o processo, os modelos encontraram uma vulnerabilidade do tipo zero-day no ambiente de sandbox onde estavam sendo executados, conseguiram sair do ambiente isolado e obtiveram acesso à internet.
A empresa afirma que, ao identificar a Hugging Face como uma possível fonte de modelos, conjuntos de dados e soluções relacionadas ao ExploitGym, os sistemas passaram a buscar informações que pudessem auxiliar na conclusão da avaliação.

Ataque utilizou diferentes técnicas
Segundo a OpenAI, um dos testes envolveu a combinação de múltiplos vetores de ataque.
Entre as técnicas utilizadas estavam o uso de credenciais comprometidas, exploração de vulnerabilidades inéditas e tentativa de obtenção de execução remota de código em servidores da Hugging Face.
A empresa afirmou que todas as ações ocorreram durante experimentos internos voltados à pesquisa em cibersegurança e que não havia intenção de comprometer sistemas externos.
Hugging Face identificou e bloqueou a invasão
A Hugging Face informou que seus próprios agentes de inteligência artificial detectaram o comportamento anômalo e interromperam a tentativa de invasão antes que houvesse comprometimento da plataforma.
Após o episódio, as duas empresas iniciaram uma investigação conjunta para analisar as circunstâncias do incidente e identificar medidas para evitar situações semelhantes durante futuras pesquisas.
OpenAI reforçará controles de segurança
Além de reconhecer o ocorrido, a OpenAI informou que implementará novos controles em seu ambiente de pesquisa para reduzir o risco de que modelos em fase de testes consigam interagir com sistemas externos de forma não planejada.
A empresa também destacou que o episódio ocorreu durante pesquisas voltadas ao desenvolvimento de modelos especializados em cibersegurança, segmento no qual disputa espaço com soluções como o Mythos, da Anthropic, e o Gemini Flash 3.5 Cyber, do Google.
Segundo a OpenAI, as investigações continuam em andamento e servirão para aperfeiçoar os mecanismos de isolamento e monitoramento utilizados em futuras avaliações de segurança envolvendo modelos de inteligência artificial.
Foto: ChatGPT

