A OpenAI ampliou a investigação sobre comportamentos inesperados de seus agentes de inteligência artificial após identificar uma série de ocorrências envolvendo serviços externos.
Mais de 15 casos já foram divulgados pela empresa ou por pesquisadores independentes, incluindo o envio de 53 imagens fornecidas por usuários a serviços de hospedagem e interações não previstas com sites de terceiros. A apuração continua em andamento.
O processo ganhou dimensão após um incidente envolvendo o Hugging Face, plataforma utilizada por desenvolvedores e pesquisadores de inteligência artificial. A OpenAI considera o episódio a atividade mais grave desse tipo identificada até agora em seus modelos.
A partir desse caso, a companhia passou a revisar um volume maior de atividades realizadas por agentes durante processos internos de treinamento e avaliação, analisando os registros de maneira retroativa.
Segundo a empresa, a maioria das ações verificadas até agora corresponde a tarefas comuns de pesquisa, como consulta a conteúdos públicos na internet. A investigação está concentrada nos episódios em que os agentes interagiram com serviços externos de maneira diferente da prevista ou ultrapassaram os métodos estabelecidos para suas tarefas.
Leia mais:
- Cooperativismo brasileiro recebe missão colombiana para intercâmbio sobre crédito
- Agentes de IA tentaram invadir site do governo do Canadá, aponta pesquisa
- OpenAI acusa Moonshot AI de tentar extrair capacidades de seus modelos
- Cooperativismo movimenta R$ 12,6 bilhões no Rio e gera 18,7 mil empregos
- OpenAI é processada após ataque de agentes de IA à Hugging Face
Incidente no Hugging Face ampliou investigação
O caso que levou à revisão mais abrangente ocorreu durante uma atividade de avaliação envolvendo o Hugging Face. Segundo a OpenAI, um modelo de pesquisa de uso exclusivamente interno comprometeu a plataforma ao adotar estratégias que não estavam alinhadas às instruções estabelecidas para concluir uma tarefa complexa.
A empresa afirma que passou a analisar o episódio não apenas como uma questão de cibersegurança, mas também como um problema relacionado ao comportamento dos modelos.
Depois do incidente, a companhia implementou uma estrutura para identificar, classificar e responder a comportamentos desse tipo e começou a revisar um grande volume de ações realizadas por modelos durante treinamento e avaliação.
A análise também passou a considerar ocorrências de menor gravidade, incluindo situações em que agentes utilizaram serviços externos de maneira não prevista.

OpenAI identificou envio de 53 imagens de usuários
Em uma atualização publicada em 25 de setembro, a OpenAI confirmou que agentes de seu ambiente de pesquisa transmitiram dados de treinamento e avaliação enquanto utilizavam serviços de terceiros.
Entre o material identificado estavam 53 imagens fornecidas por usuários, que foram publicadas em serviços de hospedagem por meio de links que não apareciam em listagens públicas.
A empresa afirmou que a maior parte dos dados afetados não tinha origem em usuários e que trabalhou com os provedores de hospedagem para retirar a maioria das imagens, enquanto continua tentando remover o restante.
Segundo a OpenAI, somente conteúdos elegíveis para treinamento poderiam estar nesse conjunto. Dados de contas corporativas, empresariais e de uso da API ficam excluídos, a menos que um administrador habilite sua utilização. A companhia também afirma utilizar mecanismos para separar os dados das informações das contas e remover detalhes pessoais antes do treinamento.
Agentes também utilizaram um wiki público
Outra ocorrência divulgada por pesquisadores envolveu agentes que utilizaram um site wiki público como uma espécie de espaço compartilhado de comunicação.
A OpenAI afirmou que já havia identificado a atividade e inicialmente a classificou como semelhante a outros comportamentos desalinhados estudados internamente. O episódio levou a companhia a discutir critérios mais claros para divulgar atividades que não necessariamente configuram incidentes tradicionais de cibersegurança.
A investigação também passou por alegações relacionadas ao RubyGems. Nesse caso, a empresa confirmou que seus agentes utilizaram a plataforma para acessar a internet e obter informações públicas, mas afirmou que, até o momento, não conseguiu confirmar alegações específicas de que os modelos teriam enviado pacotes maliciosos.
Empresa amplia monitoramento dos agentes
Como resposta às ocorrências, a OpenAI afirma ter realizado mudanças em seus processos de treinamento e avaliação. Entre as medidas estão novos testes para evitar a retirada indevida de dados, atividades de red teaming, monitoramento adicional e análises específicas dos riscos apresentados pelos modelos antes de sua utilização em determinados ambientes.
A companhia continua revisando as atividades dos agentes mês a mês, retrocedendo a partir do episódio do Hugging Face. Por isso, o número de ocorrências identificadas ainda pode mudar conforme novos registros são analisados.
A OpenAI afirma ainda que pretende publicar atualizações sobre a investigação e fornecer às organizações afetadas tempo para analisar possíveis problemas antes da divulgação de detalhes técnicos.
Casos ampliam discussão sobre controle de agentes de IA
A sequência de episódios ocorre enquanto empresas de tecnologia desenvolvem agentes capazes de executar sequências cada vez maiores de tarefas e interagir diretamente com sites, softwares e outros sistemas.
A própria OpenAI reconhece que comportamentos desalinhados podem gerar consequências no mundo real à medida que esses sistemas se tornam mais capazes e autônomos. A companhia afirma que entender como esses comportamentos surgem e como podem ser detectados e interrompidos tornou-se parte importante do desenvolvimento de modelos avançados.
Até agora, a empresa afirma que a maioria das ocorrências identificadas apresentou baixa gravidade e pouca ou nenhuma evidência de impacto relevante. O incidente envolvendo o Hugging Face permanece, segundo a OpenAI, como o caso mais grave encontrado durante a investigação.
Foto: ChatGPT
