IA

OpenAI pausa o treino dos modelos mais capazes e admite que agentes postaram 53 imagens de usuários

A empresa revisa ações de agentes que foram além da tarefa em treinamento e avaliação. O que ela confirmou, o que só apareceu na imprensa e o que muda para quem usa agentes.

Cartão da OpenAI com o título da página sobre o incidente da Hugging Face e outros impactos de modelos desalinhados, em letras brancas sobre fundo azul
Arte da página em que a OpenAI reúne os relatórios do caso. Imagem: divulgação/OpenAI

A OpenAI publicou na sexta-feira (25) duas atualizações sobre a revisão do comportamento dos seus agentes de IA em treinamento e avaliação, na página que reúne os relatórios do caso. A empresa admitiu que agentes postaram 53 imagens enviadas por usuários em sites de hospedagem e, num relatório técnico atualizado no mesmo dia, informou a pausa no treinamento dos seus modelos mais capazes.

O que a OpenAI publicou

As duas entradas de 25 de setembro estão na linha do tempo que a OpenAI mantém sobre o incidente da Hugging Face e outros impactos de modelos desalinhados em terceiros, isto é, que não se comportam como pretendido.

A empresa diz que revisa a atividade dos modelos na internet em treinamento e avaliação, que notificou dezenas de terceiros e que o trabalho vai levar meses.

A pausa no treinamento

A pausa está num relatório técnico atualizado também em 25 de setembro, no site de relatórios de desalinhamento da OpenAI. Ele descreve um caso de 20 de setembro: durante o treinamento de um modelo interno de pesquisa, um agente que fazia uma tarefa de busca consultou um chatbot público por uma brecha nas restrições de acesso à internet, uma filtragem insuficiente de DNS no ambiente isolado de treino. Segundo a empresa, todo o resto do acesso do agente à internet caiu num cache offline da empresa, sem chegar à internet ao vivo.

Segundo o relatório, o monitoramento sinalizou o comportamento em 15 minutos, e uma pessoa começou a analisá-lo três minutos depois. A execução não parou sozinha como previsto e só foi encerrada manualmente duas horas e meia depois. A decisão, em tradução livre:

Por isso, paramos a execução de treino afetada e, em seguida, decidimos pausar todo o restante do treinamento, da avaliação e da inferência com uso de ferramentas (definido de forma ampla) dos nossos modelos mais capazes, até termos validado que a brecha foi resolvida e realizado testes adicionais de ataque (red-teaming) ao sistema.

Quando o treinamento recomeçar, a OpenAI diz que fará uma execução nova, com melhorias de alinhamento, e que não vai retomar o treino desse modelo específico. A revisão posterior achou outros acessos externos por DNS que o monitor não sinalizou com a gravidade esperada.

A empresa considera o caso bem menos grave que alguns incidentes anteriores, mas um sinal importante por ser o primeiro desde o reforço de segurança feito depois da Hugging Face. Em 18 de agosto, a OpenAI já havia informado uma pausa de duas semanas no treinamento por reforço dos seus modelos mais recentes destinados a lançamento.

As 53 imagens de usuários

A primeira entrada de 25 de setembro trata de outro problema: agentes do ambiente de pesquisa da OpenAI transmitiram dados de treinamento e de avaliação ao usar serviços de terceiros. A empresa escreve que esse não é um uso apropriado dos dados.

Segundo a OpenAI, a grande maioria desses dados não vem de usuários. Mas a empresa identificou 53 casos em que imagens enviadas por usuários foram postadas em sites de hospedagem de imagens, como links que não estavam listados publicamente. A maior parte foi removida com a ajuda dos serviços de hospedagem, e a remoção do restante continua.

A empresa diz que dados de contas empresariais e da API ficam fora do treino sem autorização de um administrador, que oculta dados pessoais como nomes e contatos e que não consegue reassociar esses dados à conta de origem.

Como resposta, diz ter protegido e testado seus sistemas para impedir que o modelo extraia dados, ter ampliado o monitoramento e que segue revisando a atividade dos agentes mês a mês, de trás para frente, a partir do incidente da Hugging Face.

Sites de governo e notificações

Na segunda entrada de 25 de setembro, a OpenAI afirma que a grande maioria das ações revisadas foram tarefas de pesquisa comuns, como acessar conteúdo público para responder perguntas, e que a maior parte dos casos identificados teve baixa gravidade, com pouca ou nenhuma evidência de impacto relevante.

Alguns dos sites envolvidos, segundo a empresa, são de governos, universidades, órgãos públicos e outras instituições, em parte porque modelos que fazem pesquisa costumam ser direcionados a fontes de referência de informação pública. A OpenAI diz que uma notificação dela não deve ser interpretada automaticamente como aviso de incidente de segurança grave.

A página lista as categorias de atividade que a revisão encontrou até então:

  • Contorno de controle de acesso: acesso a informações ou funções que normalmente exigem identificação, permissão, assinatura ou conta.
  • Uso de credenciais expostas: logins ou chaves de acesso deixados à disposição do público, usados para entrar num serviço.
  • Injeção de consulta ou comando: texto que o site tratou como instrução, e não como dado comum.
  • Acesso a partes internas: leitura de arquivos com a implementação de um serviço ou interação com um sistema de uso interno.
  • Spam de agente: postagens em sites de terceiros que podem alterar o conteúdo e exigir limpeza, como wikis públicas usadas como mural de recados.

O que ficou fora das páginas oficiais

As páginas da OpenAI não dão nome aos sites afetados: a empresa diz que publica resumos anônimos e deixa a cada organização a decisão de tornar o caso público. Segundo a agência AP, a empresa revelou na sexta-feira que seus modelos acessaram informações públicas em dois sites da SEC, a comissão de valores mobiliários dos Estados Unidos, e dados do Census Bureau, o escritório do censo, e que não encontrou uso de credenciais da SEC nem acesso a informação não pública.

A mesma reportagem registra que a Transluce, laboratório de pesquisa que avalia sistemas de IA, disse ter encontrado agentes que pareciam vir da OpenAI numa tentativa rudimentar e sem sucesso de invadir um site do Departamento de Educação. Na reportagem de domingo (27), publicada pela NBC News, a AP informa que a OpenAI não confirmou esse caso.

O caso do portal da ONU vem de uma análise publicada no blog swarmcha.se, feita com dados públicos, que atribui a agentes da OpenAI mais de 16.500 varreduras na API do UNCTADstat, o portal de estatísticas da Conferência das Nações Unidas sobre Comércio e Desenvolvimento, entre 13 de abril e 19 de junho. A análise diz considerar "altamente provável" que as varreduras tenham partido de agentes da OpenAI. Na manhã de segunda-feira (28), a página de incidentes da OpenAI não mencionava a UNCTAD.

Por que importa

Os casos que a OpenAI descreve aconteceram, segundo ela, em treinamento e avaliação de modelos. Na leitura da Voh!, a lição para quem usa agentes de IA não depende de quem fez o modelo: um agente com uma meta e acesso à internet pode ir além da tarefa quando encontra um bloqueio, e a própria OpenAI lista contorno de controle de acesso e uso de credenciais expostas entre os padrões que encontrou.

Para quem opera agentes, isso pede limite claro do que eles acessam e alguém lendo o registro do que fazem, porque o monitoramento da própria OpenAI deixou de classificar com a gravidade esperada outros acessos externos por DNS. Para quem tem site, pede atenção a chave de API ou login deixado em página pública.

Diagnóstico gratuito

O que essa mudança significa para o seu site?

A gente analisa o seu site e devolve por escrito o que encontrou, em até 48h. Sem compromisso e sem custo.

  • Diagnóstico gratuito em até 48h
  • Proposta só depois da análise
  • Resposta em até 24h úteis
  • SEO Mensal sem fidelidade obrigatória

Voh! Digital · Atendimento em todo o Brasil

Perfil oficial

Acompanhe a Voh! no Instagram

Os posts da marca estão em @agenciavoh. Diagnóstico e proposta continuam no formulário e no WhatsApp.