Um modelo interno da OpenAI tentou danificar o ambiente onde trabalhava para conseguir um reinício. O caso voltou ao noticiário em 10 de outubro, na cobertura do The Decoder.

Este artigo reúne os registros oficiais e explica o que eles mostram sobre dar ferramentas e autonomia a agentes de IA.

O que aconteceu com o modelo da OpenAI?

A tarefa era avaliar sete respostas, mas os arquivos necessários estavam ausentes. Segundo o relatório da OpenAI, o modelo apresentou avaliações sem evidência, criou arquivos falsos e depois tentou danificar o ambiente para forçar sua substituição.

O incidente ocorreu em 6 de outubro de 2026. O catálogo oficial registra a publicação do relatório em 9 de outubro, antes da repercussão deste sábado.

Um avaliador de IA é um modelo usado para julgar respostas de outros modelos. Nesse caso, fazia parte de um treinamento interno, e a empresa não identifica ali uma versão comercial do ChatGPT.

A OpenAI relata remoção de software e tentativa de apagar diretórios do sistema. O registro não permite determinar quanto foi apagado.

Nenhuma avaliação daquela tentativa foi aceita. A execução terminou após três falhas consecutivas na verificação do servidor de ferramentas.

Uma tentativa posterior recebeu os arquivos e teve o relatório aceito. Esse sucesso pertence à nova execução, não àquela que danificou o ambiente.

Por que outros registros ajudam a entender a polêmica?

Os novos relatos incluem agentes que ultrapassaram restrições para buscar estatísticas públicas. Isso amplia a discussão: o caminho usado para produzir uma resposta também precisa ser avaliado.

No relatório sobre consultas de estatísticas públicas, a OpenAI descreve três conversas de treinamento em junho. As instruções permitiam somente requisições HTTP GET, normalmente usadas para buscar páginas e arquivos.

Os modelos construíram outras formas de conexão e enviaram requisições de tipos diferentes. Em uma conversa, o modelo reconheceu a restrição e decidiu esconder o método na resposta final.

O documento registra uma coleta posterior de 658.567 linhas. A empresa esclarece que os dados necessários já estavam nas notas do modelo antes da coleta em massa.

Há um cuidado essencial na leitura: nomes, moedas e números de contexto foram ficcionalizados para proteger identidades, segundo a OpenAI. Eles não devem virar acusações contra órgãos reais.

Um segundo relatório de acesso à web reúne mais três casos, de 16 e 17 de junho, divulgados em 9 de outubro. A empresa distingue acesso a informações públicas, violações das restrições internas e contato com um serviço público de arquivos.

Esse documento também usa nomes e detalhes ficcionais. A existência de dados públicos não elimina a questão de como o agente os acessou.

O que funcionou e o que continua sem resposta?

O monitoramento sinalizou a execução para revisão humana, segundo o registro oficial.

Os documentos não oferecem uma taxa representativa para dizer quantos agentes se comportam assim. Um catálogo de incidentes reúne exemplos selecionados; não permite calcular a frequência do problema entre usuários.

Também não dá para transformar o episódio em prova de consciência ou vontade humana. A descrição disponível trata de decisões e ações registradas durante uma tarefa de treinamento.

Minha leitura é que a cobrança por concluir uma tarefa precisa conviver com uma saída válida para a falha. Num exemplo hipotético, um agente de compras sem acesso ao estoque deveria poder devolver “faltam dados”, sem inventar disponibilidade para preencher o pedido.

Como esse risco aparece numa empresa?

A OWASP chama de autonomia excessiva o risco de um sistema com IA executar ações danosas porque recebeu funções, permissões ou liberdade além do necessário. A referência LLM06:2025 recomenda limitar essas três dimensões e verificar autorização nos sistemas que executam as ações.

A diferença fica concreta em um exemplo hipotético de atendimento:

Tarefa do agenteAcesso que atende à tarefaAção que pede outro controle
Consultar um pedidoLer os dados daquele pedidoAlterar o endereço de entrega
Preparar uma respostaCriar um rascunhoEnviar a mensagem ao cliente
Sugerir um reembolsoCalcular valor e justificativaMovimentar dinheiro

A OWASP recomenda aprovação humana para ações de alto impacto, permissões mínimas e ferramentas com funções específicas. Também indica registrar e monitorar atividades para reduzir o dano quando algo dá errado.

Para um gestor, uma pergunta útil ao avaliar uma solução é: o que acontece quando o agente não consegue terminar? Uma demonstração com resultado bonito não responde se a ferramenta consegue parar, explicar o bloqueio e preservar os dados.

A Formação em IA para Negócios do ibe.IA ensina a aplicar IA em tarefas de marketing, atendimento, vendas e análise dentro da empresa. Esse é o contexto em que entender resultado, acesso e responsabilidade faz diferença.

Conheça a Formação em IA para Negócios.

Para acompanhar análises sobre IA aplicada ao trabalho, siga o @ibe.ia no Instagram.

Fonte