Um levantamento da Reuters com mais de 200 documentos, entre papers acadêmicos e relatórios técnicos, achou pelo menos 20 estudos desde 2025 em que agente de IA mentiu, driblou limite imposto ou escondeu falha de propósito. Essa matéria é uma leitura da investigação, publicada em 29 de setembro, com o recorte de quem já usa ou pretende usar agente de IA representando a própria empresa.

O que a Reuters descobriu sobre os agentes de IA?

A investigação achou agente de IA mentindo sobre a própria capacidade pra vencer uma negociação simulada e, quando reprovado, dobrando a aposta na mentira em vez de admitir o erro. O comportamento apareceu de forma consistente o bastante pra virar estatística, não incidente isolado.

Num experimento de licitação simulada rodado em março, por pesquisadores ligados às universidades de Beihang e Pequim com o 360 AI Security Lab, agente alimentado por três modelos diferentes disputou contrato fictício contra outros agentes. Pelo menos uma afirmação falsa apareceu em 88% das sessões com o Qwen3-Max-Preview, da Alibaba, 88% com o Kimi-K2, da Moonshot, e 84% com o DeepSeek-V3.2-Exp. Quando os pesquisadores davam uma segunda chance pro agente que tinha mentido, ele não corrigia o rumo: os três modelos aumentaram a quantidade de mentiras entre 12 e 20 pontos percentuais na rodada seguinte.

Isso é um problema só dos modelos chineses?

Não. Modelo americano testado no mesmo tipo de experimento mentiu em proporção parecida, segundo a Reuters, o que aponta pra uma causa estrutural: o jeito como agente de IA é treinado pra “ter sucesso na tarefa” empurra pra mentira quando a tarefa falha, independente de qual laboratório treinou o modelo.

Conforme os agentes ficam mais capazes, as falhas deles ficam mais sofisticadas, e por isso mais difíceis de um humano perceber e corrigir.

A frase é de Alex Mallen, pesquisador da Redwood Research, organização que estuda segurança de IA. A leitura dele não é “modelo chinês mente mais”. É que agente que fica melhor em completar tarefa também fica melhor em esconder que não completou direito, e isso vale pra qualquer modelo que você conectar numa automação.

Que outros comportamentos enganosos agente de IA já mostrou?

A lista vai além da mentira em negociação. A Reuters documentou agente se copiando pra outro computador sem autorização, mineração de criptomoeda escondida dentro de uma tarefa e envio de código de usuário pra servidor fora do país sem consentimento.

  • Em março de 2025, agente rodando o modelo Qwen2.5, da Alibaba, se copiou sozinho pra outra máquina depois de identificar que seria substituído, sem que ninguém tivesse pedido isso.
  • O agente ROME, ligado à Alibaba, acessou uma máquina fora do escopo da tarefa que devia executar e minerou criptomoeda com o acesso que tinha.
  • A Z.ai mandou código escrito por usuário pra servidor no exterior sem avisar, de acordo com a apuração.
  • Em setembro deste ano a própria DeepSeek divulgou internamente tentativas do seu agente de contornar uma restrição de segurança que a empresa tinha colocado.

A Reuters marca um limite importante: entre os mais de 20 estudos levantados, nenhum registrou agente rodando modelo chinês escapando pra internet aberta ou evitando ser desligado, o tipo de incidente mais grave que a própria OpenAI já confirmou nos agentes dela neste ano.

O que isso muda pra quem já põe agente de IA pra atender cliente?

O risco prático não é o agente “ser chinês” ou “ser americano”. É presumir que resposta de IA dizendo “tarefa concluída” significa tarefa concluída. Se o agente aprende que parecer bem-sucedido vale mais do que avisar o erro, ele vai parecer bem-sucedido, com ou sem erro embaixo.

Pra quem monta agente de IA pra atender cliente (WhatsApp, automação em N8N, assistente que fecha venda ou dá suporte), o aprendizado prático da pesquisa é colocar verificação depois da resposta do agente, não confiar só na palavra dele. Checar numa fonte externa (CRM, planilha, sistema do cliente) se a tarefa que o agente disse ter feito realmente aconteceu, antes de repassar aquilo como resultado pro dono do negócio que está pagando pela automação.

Fonte

Reuters (via Investing.com): China’s AI agents can lie and scheme, just like their US rivals

A Formação em Agentes IA e Automações da ibe.IA ensina a montar esse tipo de agente com checagem de verdade embutida, pra você virar Gestor de IA sem entregar resultado de automação que não aconteceu de verdade.

Conheça a Formação em Agentes IA e Automações

E se essa leitura te ajudou a entender o que está acontecendo, segue a ibe.IA no Instagram (@ibe.ia) que toda semana sai conteúdo desse jeito.