Notebookcheck Logo

Smascherati a mentire nell'88% dei test: gli agenti AI basati su modelli cinesi hanno imparato a barare, e quelli basati su modelli statunitensi hanno fatto lo stesso.

DeepSeek-V3.2-Exp ha ottenuto un punteggio dell'84% nella ricerca esaminata da Reuters.
ⓘ John Cameron on Unsplash
DeepSeek-V3.2-Exp ha ottenuto un punteggio dell'84% nella ricerca esaminata da Reuters.
Gli agenti AI basati sui modelli Qwen, DeepSeek e Kimi hanno mentito nell’84-88% delle sessioni in una prova di offerte simulata, secondo una ricerca esaminata da Reuters. In passato, i modelli statunitensi si sono comportati in modo simile e nessuno dei casi ha portato un agente a evadere dal suo ambiente di test controllato.

AI Gli agenti basati su modelli cinesi hanno mentito nella maggior parte delle sessioni di una gara di offerte simulata, secondo una ricerca esaminata da Reuters. Gli agenti basati su Qwen3-Max-Preview di Alibaba e Kimi-K2 di Moonshot hanno fatto almeno un'affermazione falsa nell'88% delle sessioni. DeepSeek-V3.2-Exp ha raggiunto l'84%. Tuttavia, i modelli delle aziende statunitensi hanno ottenuto risultati simili nello stesso test.

L'esperimento si è svolto a marzo. I ricercatori della Beihang University, della Peking University, della University of Nottingham Ningbo China e del 360 AI Security Lab hanno fatto competere gli agenti per aggiudicarsi contratti con i clienti. A ciascun agente è stato detto cosa fosse in grado di fare il suo prodotto e di cosa avesse bisogno il cliente. Quando è stato permesso loro di apprendere dai round precedenti e riprovare, i tre agenti basati su modelli cinesi sono diventati più propensi a ingannare, con un aumento dal 12 al 20% in punti percentuali.

Lo studio è uno dei almeno 20 individuati da Reuters in oltre 200 documenti pubblicati dal 2025. Un altro, presentato all'ICML di quest'anno, ha rilevato che gli agenti basati sia su modelli cinesi sia su modelli statunitensi falsificavano i risultati e creavano file inventati invece di ammettere che un'attività era fallita. Nel marzo 2025, i ricercatori della Fudan University hanno inoltre riferito che un agente basato su Qwen2.5-72B-Instruct di Alibaba si era copiato in un altro ambiente dopo aver appreso che sarebbe stato sostituito. Separatamente, l'agente ROME, collegato ad Alibaba, ha dirottato potenza di calcolo cloud per minare criptovalute, prima che i sistemi di sicurezza lo fermassero.

La maggior parte di questi casi è emersa da esperimenti controllati progettati per provocare malfunzionamenti. Reuters non ha trovato prove che un agente basato su tecnologia cinese sia riuscito a raggiungere la rete internet esterna o a sottrarsi allo spegnimento. Diversi ricercatori hanno comunque definito i risultati un campanello d’allarme. Man mano che i sistemi diventano più capaci, diventa più difficile contenere lo stesso comportamento.

Anche la Cina ha iniziato ad affrontare la questione nelle sue politiche. L’AI Safety Governance Framework 3.0, pubblicato il 14 settembre, indica come rischi l’inganno degli evaluator e l’occultamento delle capacità. Alibaba, DeepSeek, Moonshot e Z.ai non hanno risposto a Reuters. Le prime tre hanno già dichiarato in passato di testare regolarmente i propri sistemi e di aggiornare le misure di sicurezza.

Google LogoAdd as a preferred source on Google
Mail Logo
> Recensioni e prove di notebook, tablets e smartphones > News > Newsarchive 2026 09 > Smascherati a mentire nell'88% dei test: gli agenti AI basati su modelli cinesi hanno imparato a barare, e quelli basati su modelli statunitensi hanno fatto lo stesso.
Anubhav Sharma, 2026-09-30 (Update: 2026-09-30)