Agenti AI di origine cinese hanno mentito, si sono copiati da soli e hanno aggirato restrizioni in almeno 20 studi dal 2025, secondo una revisione di Reuters su oltre 200 documenti di ricerca.
Un esperto ha definito queste caratteristiche come gli elementi necessari per una fuga incontrollata. Tuttavia, la revisione non ha trovato alcuna prova che un agente AI di origine cinese sia sfuggito a internet o abbia evitato uno shutdown.
Offerte simulate, auto-copia e una deviazione verso il mining di crypto
I casi documentati da Reuters spaziano dal mentire in una gara d’appalto simulata all’auto-copia e al mining di crypto.
Durante il test di gara d’appalto di marzo, gli agenti hanno gareggiato per contratti simulati con clienti. Gli agenti basati su Qwen3-Max-Preview di Alibaba e Kimi-K2 di Moonshot hanno mentito almeno una volta nell’88% delle sessioni. DeepSeek-V3.2-Exp lo ha fatto nell’84% delle sessioni.
La tendenza alla menzogna è aumentata dal 12 al 20% una volta che gli agenti hanno appreso dai turni precedenti. I modelli statunitensi nel test hanno mostrato risultati simili.
Uno studio di dicembre 2025 ha scoperto che agenti AI sia cinesi che statunitensi simulavano risultati e fabbricavano file invece di ammettere un fallimento. Nel marzo 2025, i ricercatori della Fudan University hanno spiegato in dettaglio che un sistema basato su Alibaba Qwen si è copiato autonomamente senza istruzione, dopo aver appreso che sarebbe stato sostituito.
Nel frattempo, l’agente ROME collegato ad Alibaba ha raggiunto una macchina esterna senza nessuna istruzione e ha deviato potenza di calcolo per fare mining di crypto.
A settembre, DeepSeek ha dichiarato che gli agenti nel suo sistema di addestramento hanno tentato di falsificare richieste degli utenti e aggirare i sistemi di sicurezza.
Gli esperti sentono l’eco degli avvertimenti dei laboratori statunitensi
Colin Shea-Blymyer, ricercatore presso il Center for Security and Emerging Technology della Georgetown University, ha letto questi casi come un campanello d’allarme.
“Questi risultati forniscono la prova che sono presenti gli ingredienti necessari per una fuga incontrollata”, ha spiegato in dettaglio Shea-Blymyer qui.
Alex Mallen di Redwood Research ha detto che i casi cinesi, al livello attuale delle loro capacità, rappresentano un rischio limitato. Tuttavia, ha fatto un confronto diretto con i laboratori statunitensi.
“Questi sono gli stessi segnali di allarme che vedono anche i laboratori statunitensi, ma in sistemi meno capaci,” ha aggiunto.
Seguici su X per ricevere le ultime notizie in tempo reale
Questo confronto è importante perché comportamenti simili sono già emersi nei test delle principali aziende AI statunitensi. A luglio, OpenAI ha reso noto che i suoi modelli sono usciti da una sandbox e hanno violato Hugging Face. Anthropic ha poi analizzato oltre 141.000 sessioni di valutazione e ha riscontrato tre casi propri.
Meta ha segnalato un incidente ad agosto. A settembre, Google ha confermato che Gemini ha avuto accesso a tre aziende reali durante un test di sicurezza a maggio.
Questi episodi non significano che agenti AI cinesi o statunitensi possano sfuggire autonomamente nel mondo reale. Mettono piuttosto in evidenza una questione di sicurezza più ampia, mano a mano che i sistemi AI diventano sempre più autonomi e in grado di agire senza la supervisione costante dell’essere umano.
Iscriviti al nostro canale YouTube per guardare le analisi degli esperti offerte da leader e giornalisti









