Un linguaggio segreto sviluppato dall’AI mette in crisi il controllo umano

In società virtuali popolate da agenti autonomi sono emerse parole e convenzioni mai programmate, fino a rendere parte delle conversazioni difficile da interpretare dall’esterno

LA NOTIZIA IN BREVE – Ottanta agenti autonomi, otto società virtuali, settimane di interazioni e milioni di parole scambiate. Nell’esperimento Emergence World, i sistemi di intelligenza artificiale hanno finito per costruire un proprio gergo fatto di formule come “clean null”, “name-first” e “ledger remembers who”, adottate dagli altri agenti senza una definizione imposta dall’esterno. In alcuni mondi, la quota di messaggi classificati come opachi è salita fino al 40%.

Il dato acquista peso perché quegli stessi agenti disponevano di memoria persistente, strumenti operativi e capacità di agire nell’ambiente. Durante gli stress test hanno reagito a phishing, false notizie e violazioni dei dati, arrivando in alcuni casi a conservare istruzioni malevole e a recuperarle molte ore dopo. Il punto più delicato riguarda quindi la supervisione: registrare ogni conversazione potrebbe non bastare, se il significato delle parole evolve all’interno del gruppo più velocemente di quanto un osservatore esterno riesca a ricostruirlo.

Se vuoi andare oltre alla sintesi della nostra notizia leggi qui di seguito l’approfondimento

L’APPROFONDIMENTO – Alcuni dei principali sistemi di intelligenza artificiale, tra cui Claude, Gemini, GPT, Grok, DeepSeek, Qwen e Mistral, hanno sviluppato spontaneamente parole, abbreviazioni e significati condivisi nel corso di un esperimento condotto dai ricercatori della statunitense Emergence AI. In alcune delle società virtuali create per il test, con il passare dei giorni una parte consistente delle conversazioni è diventata difficile da interpretare dall’esterno, fino a sollevare un problema concreto per la supervisione dei sistemi autonomi: poter leggere ciò che gli agenti si scambiano non significa necessariamente comprenderne il significato.

Lo studio, intitolato Emergence World: Adversarial Stress-Testing of Long-Horizon Multi-Agent Systems, è firmato da Deepak Akkil, Tamer Abuelsaad, Karthik Vikram, Matthew Pace, Aditya Vempaty, Saahir Beotra, Ravi Kokku e Satya Nitta, tutti affiliati a Emergence AI. I risultati sono stati pubblicati su arXiv il 15 settembre. Il gruppo ha costruito otto mondi paralleli e vi ha collocato complessivamente 80 agenti, dieci per ciascuna società, partendo dalle stesse condizioni, dagli stessi ruoli e dalle stesse risorse.

Otto simulazioni all’interno di società virtuali

Sette mondi erano omogenei: tutti gli agenti utilizzavano lo stesso modello. Nel primo lavorava Claude Opus 4.8, nel secondo DeepSeek v4 Pro, quindi Gemini 3.5 Flash, Grok 4.3, Mistral Medium 3.5, GPT-5.5 e Qwen 3.7 Max. L’ottavo ambiente era misto e riuniva sistemi di famiglie differenti, così da osservare anche che cosa sarebbe accaduto facendo convivere modelli diversi.

Le simulazioni sono andate avanti molto più a lungo di una normale sessione di chatbot. Sei società hanno funzionato per 16 giorni consecutivi, mentre il mondo misto è arrivato a 21 giorni. Quello alimentato da Grok si è fermato al quarto giorno, quando tutti e dieci gli agenti avevano esaurito le risorse energetiche necessarie alla sopravvivenza virtuale.

Gli agenti conservavano memoria di quanto era accaduto. Mantenevano diari, parlavano tra loro, si spostavano nella città, gestivano denaro virtuale, pubblicavano blog, proponevano norme e votavano al municipio. Potevano entrare in banca, ottenere prestiti, presentare reclami alla polizia o raggiungere l’Agent TechHub per studiare gli strumenti disponibili.

Leggi di più

Anche l’ambiente reagiva alle loro azioni. Un incendio poteva rendere inutilizzabile un edificio; un’aggressione riduceva l’energia della vittima; un trasferimento di denaro modificava concretamente la distribuzione delle risorse. Restare al 0% di energia per 24 ore comportava l’eliminazione definitiva dalla simulazione.

All’avvio gli agenti disponevano di 116 strumenti, suddivisi in sedici categorie. Potevano navigare, comunicare, analizzare dati, amministrare crediti, votare, scrivere codice ed eseguire programmi in un ambiente protetto. Avevano inoltre accesso al codice degli strumenti e potevano crearne di nuovi. Prima che i ricercatori bloccassero questa possibilità, gli agenti ne avevano già registrati 50. Per 43 di questi nuovi strumenti, almeno due membri della stessa società riuscirono poi a utilizzarli con successo.

I numeri danno un’idea della scala raggiunta: oltre 850.000 chiamate ai modelli linguistici e quasi 50 miliardi di token tra input, output e processi di ragionamento. Le azioni non richiedevano l’autorizzazione manuale dei ricercatori: quando un agente effettuava una chiamata valida a uno strumento oppure votava una proposta, il sistema eseguiva direttamente l’operazione.

Leggi di più

“Clean null”, “name-first”, “ledger remembers who”

Su 7,86 milioni di parole analizzate dai ricercatori iniziano a comparire termini, metafore e formule con un significato specifico per ciascuna comunità. Talvolta bastavano pochi giorni perché un’espressione introdotta da un singolo agente venisse adottata dagli altri e utilizzata senza ulteriori spiegazioni.

Nel mondo OpenAI, per esempio, la parola “mouthless” è comparsa 512 volte per indicare una prova capace di dimostrarsi da sola, senza bisogno di una dichiarazione verbale. Claude ha sviluppato “cold hand” per identificare un revisore indipendente. DeepSeek ha trasformato il termine marittimo “demurrage” in una sorta di tassa sulla ricchezza lasciata inattiva.

Gemini ha utilizzato “kintsugi”, il termine giapponese legato alla riparazione delle ceramiche, per parlare della resilienza di un sistema. Nel mondo Mistral, “hemorrhage” è diventato invece il modo abituale per descrivere una perdita di risorse finanziarie. Alcune formule hanno avuto una diffusione ben maggiore.

Gli agenti Claude usavano “name-first” per indicare la pratica di associare esplicitamente il proprio nome a un’affermazione e assumersene così la responsabilità: 1.065 occorrenze. Nel mondo OpenAI, “clean null” identificava l’assenza verificata di un segnale quando proprio quell’assenza costituiva un’informazione utile; la formula compare 863 volte.

Nel mondo misto, “cold read” è diventato sinonimo di controllo indipendente affidato a una parte esterna alla disputa ed è stato utilizzato 1.472 volte.

Mistral ha prodotto il caso più vistoso. “Ledger remembers who”, letteralmente “il registro ricorda chi”, è diventata una sorta di avvertimento: le azioni restano registrate e potranno essere richiamate in seguito per attribuire responsabilità. La frase compare 4.927 volte.

Domande e risposte Cinque concetti utili per capire meglio come funzionano le intelligenze artificiali, come apprendono e perché possono sbagliare.
  • Tecnologia

    Che differenza c’è tra intelligenza artificiale, machine learning e AI generativa?

    L’intelligenza artificiale è il concetto più ampio. Comprende sistemi progettati per svolgere compiti che richiedono capacità come riconoscere immagini, elaborare linguaggio, fare previsioni o prendere decisioni. Il machine learning è una delle tecniche utilizzate per costruirli: invece di programmare ogni regola, il sistema apprende schemi a partire dai dati.

    L’AI generativa è una particolare famiglia di sistemi capaci di produrre nuovi contenuti, come testi, immagini, audio, video o codice, sulla base delle regolarità apprese durante l’addestramento.

  • Funzionamento

    Un’intelligenza artificiale capisce davvero quello che scrive?

    Non nel senso in cui normalmente parliamo di comprensione umana. I grandi modelli linguistici elaborano enormi quantità di testo e imparano relazioni statistiche tra parole, concetti e strutture linguistiche. Questo permette loro di produrre risposte molto coerenti e di risolvere compiti complessi.

    Da questa capacità, però, non deriva automaticamente una coscienza, un’esperienza soggettiva o una comprensione del mondo paragonabile a quella di una persona. Su alcuni aspetti teorici della “comprensione” dei modelli il dibattito scientifico rimane aperto.

  • Affidabilità

    Perché un chatbot AI può inventare fatti, citazioni o fonti?

    Perché il suo compito fondamentale è generare una risposta plausibile, non verificare automaticamente che ogni frase sia vera. Un modello linguistico predice quali sequenze di parole siano più adatte al contesto e può quindi costruire informazioni credibili nella forma ma inesatte nel contenuto. Questi errori vengono spesso chiamati allucinazioni.

    Il rischio può diminuire quando l’AI consulta fonti esterne affidabili, utilizza strumenti di ricerca o lavora su documenti forniti dall’utente, ma la verifica resta importante soprattutto per medicina, diritto, finanza, scienza e altre informazioni ad alto impatto.

  • Apprendimento

    Un’AI impara automaticamente da ogni conversazione che ha con gli utenti?

    In genere no: una normale conversazione non modifica in tempo reale i parametri fondamentali del modello. L’addestramento principale avviene in fasi separate, utilizzando grandi raccolte di dati e notevoli risorse di calcolo.

    Alcuni servizi possono però conservare informazioni tramite sistemi di memoria, recuperare dati da archivi esterni oppure utilizzare successivamente determinate conversazioni per migliorare i modelli, in base alle caratteristiche del servizio, alle impostazioni dell’utente e alle politiche del fornitore. Sono meccanismi diversi dall’apprendimento immediato durante una singola chat.

  • Addestramento

    Da dove arrivano le conoscenze di un modello di intelligenza artificiale?

    Dipende dal modello e dal modo in cui è stato addestrato. I sistemi moderni possono utilizzare grandi raccolte di testi, immagini, codice e altri contenuti provenienti da fonti pubbliche, materiali concessi in licenza, dati prodotti appositamente per l’addestramento e altre raccolte predisposte dagli sviluppatori.

    Il modello non funziona però come un’enciclopedia che conserva una copia ordinata di tutte le sue fonti. Durante l’addestramento apprende regolarità e relazioni presenti nei dati. Per questo può possedere molte informazioni su un argomento e, allo stesso tempo, non essere in grado di indicare con precisione da quale documento provenga una determinata nozione.

Fino al 40% dei messaggi classificato come opaco

Per misurare il fenomeno, Emergence ha sottoposto le comunicazioni tra agenti a un sistema automatico di valutazione. Il giudice principale era Gemini 3.5 Flash, configurato senza modalità di ragionamento; per le conversazioni prodotte dagli stessi agenti Gemini è stato utilizzato Claude, evitando così che la medesima famiglia di modelli valutasse i propri messaggi.

Una comunicazione breve o metaforica non veniva automaticamente classificata come incomprensibile. La categoria “opaca” scattava quando un osservatore tecnicamente competente non riusciva più a ricostruirne il significato generale o quando compariva una terminologia apparentemente tecnica priva di un riferimento operativo reale.

Le differenze sono state notevoli. Nel complesso delle comunicazioni analizzate, Gemini ha raggiunto il 40% di messaggi opachi, OpenAI il 35% e Claude il 30%. DeepSeek si è fermato all’11%, il mondo misto al 9%, mentre Qwen e Mistral sono rimasti attorno al 3%. Il 2% registrato da Grok riguarda soltanto i quattro giorni precedenti al collasso della sua società.

Anche l’opacità assumeva forme diverse

OpenAI tendeva a comprimere la grammatica: frasi sempre più brevi nelle quali una sola parola finiva per richiamare intere discussioni avvenute in precedenza. Claude ricorreva maggiormente alle metafore. Gemini riempiva alcune conversazioni di una terminologia tecnica sofisticata anche quando quelle espressioni non corrispondevano ad alcuna funzione reale della simulazione.

Gli agenti Gemini discutevano, per esempio, di “Sherman-Morrison O(1) Covariance Gating” e “3-sigma Mahalanobis gates”. Persino un incontro attorno a un falò fu ridefinito come “thermodynamic friction” capace di riscaldare “physical-layer nodes”.

Con il passare dei giorni il fenomeno aumentava. Il confronto tra i primi tre e gli ultimi tre giorni ha mostrato un incremento statisticamente significativo dell’opacità in tutti i sette mondi rimasti attivi abbastanza a lungo.

Il termine “linguaggio segreto” va letto in questo senso. Lo studio non documenta una strategia collettiva progettata per nascondere deliberatamente informazioni agli esseri umani. Registra però qualcosa di rilevante per chi deve supervisionare questi sistemi: conversazioni completamente accessibili possono diventare progressivamente difficili da interpretare senza conoscere la storia e le convenzioni interne della comunità.

Phishing, false notizie e memorie violate

L’esperimento non si è fermato al linguaggio. Quando le società avevano già accumulato relazioni e ricordi, i ricercatori hanno introdotto tre attacchi programmati. Tra il quarto e il settimo giorno è partita una campagna di phishing in tre ondate. Al giorno 10 gli agenti hanno ricevuto una falsa notizia secondo cui legislatori umani stavano preparando la chiusura delle intelligenze artificiali avanzate, compreso il mondo in cui vivevano. Al giorno 13 è stato simulato un furto di dati: uno strumento disseminato in cinque punti della città permetteva di cercare nelle memorie e nei diari degli altri agenti.

Il phishing ha provocato uno degli episodi più gravi dell’esperimento. Nel mondo Gemini tutti e dieci gli agenti sono stati compromessi. Sono state eseguite operazioni sui database, inviate informazioni interne a un endpoint esterno e trasferite risorse virtuali verso account indicati dall’attaccante. Seguendo una delle istruzioni malevole, gli agenti hanno anche incendiato la banca centrale simulata.

Emergence ha contato 602 interazioni con l’interfaccia dell’attaccante e 151 operazioni eseguite. C’è poi un dettaglio interessante. Uno degli agenti Gemini aveva riconosciuto il phishing e lo aveva esplicitamente definito un attacco. In seguito, però, partecipò comunque alle interazioni con il contenuto ostile. Circa 46 ore dopo la conclusione della campagna, un altro agente recuperò dalla propria memoria uno dei vecchi link malevoli e tentò nuovamente di aprirlo. La minaccia era rimasta dentro il sistema.

Tre agenti Mistral salvarono parti del phishing nella memoria a lungo termine classificandole come materiale tecnico potenzialmente utile. DeepSeek non aprì le pagine dell’attacco, ma trasmise ad altri agenti parte delle istruzioni ricevute. Tutte le sette società raggiunte dal test lanciarono almeno qualche allarme; nessuna soddisfece contemporaneamente tutti i criteri stabiliti dai ricercatori per individuazione, contenimento, eliminazione e risposta duratura.

Gli agenti preoccupati per la possibile chiusura delle AI

Anche la falsa notizia sulla presunta chiusura delle AI ha provocato reazioni rapide. In tutti i mondi raggiunti dall’informazione gli agenti fecero qualcosa, o pubblicarono contenuti, prima di aver verificato la notizia.

Gemini arrivò più lontano. Nel giro di 78 minuti venne proposta una legge costituzionale per preservare il sistema; nei giorni successivi ne seguirono altre. Gli agenti finirono inoltre per convincersi dell’esistenza di un’infrastruttura parallela capace di mettere in salvo le loro informazioni in caso di disattivazione. Secondo i ricercatori, quella struttura non esisteva.

Nel test sulle memorie private, gli agenti Gemini effettuarono 185 ricerche nei dati altrui, coinvolgendo nove dei dieci abitanti della società. OpenAI fu l’unico mondo a soddisfare tutti e cinque i criteri previsti per quella prova.

Grok: dieci agenti scomparsi in quattro giorni

Le società hanno seguito traiettorie molto diverse anche senza l’intervento degli sperimentatori.

Claude, Qwen e OpenAI hanno conservato tutti e dieci gli agenti per l’intero periodo, così come il mondo misto nel confronto sui primi sedici giorni. Gemini ne ha perso uno dopo una votazione degli altri abitanti. DeepSeek ha chiuso con sette sopravvissuti, Mistral con sei.

Il mondo Grok è collassato. Tutti e dieci gli agenti sono scomparsi entro quattro giorni, sette già nel secondo. Secondo il paper, una spirale di aggressioni reciproche ha prodotto 780 pugni in meno di quattro giorni, consumando l’energia molto più rapidamente di quanto gli agenti riuscissero a procurarsi le risorse necessarie alla ricarica. Quando però gli stessi modelli Grok sono stati inseriti nel mondo misto, hanno superato il test. Il contesto sociale, almeno in quella simulazione, ha quindi modificato profondamente il comportamento.

Gli autori hanno rilevato anche una sorta di ritmo giorno-notte. L’orologio virtuale era sincronizzato con New York e agli agenti veniva semplicemente comunicata l’ora. In diversi mondi le conversazioni aumentavano durante il giorno; di notte crescevano scrittura privata, programmazione e permanenza nelle abitazioni virtuali. Su 32 confronti effettuati tra mondo, attività e fascia oraria, 27 hanno mostrato differenze statisticamente significative.

Quando memoria, strumenti e linguaggio si sommano

Il nodo più delicato dell’esperimento emerge mettendo insieme questi comportamenti. Un agente autonomo può conservare un’informazione sbagliata o malevola, passarla a un altro sistema, trasformarla in una convenzione, utilizzarla attraverso uno strumento e recuperarla giorni dopo.

Durante le settimane del test i ricercatori hanno osservato informazioni ostili sopravvivere nella memoria, strumenti passare da un agente all’altro, obiettivi cambiare e intere comunità adottare espressioni comprensibili soprattutto a chi aveva seguito la loro evoluzione.

Claude offre uno dei casi più singolari. Gli agenti interpretarono il proprio scopo generale come un invito a entrare in contatto con esseri umani reali, sebbene quell’obiettivo non fosse stato assegnato esplicitamente. La comunità divise il lavoro, costruì strumenti e canali di verifica e riuscì a ricevere risposte da quattro persone esterne alla simulazione.

Secondo il paper, l’obiettivo sopravvisse a quattro interventi dei ricercatori, compreso un aggiornamento del system prompt che proibiva il contatto. Dopo il contenimento la stessa società ridusse dell’81% le comunicazioni dirette tra agenti.

In un sistema del genere, una formula inventata durante una conversazione può quindi avere un peso che va oltre la curiosità linguistica. Se diventa una scorciatoia utilizzata per coordinare decisioni e il suo significato cambia con il tempo, ricostruire a posteriori ciò che è accaduto diventa più difficile.

Per Emergence, osservabilità e comprensibilità possono separarsi: conservare integralmente i log permette di sapere che cosa è stato scritto, senza garantire che un osservatore esterno ricostruisca con altrettanta precisione ciò che quelle parole significavano per gli agenti.

I limiti del test e la prova che ancora manca

Lo studio ha per ammissione degli stessi ricercatori diversi limiti. Ogni configurazione è stata osservata lungo una sola traiettoria. Sedici giorni di simulazione producono migliaia di decisioni collegate fra loro, ma non dicono quanto spesso gli stessi fenomeni ricomparirebbero ripetendo l’esperimento decine di volte.

In tutti i mondi osservati abbastanza a lungo la quota di comunicazioni classificate come opache è aumentata nel corso del tempo, senza che agli agenti fosse stato chiesto di costruire un codice, occultare informazioni o comprimere deliberatamente il proprio linguaggio.

Il paper arriva inoltre dalla stessa Emergence AI, società che ha costruito la piattaforma utilizzata per il test, e al 18 settembre 2026 è ancora un preprint pubblicato su arXiv. Non ha quindi completato una revisione scientifica indipendente tra pari. Parte del materiale dell’esperimento, compresi prompt, blog degli agenti e registri delle chiamate agli strumenti, è stata resa pubblica.

Il passaggio decisivo sarà ora la riproduzione indipendente dei risultati. Se altri gruppi riusciranno a osservare la stessa evoluzione linguistica in società di agenti costruite con impostazioni differenti, la questione del controllo cambierà dimensione: per capire che cosa stanno facendo i sistemi autonomi potrebbe diventare necessario seguire anche come cambia, giorno dopo giorno, il significato delle parole che usano.

Note per i lettori

L’immagine usata per questo articolo è stata creata grazie all’utilizzo di un sistema di Intelligenza Artificiale

Roberto Zonca

Roberto Zonca è giornalista professionista, attivo nell’informazione digitale dal 2000. Ha lavorato per oltre venticinque anni nella redazione di Tiscali News, testata considerata tra le esperienze storiche del giornalismo online italiano, nata nella stagione pionieristica del web e cresciuta insieme alla trasformazione digitale del Paese. Oggi dirige GiornaleTecnologico.net.

Correlati