Un rapporto di intelligence generato dall’IA ha identificato erroneamente una nave cinese come trasportatrice di componenti per un programma di armi nucleari. L’esercito statunitense è andato vicino a intercettare e salire a bordo di quella nave, con il supporto aereo pronto. L’errore è stato scoperto prima che venisse intrapresa un’azione, ma solo per un pelo. Una fonte ha descritto l’episodio come qualcosa che “ha quasi fatto scoppiare una guerra”.
Questo non è uno scenario ipotetico sui rischi futuri dell’IA. È una quasi collisione documentata che illustra, con inusuale chiarezza, cosa succede quando un’allucinazione dell’IA si scontra con un processo decisionale ad alto rischio.
Come un Chatbot ha Riscritto il Carico di una Nave
Secondo quanto riportato dalla CNN, un analista del Comando delle Operazioni Speciali degli Stati Uniti ha usato un chatbot per elaborare informazioni di intelligence sul manifesto della nave cinese. Lo strumento ha combinato l’intelligence open-source con l’intelligence sui segnali classificati conservata nei sistemi governativi, confezionando poi il risultato in un rapporto formale. Quel rapporto concludeva che la nave stava trasportando componenti di un programma di armi nucleari attraverso il Medio Oriente.
La conclusione era del tutto falsa.
Il chatbot aveva, secondo il linguaggio ormai familiare a chiunque segua lo sviluppo dell’IA, allucinato. Ha generato un output che sembrava sicuro di sé ma non rifletteva la realtà, perché i dati sottostanti non fornivano un contesto sufficiente per una risposta accurata. L’esercito si stava preparando a un’intercettazione fisica prima che i funzionari identificassero l’errore nell’output dell’IA.
Questo è ciò che la maggior parte dei servizi sulle allucinazioni dell’IA si perde: il problema non è che i sistemi di IA producano occasionalmente risposte sbagliate in contesti a basso rischio. Il problema è che gli output sono formattati, strutturati e consegnati in modi che sembrano autorevoli. Un rapporto di intelligence generato con l’assistenza dell’IA non arriva con un disclaimer. Arriva sembrando un rapporto di intelligence.
Un Esercito che sta Accelerando, non Fermandosi
L’episodio si inserisce in un modello più ampio di rapida adozione dell’IA in tutto l’apparato della difesa statunitense. A gennaio, il Dipartimento della Difesa ha lanciato quella che ha descritto come una “strategia di accelerazione dell’IA”, con l’obiettivo dichiarato di rendere i dati disponibili attraverso sistemi federati per quella che il dipartimento ha definito “sfruttamento dell’IA”. Il Segretario alla Difesa Pete Hegseth ha inquadrato l’iniziativa attorno alla qualità dei dati: “L’IA è valida solo quanto i dati che riceve”.
Il dipartimento si è mosso rapidamente anche sul fronte degli strumenti. Lo scorso dicembre, ha annunciato l’uso di Gemini di Google per il Governo come base per una piattaforma su misura chiamata GenAI.mil. Il mese successivo, Grok per il Governo è stato aggiunto come opzione sulla stessa piattaforma. Anthropic offre una versione personalizzata di Claude per il lavoro di intelligence statunitense. Un rappresentante del Pentagono ha dichiarato al Congresso a giugno che 1,5 milioni di membri attivi del Dipartimento della Difesa hanno usato gli strumenti di IA generativa dei militari, e che l’IA generativa viene già impiegata per contribuire alla produzione di rapporti richiesti dal Congresso.
La scala del deployment è significativa. Lo è anche la velocità. La quasi collisione con la nave cinese non è avvenuta nel vuoto: è avvenuta all’interno di un’istituzione che ha fatto dell’integrazione dell’IA una priorità strategica.
C’è una tensione qui che merita attenzione. Una dichiarazione del Dipartimento di Stato del 2023 sull’uso militare responsabile dell’IA ha chiesto una “attenta considerazione di rischi e benefici” e ha insistito sul fatto che l’uso responsabile dei sistemi di IA deve sempre coinvolgere “un umano nel ciclo, una catena di comando e controllo umana e responsabile”. L’episodio riportato suggerisce che un umano fosse tecnicamente nel ciclo, nel senso che un analista ha presentato il rapporto. Ma l’analista sembra essersi fidato dell’output del chatbot senza una verifica sufficiente. L’umano nel ciclo è efficace solo quanto la sua capacità di interrogare ciò che l’IA ha prodotto.
Cosa Rivelano Questi Fatti sull’IA in Ambienti ad Alto Rischio
Il problema delle allucinazioni non è nuovo e non è confinato ai contesti militari. Da quando “hallucinating” è diventata la parola dell’anno del Cambridge Dictionary nel 2023, sono emersi casi documentati in medicina, legge, giornalismo, ricerca accademica e contesti aziendali. I ricercatori hanno suggerito che potrebbe essere impossibile impedire del tutto ai LLM di allucinare, indipendentemente da come vengono costruiti i prompt.
Ciò che la quasi collisione militare aggiunge a questo quadro è un senso di conseguenza di un ordine di grandezza diverso. Un’IA che allucina in un contesto di servizio clienti produce una risposta sbagliata che può essere corretta. Un’IA che allucina in un contesto di intelligence può produrre una risposta sbagliata che innesca una catena di eventi che coinvolgono forze armate, relazioni internazionali e la possibilità di un conflitto armato.
Il problema più profondo è strutturale. Gli strumenti di IA vengono integrati nei flussi di lavoro più velocemente di quanto non si stiano costruendo i framework di verifica necessari per catturare i loro errori. La strategia di accelerazione del Dipartimento della Difesa è esplicita su velocità e scala. Le tutele, al contrario, sono descritte in termini generali: uso di principi, supervisione umana, attenta considerazione. Queste non sono la stessa cosa dei protocolli operativi che avrebbero catturato l’errore nel rapporto sulla nave cinese prima che raggiungesse la fase di preparazione militare.
L’IA potenzia l’analisi umana. Può elaborare volumi di dati che nessun singolo analista potrebbe gestire da solo. Questa è una capacità genuina. Ma il potenziamento richiede che gli umani che lavorano a fianco di questi strumenti abbiano sia il tempo sia il supporto istituzionale per verificare gli output in modo critico, specialmente quando quegli output informeranno decisioni con conseguenze irreversibili.
In Breve
Un chatbot con IA ha fuso intelligence open-source e classificata, producendo un falso rapporto che ha quasi innescato un’intercettazione da parte dell’esercito statunitense di una nave cinese. L’errore è stato scoperto, ma l’episodio rivela un divario strutturale: l’esercito statunitense sta distribuendo l’IA su scala e velocità, mentre i framework di verifica necessari per catturare le allucinazioni in contesti ad alto rischio stanno ancora recuperando terreno. L’allucinazione dell’IA è un problema noto, documentato e possibilmente irriducibile. Nei contesti a basso rischio, è un inconveniente. Nell’intelligence militare, è una categoria di rischio completamente diversa.
Basato su un articolo di Ars Technica.