Per anni, una singola frase ha plasmato il modo in cui molte persone pensano ai large language models: “pappagallo stocastico”. L’idea, che ha preso piede tra il 2017 e il 2022, descriveva i primi sistemi di IA generativa come sofisticati abbinatori di pattern che selezionavano parole statisticamente probabili senza alcuna genuina comprensione. È stata una correzione utile contro l’hype. Il problema è che ha superato la sua accuratezza, e usarla oggi per liquidare le preoccupazioni sui modelli di frontiera dell’IA porta a un quadro pericolosamente incompleto.
Come funzionavano davvero i primi modelli e perché l’etichetta calzava a pennello
La cornice del pappagallo stocastico non era sbagliata per i suoi tempi. I primi modelli linguistici operavano tramite la predizione autoregressiva del token successivo: data una sequenza di parole, il modello calcolava quale parola avesse più probabilità di seguire, basandosi interamente sui pattern assorbiti durante l’addestramento. Non c’era alcun recupero di conoscenza esterna, nessun ragionamento strutturato, nessuna autocorrezione. Il modello era, in un senso significativo, una tabella di ricerca statistica molto grande vestita da conversazione. Chiamarlo pappagallo coglieva qualcosa di reale sui suoi limiti.
L’etichetta è rimasta. E nel 2026, viene ancora impiegata, spesso per sostenere che modelli come Astra di OpenAI o Mythos di Anthropic non pongono rischi seri perché sono, in fondo, solo l’autocompletamento. È qui che la metafora smette di essere utile e inizia a diventare fuorviante.
Quattro filoni di ricerca che hanno cambiato tutto
A partire dal 2017 circa e accelerando nei primi anni 2020, diversi filoni di ricerca distinti hanno iniziato a spingere i modelli linguistici ben oltre il riconoscimento statico dei pattern. Non hanno sostituito l’architettura sottostante quanto piuttosto costruito strati di capacità al di sopra di essa.
Il primo è stato la generazione aumentata da recupero, nota come RAG. Piuttosto che costringere un modello a fare affidamento esclusivamente su ciò che aveva assorbito durante l’addestramento, il RAG ha dato ai modelli la capacità di interrogare fonti esterne, estrarre documenti pertinenti e incorporare quel materiale nelle loro risposte. L’effetto pratico è stato un miglioramento significativo nell’accuratezza fattuale, perché il modello poteva attingere a informazioni aggiornate e autorevoli anziché a dati di addestramento congelati.
Il secondo filone è stato l’IA neurosimbolica, che ha affrontato una limitazione diversa: la capacità di gestire la logica strutturata. Un modello linguistico che recupera una polizza assicurativa può dirti cosa dice il documento. Un sistema neurosimbolico può tradurre quella polizza in regole e condizioni esplicite, per poi applicare un risolutore logico al fine di determinare una risposta deterministica. L’output in linguaggio naturale proviene dal modello neurale, mentre il ragionamento rigoroso proviene da uno strato simbolico che opera al suo fianco o integrato al suo interno durante l’addestramento.
Il terzo sviluppo è arrivato da una collaborazione del 2022 tra ricercatori di Google e dell’Università di Tokyo. Hanno dimostrato che semplicemente inserendo nel prompt l’istruzione “Pensiamo passo dopo passo” si poteva sbloccare una capacità latente di risoluzione strutturata dei problemi, senza modificare i pesi del modello o fornire esempi svolti. Il modello stava ancora prevedendo i token, ma la generazione di passaggi di ragionamento intermedi gli dava qualcosa di funzionalmente simile a un blocco per appunti. Questa ricerca sulla catena di pensiero ha gettato le basi per ciò che è venuto dopo.
Il quarto e più consequenziale cambiamento è stato l’emergere dei modelli di ragionamento. I ricercatori hanno iniziato ad addestrare i modelli specificamente per ragionare sui problemi durante l’inferenza dal vivo, dopo il prompt di un utente, anziché produrre una risposta in un unico passaggio in avanti. O1 di OpenAI, rilasciato nel 2024, è stato il primo modello di ragionamento di un grande laboratorio. È stato addestrato utilizzando una combinazione di pre-addestramento su esempi scritti da umani e apprendimento per rinforzo. Poi, all’inizio del 2025, il laboratorio cinese DeepSeek ha dimostrato che il solo apprendimento per rinforzo, senza esempi di ragionamento espliciti, poteva insegnare a un modello a produrre catene di pensiero più lunghe, controllare il proprio lavoro e riconsiderare i propri approcci. Il modello ha imparato a ragionare venendo premiato per aver dato le risposte giuste.
Questi quattro filoni si sono sviluppati in gran parte in parallelo, sovrapponendosi notevolmente tra il 2019 e il 2023, con i modelli di ragionamento arrivati poco dopo. Il risultato è una classe di sistemi che fa molto di più che eseguire un prompt attraverso un insieme fisso di parametri.
Perché la cornice è importante oltre l’accuratezza tecnica
Questo è ciò che la maggior parte della copertura mediatica tralascia: il dibattito sul pappagallo stocastico non è solo un disaccordo semantico tra ricercatori. Ha conseguenze pratiche sul modo in cui la società valuta il rischio.
Se i modelli di frontiera dell’IA vengono intesi come un correttore automatico sofisticato, l’istinto è di trattare le preoccupazioni sulle loro capacità come esagerate. Ma un sistema in grado di recuperare informazioni esterne, applicare logica strutturata, ragionare su problemi multi-step e auto-correggersi durante l’inferenza è un tipo di strumento qualitativamente diverso. Aumenta il giudizio umano in modi che i precedenti modelli non potevano fare, e può operare a una scala e a una velocità che i team umani non possono eguagliare senza supporto. Questa capacità estesa è precisamente il motivo per cui la questione di come questi sistemi vengono distribuiti, e da chi, merita seria attenzione.
La metafora del pappagallo è sempre stata una semplificazione. Le semplificazioni sono utili finché non oscurano più di quanto rivelano. Nel 2026, il pappagallo stocastico oscura una grande quantità di aspetti.
In breve
I large language models nel 2026 non sono i sistemi di abbinamento di pattern che l’etichetta di “pappagallo stocastico” è stata coniata per descrivere. La generazione aumentata da recupero, il ragionamento neurosimbolico, il prompting con catena di pensiero e i modelli di ragionamento dedicati hanno trasformato collettivamente ciò che questi sistemi possono fare. Usare una metafora obsoleta per liquidare le preoccupazioni sulle loro capacità non è scetticismo. È l’incapacità di stare al passo con la tecnologia di cui si discute.
Basato su un articolo di Fast Company - Tech.