Per almeno 100.000 anni, un solo tipo di entità sulla Terra ha potuto imparare una lingua umana con piena padronanza: un bambino umano. Le cose sono cambiate circa quattro anni fa. I modelli linguistici di grandi dimensioni possono ora sostenere conversazioni che, a un primo sguardo, sono indistinguibili dagli scambi umani. Eppure, sotto quella fluidità, sta accadendo qualcosa di profondamente strano. Questi sistemi richiedono una quantità sbalorditiva di dati per raggiungere un livello di competenza che un bambino piccolo ottiene quasi senza sforzo. Capire perché esista questo divario è oggi una delle questioni aperte più importanti sia nella scienza cognitiva sia nella ricerca sull’IA.
La scala del problema è difficile da cogliere
I numeri in gioco sono difficili da immaginare. Un preadolescente cresciuto in un ambiente ricco dal punto di vista linguistico potrebbe aver sentito circa 100 milioni di parole prima di arrivare all’adolescenza. Se aggiungi la lettura al quadro, quella cifra potrebbe salire a circa 300 milioni di parole all’età di 20 anni. Il modello open-weight Llama 3.1 di Meta, al contrario, è stato addestrato su 15 trilioni di token, dove i token sono unità linguistiche simili a parole. I modelli di frontiera potrebbero essere addestrati su dieci volte tanto, secondo Ethan Gotlieb Wilcox, scienziato cognitivo e linguista presso la Georgetown University.
Per rendere il confronto tangibile: se stampassi tutte le parole usate per addestrare un moderno modello linguistico di grandi dimensioni, la pila di carta supererebbe la Stazione Spaziale Internazionale. I 100 milioni di parole ascoltate da un preadolescente arriverebbero a una pila alta circa 20 metri. Wilcox la mette in un altro modo: Claude ha visto la quantità di linguaggio che un’intera città sperimenterà in una generazione.
Questo è ciò che i ricercatori chiamano divario di efficienza dei dati. I bambini imparano la lingua da una minuscola frazione dell’input richiesto dalle macchine, e lo fanno più velocemente, in modo più affidabile e con molte meno istruzioni esplicite. I bambini piccoli in genere iniziano a produrre frasi grammaticalmente corrette dopo aver ascoltato un numero di parole compreso tra 10 e 30 milioni. Addestrare GPT-2 su 30 milioni di parole, come fa notare Michael C. Frank, scienziato cognitivo della Stanford University, produce un generatore di sciocchezze. Non produce nulla che somigli a un bambino.
Un dibattito che ha plasmato sia la linguistica sia l’IA
La questione di come i bambini acquisiscano il linguaggio non è nuova, e le risposte in competizione hanno avuto conseguenze reali su come si è sviluppata l’IA. Negli anni Cinquanta, il linguista del MIT Noam Chomsky sosteneva che i bambini nascono con una conoscenza grammaticale innata. Il suo ragionamento era che il linguaggio, in particolare la sua sintassi, è troppo complesso e l’esposizione dei bambini ad esso è troppo limitata perché l’apprendimento avvenga puramente attraverso l’esperienza. Ha definito questo concetto “povertà dello stimolo”. Contro di lui c’era lo psicologo B.F. Skinner, secondo il quale il linguaggio veniva imparato interamente attraverso il condizionamento ambientale, nello stesso modo in cui gli animali imparano a rispondere alle ricompense.
La visione di Chomsky ha dominato la linguistica americana per decenni e ha plasmato direttamente la ricerca iniziale sull’IA. I ricercatori hanno cercato di insegnare ai computer il linguaggio codificando esplicitamente le regole grammaticali nei programmi, un approccio basato sulle regole che è diventato parte di quella che veniva chiamata IA simbolica. Tale approccio non è riuscito in gran parte a produrre sistemi in grado di gestire il vero linguaggio umano su scala. L’interesse per il settore è calato notevolmente durante il periodo noto come inverno dell’IA, iniziato negli anni Settanta.
Il ritorno è avvenuto attraverso una strada completamente diversa. Le reti neurali, che imparano riconoscendo schemi statistici anziché seguire regole esplicite, hanno iniziato a superare i sistemi basati su regole man mano che l’hardware diventava più economico e Internet forniva vaste quantità di testo. Tra il 2018 e il 2019, modelli come BERT e GPT-2, costruiti su una nuova architettura chiamata transformer, hanno dimostrato che l’imparare da enormi quantità di dati poteva funzionare per il linguaggio. Il successo di ChatGPT nel 2022 ha reso tutto ciò visibile al pubblico generale.
L’ironia è evidente. I modelli linguistici di grandi dimensioni sono, in essenza, esattamente quel tipo di macchine di apprendimento statistico che Chomsky sosteneva non avrebbero mai potuto acquisire il linguaggio. Non hanno grammatica innata, né regole cablate, né architettura biologica. Eppure funzionano, almeno su scala. I bambini, nel frattempo, compiono la stessa prodezza con una frazione dei dati e senza alcuna infrastruttura computazionale. Nessuna delle due parti del vecchio dibattito spiega completamente ciascun caso.
Perché questa domanda è importante al di fuori del laboratorio
C’è un’urgenza pratica che va oltre il dibattito accademico. Internet non è infinito. I ricercatori suggeriscono che la disponibilità di dati testuali facilmente reperibili per l’addestramento potrebbe esaurirsi già negli anni Trenta del duemila. Se i sistemi di IA possono migliorare solo consumando più dati, quella traiettoria ha un limite massimo. I bambini dimostrano che quel limite massimo non è fondamentale. È una limitazione dei metodi attuali, non del compito in sé.
Colmare il divario di efficienza dei dati potrebbe aprire possibilità che i modelli attuali non possono raggiungere: sistemi di IA addestrati efficacemente su video anziché su testo, strumenti linguistici creati per comunità di lingue minoritarie in cui non esistono grandi corpus di testi, e modelli che generalizzano a partire da esempi limitati nello stesso modo in cui fanno gli esseri umani. Studiare come imparano i bambini offre anche un modo per testare ipotesi di lunga data sulla mente umana, compreso se l’acquisizione del linguaggio richieda strutture biologiche innate o se il giusto tipo di ambiente di apprendimento sia sufficiente.
Ciò che questo campo sta realmente chiedendo è una versione di una domanda molto più antica: cosa significa comprendere il linguaggio e quanta parte di quella comprensione è unicamente umana? L’IA non ha risposto a quella domanda. L’ha resa più urgente.
In breve
I bambini imparano il linguaggio da una frazione dei dati richiesti dai sistemi di IA, un divario così grande che può essere descritto solo attraverso un’analogia. I ricercatori stanno studiando come i bambini riescano in questa impresa perché la risposta potrebbe rimodellare il modo in cui vengono costruiti i modelli di IA, e perché la fornitura di dati di addestramento ha dei limiti. Il dibattito tra conoscenza innata e apprendimento statistico, che ha plasmato sia la linguistica sia la prima IA, è ancora irrisolto. I modelli linguistici di grandi dimensioni sono la prova evidente che la statistica può fare molta strada. I bambini sono la prova altrettanto evidente che la statistica da sola non esaurisce l’intera storia.
Basato su un articolo di MIT Technology Review.