The Brief
Come funziona l'IA 5 min di lettura

L'AGI è "Qui". La Definizione Continua a Spostarsi

NAVION

Condividi

Il presidente di OpenAI Greg Brockman ha dichiarato recentemente che “l’era dell’AGI” è iniziata, in seguito al lancio di GPT-6 Astra. Il CEO di Nvidia Jensen Huang ha riecheggiato l’annuncio pubblicamente. L’affermazione è arrivata con un peso considerevole: l’intelligenza artificiale generale, a lungo trattata come il distante orizzonte della ricerca sull’IA, veniva presentata come una realtà attuale. Il problema è che quasi nessuno al di fuori di quelle aziende concorda su ciò che quella realtà significhi effettivamente.

Un Punteggio di Benchmark Che Cambia Con il Software

La prova più citata di Astra per una capacità a livello di AGI è la sua performance su ARC-AGI-3, un benchmark progettato dal ricercatore dell’IA François Chollet specificamente per resistere al tipo di addestramento mirato che ha reso inaffidabili molti test sull’IA. Il benchmark colloca i modelli in ambienti di videogiochi non familiari e misura se riescono a capire le regole, ad adattarsi e a vincere. È, per design, più difficile da aggirare rispetto alla maggior parte degli altri.

Astra si è comportata notevolmente bene. Utilizzando l’Harness di test proprietario di OpenAI, il livello software che fa da tramite tra il modello e il benchmark, ha ottenuto il 99,9%. Utilizzando la configurazione di test standard di ARC-AGI-3, progettata per dare a tutti i modelli un’interfaccia più uniforme, il punteggio è sceso al 62,7%. Quel divario non è una nota a margine tecnica minore. Pone una domanda diretta: il modello è veramente capace, o è in parte ottimizzato per le condizioni in cui viene valutato?

Lo stesso Chollet ha affrontato la questione direttamente. Il benchmark, ha spiegato, testa un insieme non esaustivo di attributi su scala ridotta. L’intelligenza del mondo reale implica orizzonti temporali di apprendimento molto più lunghi, una complessità di gran lunga maggiore nella modellazione del mondo e obiettivi molto più ambigui. Risolvere ARC-AGI-3, a suo avviso, è un segno significativo di progresso. Non è la prova dell’AGI, e non è mai stato inteso per esserlo.

Il Problema Della Definizione È la Vera Notizia

Ecco cosa la maggior parte della copertura di questo annuncio tralascia: il dibattito sul fatto che l’AGI sia arrivata è inseparabile dal dibattito su cosa significhi persino l’AGI. Non esiste una definizione universalmente accettata, e questa assenza crea un margine significativo di interpretazione.

L’attuale definizione di OpenAI descrive l’AGI come “sistemi altamente autonomi che superano gli umani nella maggior parte del lavoro di valore economico”. Il Center for AI Safety utilizza un quadro più esigente che richiede alte prestazioni in dieci domini cognitivi distinti, che spaziano dal ragionamento, alla memoria e alla percezione. I ricercatori indipendenti lavorano spesso a partire da definizioni ancora più rigorose.

Gary Marcus, professore alla New York University e noto scettico dell’IA, ha descritto l’affermazione sull’AGI come marketing, sostenendo che o fraintende le definizioni originali del termine o abbassa deliberatamente l’asticella. La sua osservazione sulle prestazioni di Astra nell’Epoch Capabilities Index è istruttiva: Astra ha stabilito un nuovo record, ottenendo 169 contro un precedente massimo di 163, ma la stessa analisi di Epoch AI ha rilevato che il miglioramento è rimasto coerente con la traiettoria esistente del progresso dell’IA. Un nuovo record, sì. Un salto discontinuo, no.

Ben Goertzel, il ricercatore che ha coniato il termine “intelligenza artificiale generale” nel 2005, ha offerto forse la formulazione più precisa. Dopo aver usato Astra, la sua valutazione è stata che il modello è sovrumano in determinate aree, in particolare la matematica e la programmazione, pur rimanendo più debole in altre. Paragonarlo a un essere umano, ha detto, “finisce per essere complicato piuttosto che un semplice sì o no”. Ha anche identificato lacune specifiche che lo scaffolding software non può colmare: come il modello comprende se stesso, come trattiene e applica la memoria attraverso la sua esperienza e come coordina obiettivi in competizione tra loro.

Andy Konwinski, cofondatore di Databricks, Perplexity e Laude, lo ha detto in modo più chiaro. Questi sistemi non sanno ancora pensare in modo indipendente per lunghi periodi. Possono scrivere software complessi e identificare bug, ma la maggior parte del valore del mondo non proviene dall’ingegneria del software. Non stanno coltivando cibo, costruendo infrastrutture o governando società.

Perché l’Etichetta Conta Oltre il Laboratorio

Il dibattito sull’AGI potrebbe sembrare una disputa tecnica tra ricercatori, ma le sue implicazioni si estendono ben oltre i punteggi dei benchmark. Quando figure influenti nel settore dichiarano che una soglia è stata superata, ciò modella le aspettative pubbliche, le conversazioni politiche, le decisioni di investimento e il modo in cui le persone comprendono la tecnologia con cui convivono sempre più a stretto contatto.

Brockman non è il primo a fare questo tipo di dichiarazione. Huang ha fatto una simile affermazione all’inizio dell’anno. Il CEO di OpenAI Sam Altman ha descritto il momento attuale come l’inizio della Singolarità, una fase in cui i sistemi di IA hanno preso il sopravvento e accelerato lo sviluppo di nuovi modelli, con gli umani ampiamente esclusi da quel ciclo. Ognuna di queste affermazioni porta con sé un peso proprio a causa di chi le sta pronunciando, e ognuna arriva senza uno standard condiviso rispetto al quale misurare l’affermazione.

L’analogia con la rete cellulare è calzante: storicamente gli operatori hanno etichettato le loro reti con il marcatore della generazione successiva prima che la tecnologia sottostante soddisfacesse pienamente lo standard tecnico. L’etichetta guida l’adozione e la percezione. Il divario tra l’etichetta e la realtà si chiude più tardi, silenziosamente.

Le capacità dell’IA stanno avanzando. Questo non è in discussione. Ciò che rimane veramente irrisolto è se il concetto di AGl, così come è stato definito e ridefinito dalle persone più motivate a raggiungerlo, descriva ancora qualcosa di abbastanza preciso da essere significativo.

In Breve

GPT-6 Astra è un modello capace, e i suoi risultati nei benchmark rappresentano un progresso reale. Ma l’affermazione che l’AGI sia arrivata si basa su una definizione che le aziende che fanno l’affermazione hanno modellato per adattarsi ai propri sistemi. I ricercatori che hanno coniato il termine, progettato i benchmark e studiato l’IA in modo indipendente non sono convinti. La cosa più importante da capire non è se l’AGI sia qui. È che la risposta dipende interamente da chi ha il compito di definire la domanda.

Basato su un articolo di Fast Company - Tech.

Scritto da

NAVION