L’IA per il ripiegamento delle proteine è stata uno dei successi scientifici più celebrati degli ultimi anni. Eppure, una limitazione silenziosa ha iniziato a crescere sotto la superficie. I modelli che prevedono come le proteine interagiscono con i potenziali farmaci valgono tanto quanto i dati su cui sono stati addestrati, e quei dati, a quanto pare, sono molto più scarse di quanto la maggior parte delle persone realizzi. Un consorzio di aziende farmaceutiche ha ora dimostrato che sbloccare i dati molecolari proprietari, mantenuti privati per motivi di concorrenza, può colmare sostanzialmente questo divario.
Il Problema del Caveau di Dati al Cuore della Scoperta dei Farmaci
La Protein Data Bank, nota come PDB, è il repository aperto che ha reso possibile AlphaFold 2. Contiene più di 200.000 strutture proteiche determinate sperimentalmente, e la sua scala è stata fondamentale per la precisione rivoluzionaria di AlphaFold 2, un contributo riconosciuto con il Premio Nobel per la Chimica 2024.
Ma la prossima generazione di strumenti di IA per le proteine affronta una sfida diversa. Modelli come AlphaFold 3 sono progettati non solo per prevedere le forme delle proteine, ma per prevedere come le proteine interagiscono con altre molecole, compresi i farmaci candidati. È qui che il PDB risulta carente. Secondo Paul Mortenson, vicepresidente per la chimica computazionale e l’informatica presso Astex Pharmaceuticals, il PDB contiene solo circa 10.000 strutture determinate sperimentalmente che mostrano proteine che interagiscono con molecole simili a farmaci. È un numero piccolo rispetto alla diversità delle interazioni molecolari che la scoperta dei farmaci richiede.
Il resto di questi dati si trova all’interno delle aziende farmaceutiche. Generate attraverso tecniche come la cristallografia a raggi X e la criomicroscopia elettronica, queste strutture non sono mai state depositate nei database pubblici perché si riferiscono a programmi proprietari di sviluppo di farmaci. Il volume totale di questi dati privati è sconosciuto, ma alcune stime suggeriscono che potrebbe superare ciò che il PDB contiene. Come ha dichiarato John Karanicolas, responsabile della scoperta computazionale dei farmaci presso AbbVie, i dati mancanti nel PDB sono proprio i dati presenti nei sistemi interni delle aziende farmaceutiche.
Cosa Succede Quando Metti in Comune i Dati Privati
Per testare se quei dati privati potessero migliorare le performance dell’IA, AbbVie, Astex e diverse altre aziende farmaceutiche hanno formato una collaborazione chiamata AISB Structural Biology Network, o AISB. Il gruppo ha preso OpenFold3, una replica open-source di AlphaFold 3 che era stata addestrata solo sui dati pubblici del PDB, e lo ha messo a punto su ulteriori 20.167 strutture proteiche proprietarie. Queste strutture provenivano da cinque aziende e sono state condivise in modo da mantenere i dati di ciascuna azienda privati rispetto alle altre.
I risultati sono stati notevoli. Quando il modello AISB è stato testato contro 1.056 strutture proteina-ligando escluse dall’addestramento, ha previsto più della metà di esse con un alto livello di precisione. La versione pubblicamente disponibile di OpenFold3, addestrata solo sui dati pubblici, ha raggiunto le stesse prestazioni su appena un terzo di quelle strutture. Un modello open-source concorrente chiamato Boltz-2 ha raggiunto circa il 40%.
Mohammed AlQuraishi, un biologo computazionale della Columbia University che ha partecipato all’iniziativa, ha descritto il miglioramento come un incremento piuttosto consistente delle prestazioni. Karanicolas ha notato che il modello AISB ha anche superato i modelli addestrati solo sui dati della singola azienda, il che sottolinea un punto chiave: mettere in comune le informazioni tra le organizzazioni produce risultati che nessuna singola organizzazione potrebbe ottenere in modo indipendente.
Lo studio è stato descritto in un post sul blog e non è stato ancora sottoposto a revisione paritaria. Il modello in sé non è pubblicamente disponibile. Il team prevede di sottoporre il lavoro a una rivista peer-reviewed.
Perché Questo è Importante Oltre il Laboratorio
Ecco cosa la maggior parte della copertura sull’IA delle proteine tralascia: il collo di bottiglia nella scoperta dei farmaci non è la potenza di calcolo, e non è la raffinatezza algoritmica. Sono i dati. Nello specifico, è il tipo giusto di dati, esempi strutturati di proteine che si legano a molecole simili a farmaci, che riflettono l’effettiva diversità chimica che i ricercatori incontrano quando sviluppano nuove medicine.
L’esperimento AISB è una prova di concetto per un’idea più ampia: che il progresso scientifico nella scoperta di farmaci assistita dall’IA possa dipendere meno dalla costruzione di modelli più intelligenti e più dalla costruzione di migliori strutture di condivisione dei dati. L’istinto competitivo di mantenere privati i dati molecolari è comprensibile, ma i risultati dell’AISB suggeriscono che la condivisione collettiva dei dati, anche tra rivali, produce strumenti di cui tutti beneficжают.
Questa dinamica non è unica per il settore farmaceutico. Riecheggia un modello visibile in tutto lo sviluppo dell’IA: le organizzazioni che possono aggregare dati di addestramento diversi e di alta qualità ottengono capacità che coloro che lavorano in isolamento non possono eguagliare. Nella scoperta dei farmaci, la posta in gioco è particolarmente alta. Una migliore previsione proteina-ligando potrebbe accelerare l’identificazione di candidati farmaci vitali, ridurre il costo della ricerca in fase precoce e infine accorciare il percorso dall’ipotesi di laboratorio al trattamento clinico.
Anche gli sforzi finanziati con fondi pubblici si stanno muovendo in questa direzione. Un progetto chiamato OpenBind, sostenuto da un finanziamento del governo britannico fino a 8 milioni di sterline, ha già rilasciato centinaia di nuove strutture proteiche, con migliaia di altre pianificate.
In Breve
I modelli di IA per il ripiegamento delle proteine hanno un problema di dati: i database pubblici contengono pochissimi esempi di proteine che interagiscono con molecole simili a farmaci. Un consorzio di aziende farmaceutiche ha dimostrato che l’addestramento su più di 20.000 strutture proprietarie, messe in comune tra cinque aziende, ha innalzato la precisione di previsione da circa un terzo a più della metà dei casi di test. La scoperta ridiscute la sfida nella scoperta di farmaci assistita dall’IA: il fattore limitante non è l’algoritmo, è l’accesso ai dati giusti, e la condivisione di quei dati, anche tra concorrenti, produce risultati che nessuna singola organizzazione può raggiungere da sola.
Basato su un articolo di Nature: Machine Learning.