Per decenni, capire come funzionano i virus a livello molecolare ha richiesto un lavoro di laboratorio meticoloso, attrezzature costose e anni di sforzi. Una parte significativa di questa sfida si riduce a una domanda ingannevolmente semplice: che aspetto hanno realmente le proteine virali in tre dimensioni e come interagiscono tra loro? Una grande espansione del database di strutture proteiche AlphaFold sta ora affrontando questa questione su una scala precedentemente inimmaginabile.
I ricercatori hanno aggiunto più di 8.000 dimeri di proteine virali, che sono coppie di molecole proteiche interagenti, al database di AlphaFold. Queste strutture provengono da 23 famiglie di virus, tutte incluse tra quelle capaci di infettare gli umani. L’aggiunta fa parte di un portale per la preparazione alle pandemie appena lanciato all’interno del database, gestito dall’Istituto Europeo di Bioinformatica del Laboratorio Europeo di Biologia Molecolare (EMBL-EBI) di Hinxton, nel Regno Unito, ed è liberamente disponibile per i suoi oltre tre milioni di utenti in tutto il mondo.
Perché i virus sono stati un punto cieco fin dall’inizio
Il database di AlphaFold contiene già strutture predette per la stragrande maggioranza delle proteine conosciute sulla Terra. I virus, tuttavia, sono stati una lacuna persistente. Joe Grove, un virologo molecolare dell’Università di Glasgow, li descrive chiaramente come un “punto cieco”. Il motivo è in parte biologico e in parte tecnico.
Molti virus, compresi i flavivirus come Zika e dengue, si replicano producendo prima un’unica grande molecola chiamata poliproteina. Quella poliproteina viene poi tagliata in singole proteine funzionali. Il problema è che la sequenza genetica di un virus non rende sempre ovvio dove finisce una proteina e dove inizia la successiva. Questa ambiguità porta a predizioni di strutture incomplete o imprecise, ed è il motivo per cui fino ad ora sono mancate voci di alta qualità per molte proteine virali.
Per risolvere questo problema, i ricercatori del Swiss Institute of Bioinformatics di Ginevra hanno identificato sequenze accurate per migliaia di proteine virali derivate da poliproteine. Il team più ampio ha poi analizzato le sequenze di 41.774 proteine provenienti da circa 2.800 virus, compresi quelli responsabili del vaiolo delle scimmie, del morbillo e dell’epatite B.
Cosa è stato aggiunto e cosa è stato escluso
Usando AlphaFold2, il team di ricerca ha generato predizioni per 40.746 omodimeri (coppie di filamenti proteici identici) e quasi 1,7 milioni di eterodimeri (coppie di molecole diverse). Non tutti sono entrati nel database pubblico. Solo 2.749 degli omodimeri e 5.279 degli eterodimeri sono stati giudicati sufficientemente accurati per l’inclusione, sebbene tutte le predizioni siano state rese pubbliche a prescindere.
La distinzione è importante. Essere inclusi nel database curato segnala un livello di confidenza che rende i dati immediatamente più utili per i ricercatori che progettano esperimenti o sviluppano trattamenti. Il set più ampio di predizioni, sebbene accessibile, richiede maggiore cautela nell’interpretazione.
Ci sono anche limiti noti a ciò che queste predizioni catturano. Le strutture attuali non includono le molecole di zucchero che rivestono molte proteine virali e le aiutano a eludere il sistema immunitario. Anche i complessi proteici più grandi, noti come trimeri o assemblaggi di ordine superiore, sono assenti dal database in molti casi. La proteina spike che consente a SARS-CoV-2 e ad altri coronavirus di infettare le cellule ospiti, per esempio, è composta da tre proteine identiche. Lo stesso vale per la proteina di ingresso dell’involucro dell’HIV. Le predizioni a livello di dimero per queste strutture non erano abbastanza accurate per essere incluse. Sameer Velankar, un bioinformatico dell’EMBL-EBI, riconosce che l’aggiunta di predizioni per i trimeri è il prossimo passo logico, sebbene i complessi più grandi presentino una sfida aggiuntiva: non è sempre chiaro quante copie di ciascun componente contengano.
Cosa significa questo oltre il laboratorio
Ecco cosa la maggior parte della copertura di questo sviluppo tralascia: la significatività non riguarda solo l’avere più dati. Riguarda il cambiamento della velocità e dell’accessibilità di un passaggio fondamentale in virologia.
Storicamente, determinare la struttura tridimensionale di una proteina richiedeva o la cristallografia a raggi X o la criomicroscopia elettronica, entrambe dispendiose in termini di tempo e risorse, oltre che dipendenti da campioni fisici. AlphaFold2 genera predizioni in modo computazionale, partendo dai soli dati di sequenza. Questo cambiamento significa che i ricercatori in istituzioni senza accesso a costose infrastrutture di imaging possono ora interagire con dati strutturali che prima erano fuori portata.
Anche l’inquadramento nella preparazione alle pandemie merita di essere preso sul serio. Quando emerge un nuovo virus, una delle prime priorità scientifiche è comprendere le sue proteine: come funzionano, come interagiscono e dove potrebbero essere vulnerabili a farmaci o anticorpi. Avere un database curato e liberamente accessibile di strutture proteiche virali non sostituisce la validazione di laboratorio, ma comprime il tempo tra “è apparso un nuovo patogeno” e “ecco i bersagli molecolari che vale la pena indagare”.
Lo stesso Grove inquadra la fase successiva in termini pratici: il valore dei dati diventerà chiaro man mano che i team di ricerca inizieranno a lavorarci, testando le predizioni rispetto ai risultati sperimentali e identificando quali strutture reggono sotto esame.
In breve
Il database di AlphaFold ha aggiunto più di 8.000 strutture di coppie di proteine virali provenienti da 23 famiglie di virus che infettano l’uomo, insieme a un nuovo portale per la preparazione alle pandemie. L’espansione affronta una lacuna di lunga data causata dalla complessità delle poliproteine virali. Rimangono dei limiti, tra cui l’assenza di rivestimenti di molecole di zucchero e l’esclusione di complessi proteici più grandi. Ciò che l’aggiunta rappresenta, nella sua essenza, è una significativa riduzione della barriera tra un’epidemia virale e una comprensione a livello molecolare di ciò con cui i ricercatori hanno a che fare.
Basato su un articolo di Nature: Machine Learning.