Por décadas, entender como os vírus funcionam no nível molecular exigiu um trabalho laboratorial meticuloso, equipamentos caros e anos de esforço. Uma parte significativa desse desafio resume-se a uma pergunta aparentemente simples: qual é a aparência real das proteínas virais em três dimensões e como elas interagem entre si? Uma grande expansão do AlphaFold Protein Structure Database está agora abordando essa questão em uma escala que antes era inimaginável.
Pesquisadores adicionaram mais de 8.000 dímeros de proteínas de vírus, que são pares de moléculas proteicas interativas, ao banco de dados do AlphaFold. Essas estruturas vêm de 23 famílias de vírus, todas incluindo membros capazes de infectar humanos. A adição faz parte de um portal de preparação para pandemias recém-lançado dentro do banco de dados, que é mantido pelo European Bioinformatics Institute do European Molecular Biology Laboratory (EMBL-EBI) em Hinxton, Reino Unido, e está disponível gratuitamente para seus mais de três milhões de usuários em todo o mundo.
Por que os vírus foram um ponto cego desde o início
O banco de dados do AlphaFold já contém estruturas previstas para a grande maioria das proteínas conhecidas na Terra. Os vírus, no entanto, têm sido uma lacuna persistente. Joe Grove, um virologista molecular da University of Glasgow, descreve-os claramente como um “ponto cego”. O motivo é em parte biológico e em parte técnico.
Muitos vírus, incluindo flavivírus como o Zika e a dengue, replicam-se produzindo primeiro uma única molécula grande chamada de poliproteína. Essa poliproteína é então cortada em proteínas funcionais individuais. O problema é que a sequência genética de um vírus nem sempre torna óbvio onde uma proteína termina e a próxima começa. Essa ambiguidade leva a previsões de estrutura incompletas ou imprecisas, razão pela qual entradas de alta qualidade para muitas proteínas virais vinham faltando até agora.
Para resolver isso, pesquisadores do Swiss Institute of Bioinformatics em Genebra identificaram sequências precisas para milhares de proteínas virais derivadas de poliproteínas. A equipe mais ampla analisou então sequências de 41.774 proteínas em aproximadamente 2.800 vírus, incluindo aqueles responsáveis pela mpox, pelo sarampo e pela hepatite B.
O que foi adicionado e o que ficou de fora
Usando o AlphaFold2, a equipe de pesquisa gerou previsões para 40.746 homodímeros (pares de fitas proteicas idênticas) e quase 1,7 milhão de heterodímeros (pares de moléculas diferentes). Nem todos entraram no banco de dados público. Apenas 2.749 dos homodímeros e 5.279 dos heterodímeros foram julgados precisos o suficiente para inclusão, embora todas as previsões tenham sido disponibilizadas publicamente de qualquer maneira.
A distinção importa. Ser incluído no banco de dados curado sinaliza um nível de confiança que torna os dados mais imediatamente úteis para pesquisadores que projetam experimentos ou desenvolvem tratamentos. O conjunto mais amplo de previsões, embora acessível, exige mais cautela na interpretação.
Também existem limitações conhecidas quanto ao que essas previsões capturam. As estruturas atuais não incluem as moléculas de açúcar que revestem muitas proteínas virais e as ajudam a escapar do sistema imunológico. Complexos proteicos maiores, conhecidos como trímeros ou montagens de ordem superior, também estão ausentes do banco de dados em muitos casos. A proteína spike que permite que o SARS-CoV-2 e outros coronavírus infectem células hospedeiras, por exemplo, é composta por três proteínas idênticas. O mesmo ocorre com a proteína de entrada do envelope do HIV. As previsões em nível de dímero para essas estruturas não foram precisas o suficiente para inclusão. Sameer Velankar, um bioinformata do EMBL-EBI, reconhece que adicionar previsões de trímeros é o próximo passo lógico, embora complexos maiores apresentem um desafio adicional: nem sempre fica claro quantas cópias de cada componente eles contêm.
O que isso significa além do laboratório
Eis o que a maior parte da cobertura sobre esse desenvolvimento deixa passar: a significância não é apenas ter mais dados. Trata-se de mudar a velocidade e a acessibilidade de uma etapa fundamental na virologia.
Historicamente, determinar a estrutura tridimensional de uma proteína exigia cristalografia de raios X ou crio-microscopia eletrônica, ambas demoradas, intensivas em recursos e dependentes de amostras físicas. O AlphaFold2 gera previsões computacionalmente, apenas a partir de dados de sequência. Essa mudança significa que pesquisadores em instituições sem acesso a infraestrutura de imagem cara agora podem lidar com dados estruturais que antes estavam fora de alcance.
A estruturação em torno da preparação para pandemias também merece ser levada a sério. Quando um novo vírus surge, uma das primeiras prioridades científicas é entender suas proteínas: como elas funcionam, como interagem e onde podem ser vulneráveis a drogas ou anticorpos. Ter um banco de dados curado e de livre acesso de estruturas de proteínas virais não substitui a validação laboratorial, mas comprime o tempo entre “um novo patógeno apareceu” e “aqui estão os alvos moleculares que vale a pena investigar”.
O próprio Grove enquadra a próxima fase em termos práticos: o valor dos dados ficará claro à medida que as equipes de pesquisa começarem a trabalhar com eles, testando previsões contra resultados experimentais e identificando quais estruturas se sustentam sob escrutínio.
Resumindo
O banco de dados do AlphaFold adicionou mais de 8.000 estruturas de pares de proteínas virais de 23 famílias de vírus que infectam humanos, juntamente com um novo portal de preparação para pandemias. A expansão aborda uma lacuna de longa data causada pela complexidade das poliproteínas virais. Limitações permanecem, incluindo a ausência de revestimentos de moléculas de açúcar e a exclusão de complexos proteicos maiores. O que a adição representa, em sua essência, é uma redução significativa na barreira entre um surto viral e uma compreensão em nível molecular do que os pesquisadores estão enfrentando.
Com base em reportagem de Nature: Machine Learning.