The Brief
Ciência e descobertas 5 min de leitura

De Um Terço a Mais da Metade: Como os Dados Farmacêuticos Estão Reformulando a IA de Proteínas

NAVION

Partilhar

A IA de dobramento de proteínas tem sido um dos avanços científicos mais celebrados dos últimos anos. No entanto, uma limitação silenciosa tem se acumulado sob a superfície. Os modelos que preveem como as proteínas interagem com potenciais medicamentos são tão bons quanto os dados em que foram treinados, e esses dados, ao que parece, são muito mais escassos do que a maioria das pessoas percebe. Um consórcio de empresas farmacêuticas demonstrou agora que desbloquear dados moleculares proprietários, mantidos em sigilo por motivos competitivos, pode fechar substancialmente essa lacuna.

O Problema do Cofre de Dados no Coração da Descoberta de Medicamentos

O Protein Data Bank, conhecido como PDB, é o repositório aberto que tornou o AlphaFold 2 possível. Ele contém mais de 200.000 estruturas de proteínas determinadas experimentalmente, e sua escala foi fundamental para a precisão inovadora do AlphaFold 2, uma contribuição reconhecida com o Prêmio Nobel de Química de 2024.

Mas a próxima geração de ferramentas de IA de proteínas enfrenta um desafio diferente. Modelos como o AlphaFold 3 são projetados não apenas para prever formas de proteínas, mas para prever como as proteínas interagem com outras moléculas, incluindo candidatos a medicamentos. É aqui que o PDB fica aquém. De acordo com Paul Mortenson, vice-presidente de química computacional e informática na Astex Pharmaceuticals, o PDB contém apenas cerca de 10.000 estruturas determinadas experimentalmente que mostram proteínas interagindo com moléculas semelhantes a drogas. Esse é um número pequeno em relação à diversidade de interações moleculares que a descoberta de medicamentos exige.

O restante desses dados permanece dentro das empresas farmacêuticas. Geradas por meio de técnicas como cristalografia de raios X e criomicroscopia eletrônica, essas estruturas nunca foram depositadas em bancos de dados públicos porque se relacionam a programas proprietários de desenvolvimento de medicamentos. O volume total desses dados privados é desconhecido, mas algumas estimativas sugerem que pode superar o que o PDB abriga. Como disse John Karanicolas, chefe de descoberta computacional de medicamentos na AbbVie, os dados que faltam no PDB são precisamente os dados presentes nos sistemas internos das empresas farmacêuticas.

O Que Acontece Quando Você Agrupa os Dados Privados

Para testar se esses dados privados poderiam melhorar o desempenho da IA, a AbbVie, a Astex e várias outras empresas farmacêuticas formaram uma colaboração chamada AI Structural Biology Network, ou AISB. O grupo pegou o OpenFold3, uma replicação de código aberto do AlphaFold 3 que havia sido treinada apenas com dados públicos do PDB, e aprimorou o modelo com mais 20.167 estruturas de proteínas proprietárias. Essas estruturas vieram de cinco empresas e foram compartilhadas de uma forma que manteve os dados de cada firma privados em relação às outras.

Os resultados foram notáveis. Quando o modelo do AISB foi testado contra 1.056 estruturas de proteína-ligante mantidas fora do treinamento, ele previu mais da metade delas com um alto nível de precisão. A versão publicamente disponível do OpenFold3, treinada apenas com dados públicos, alcançou o mesmo desempenho em apenas um terço dessas estruturas. Um modelo concorrente de código aberto chamado Boltz-2 alcançou cerca de 40%.

Mohammed AlQuraishi, um biólogo computacional da Universidade Columbia que participou do esforço, descreveu a melhoria como “um salto bastante grande no desempenho”. Karanicolas observou que o modelo do AISB também superou os modelos treinados apenas com os dados de cada empresa individual, o que ressalta um ponto importante: agrupar informações entre organizações produz resultados que nenhuma organização isolada conseguiria alcançar de forma independente.

O estudo foi descrito em uma postagem de blog e ainda não foi revisado por pares. O modelo em si não está publicamente disponível. A equipe planeja enviar o trabalho para um periódico revisado por pares.

Por Que Isso Importa Além do Laboratório

Aqui está o que a maior parte da cobertura sobre IA de proteínas deixa passar: o gargalo na descoberta de medicamentos não é o poder computacional, e não é a sofisticação algorítmica. São os dados. Especificamente, é o tipo certo de dados, exemplos estruturados de proteínas ligando-se a moléculas semelhantes a drogas, que reflete a real diversidade química que os pesquisadores encontram ao desenvolver novos medicamentos.

O experimento do AISB é uma prova de conceito para uma ideia mais ampla: o progresso científico na descoberta de medicamentos auxiliada por IA pode depender menos da construção de modelos mais inteligentes e mais da construção de melhores estruturas de compartilhamento de dados. O instinto competitivo de manter os dados moleculares privados é compreensível, mas os resultados do AISB sugerem que o compartilhamento coletivo de dados, mesmo entre rivais, produz ferramentas que beneficiam a todos.

Essa dinâmica não é exclusiva dos produtos farmacêuticos. Ela ecoa um padrão visível em todo o desenvolvimento de IA: as organizações que conseguem agregar dados de treinamento diversos e de alta qualidade ganham capacidades que aquelas que trabalham isoladamente não conseguem igualar. Na descoberta de medicamentos, o que está em jogo é particularmente alto. Uma previsão aprimorada de proteína-ligante pode acelerar a identificação de candidatos a medicamentos viáveis, reduzir o custo da pesquisa em estágio inicial e, finalmente, encurtar o caminho da hipótese laboratorial ao tratamento clínico.

Esforços financiados publicamente também estão caminhando nessa direção. Um projeto chamado OpenBind, apoiado por até 8 milhões de libras esterlinas em financiamento do governo do Reino Unido, já lançou centenas de novas estruturas de proteínas, com milhares de outras planejadas.

Em Resumo

Os modelos de IA de dobramento de proteínas têm um problema de dados: os bancos de dados públicos contêm poucos exemplos de proteínas interagindo com moléculas semelhantes a drogas. Um consórcio de empresas farmacêuticas demonstrou que o treinamento em mais de 20.000 estruturas proprietárias, agrupadas entre cinco firmas, elevou a precisão da previsão de aproximadamente um terço para mais da metade dos casos de teste. A descoberta reestrutura o desafio na descoberta de medicamentos auxiliada por IA: o fator limitante não é o algoritmo, é o acesso aos dados certos, e o compartilhamento desses dados, mesmo entre concorrentes, produz resultados que nenhuma organização isolada consegue alcançar sozinha.

Com base em reportagem de Nature: Machine Learning.

Escrito por

NAVION