Ir para o conteúdo
Ir para insights Blog

Viral Escape

Viral Escape
Escrito por
Data Science Lab
Publicado em
17 de agosto de 2021
Estamos quase lá. Praticamente todas as pessoas nos Países Baixos já tiveram a oportunidade de se vacinar, a regra do distanciamento de 1,5 metros vai deixar de vigorar e o governo pretende levantar também as restantes medidas. Parece o fim da pandemia, não é? Infelizmente, o SARS-CoV-2 (o coronavírus que causa a COVID-19) sofre mutações rapidamente, tal como o vírus da gripe. Além dessas milhares de mutações, já conhecemos várias variantes do SARS-CoV-2, incluindo a alfa, a beta, a gama e a delta (atualmente a mais comum). Felizmente, a maioria das vacinas também continua a ser eficaz contra as novas variantes do vírus. Mas e se isso deixar de acontecer? Um "viral escape" é um cenário preocupante em que o vírus sofre uma mutação suficiente para que os anticorpos existentes deixem de o reconhecer. As consequências são graves: uma mutação perigosa deste tipo contornaria o sistema imunitário das pessoas vacinadas (ou anteriormente infetadas). Em suma, voltaríamos à estaca zero.

Representação de partículas virais com saliências.

Como a inteligência artificial pode ajudar

Para evitar este cenário, é importante identificar quais das milhares de mutações podem realmente representar um grande perigo, para que o desenvolvimento de vacinas possa responder o mais rapidamente possível. A inteligência artificial (IA) pode ajudar. Investigadores do MIT desenvolveram uma nova forma de modelar ‘viral escapes’ com base em modelos originalmente criados para analisar a linguagem: os conhecidos modelos de Natural Language Processing (NLP).

A ideia de usar um modelo de NLP neste caso é a seguinte: os vírus sofrem mutações que respeitam as regras biológicas da estrutura das proteínas, mas que também lhes são o mais favoráveis possível. Por exemplo, o SARS-CoV-2 sofre mutações na proteína spike, visível na imagem abaixo. Atualmente, as pessoas que tiveram recentemente COVID-19 ou foram vacinadas têm anticorpos que se ligam à proteína spike. Por isso, as células do vírus SARS-CoV-2 deixam de conseguir estabelecer contacto com as células humanas, e uma pessoa fica infetada. O objetivo do vírus é, então, voltar a sofrer rapidamente mutações nas proteínas spike, para que os anticorpos deixem de se ligar a elas, mas os recetores das células humanas ainda o consigam fazer. O vírus procura, assim, sofrer mutações que lhe permitam escapar ao sistema imunitário humano (aos anticorpos), sem morrer nem perder a capacidade de se multiplicar. Da mesma forma, para um modelo de NLP, uma frase não só tem de ter o significado certo (semântica), como também tem de estar gramaticalmente correta (sintaxe). Usando estes dois princípios, os investigadores adaptaram de forma criativa modelos de NLP para detetar alterações no código genético dos vírus.

Esquema de um coronavírus que se liga a uma célula humana através da proteína spike.

Um exemplo

O exemplo abaixo ilustra como o modelo de NLP estima que mutações do vírus podem provocar viral escape. A primeira frase representa o vírus antes de sofrer uma mutação. A segunda frase (a contar da esquerda) mostra uma pequena mutação. O significado da frase quase não mudou e a frase está gramaticalmente correta. Com esta mutação, o novo vírus ainda se assemelha o suficiente ao original para que o sistema imunitário o reconheça e ataque. Não são necessários novos anticorpos. A terceira frase está gramaticalmente incorreta. Na linguagem do vírus, esta mutação seria considerada falhada. A última frase é onde reside o perigo. Está gramaticalmente correta e tem uma semântica adequada. Estas são as exceções que, segundo o modelo de NLP, podem provocar viral escape. Os investigadores chamam à procura destas exceções 'constrained semantic change search' (CSCS).

Quatro versões da mesma frase, ordenadas desde a original até à versão sem sentido.

Modelo de NLP e treino

Naturalmente, o modelo NLP não foi treinado com frases, mas com os elementos constituintes de diferentes proteínas spike de coronavírus: as chamadas sequências de aminoácidos. O conjunto de treino continha pouco menos de 1000 sequências da proteína spike do SARS-CoV-2 e mais 3000 sequências de aminoácidos de proteínas spike de outros tipos de coronavírus. A imagem abaixo mostra o modelo NLP. Internamente, o modelo constrói uma representação semântica, também chamada “embedding”, para uma determinada sequência de aminoácidos. O resultado do modelo mostra até que ponto um aminoácido se enquadra na “gramática” da sequência. Na imagem, o aminoácido que melhor se enquadra gramaticalmente na sequência está assinalado com a letra maiúscula A.

Esquema de um modelo de linguagem que avalia sequências de proteínas.

Testes

Das 891 sequências diferentes de aminoácidos de proteínas spike de coronavírus que os investigadores analisaram com o modelo, uma provinha de uma estirpe que reinfetou uma pessoa recuperada da Covid-19 no ano anterior. Por isso, esta sequência recebeu rapidamente uma pontuação elevada segundo a CSCS. Em todo o conjunto, foram encontradas apenas outras três sequências que apresentavam simultaneamente uma maior alteração semântica e uma maior «gramaticalidade». Os investigadores também introduziram algumas das novas variantes no algoritmo e verificaram que tanto a estirpe sul-africana como a britânica obtiveram pontuações "bastante elevadas" quanto à probabilidade de evasão.

Como prevenir a evasão viral

E agora? Se as novas mutações forem acompanhadas de perto e o algoritmo for utilizado para avaliar o perigo que representam, os investigadores poderão testar as estirpes suspeitas em laboratório o mais rapidamente possível e adaptar as vacinas em conformidade. O teste funciona da seguinte forma. As estirpes suspeitas são colocadas em contacto com anticorpos. Se os anticorpos não se ligarem às proteínas spike, os anticorpos atuais deixam de oferecer proteção. Ainda não se sabe quanto tempo os responsáveis pelo desenvolvimento das vacinas poderão efetivamente poupar com uma abordagem baseada em IA como esta. O que sabemos é que, numa pandemia desta dimensão, cada segundo conta.

Referências

  1. Hie, Brian, et al. "Learning the language of viral evolution and escape." Science371.6526 (2021): 284-288. DOI: 10.1126/science.abd7331
  2. https://singularityhub.com/2021/01/19/a-language-ai-is-accurately-predicting-covid-19-escape-mutations/
  3. https://spectrum.ieee.org/ai-predicts-most-potent-covid-19-mutations
  4. https://news.mit.edu/2021/model-viruses-escape-immune-0114
  5. https://qz.com/africa/1995639/scientists-use-algorithms-to-predict-new-covid-19-variants/
Blog

Também poderá ter interesse nisto,

Subscreva a nossa newsletter.

Quer ser a primeira pessoa a saber quando publicamos um novo artigo no blogue?

Introduza um endereço de e-mail válido.