NVIDIA ha integrado sus capacidades de computación avanzada en una alianza estratégica junto a Google DeepMind y el Instituto Europeo de Bioinformática del Laboratorio Europeo de Biología Molecular (EMBL-EBI). El objetivo central de esta colaboración es la publicación de las estructuras tridimensionales predichas de los complejos proteicos de más de 2.800 virus, datos que quedan disponibles de forma abierta para la comunidad científica internacional a través de la base de datos AlphaFold.
La importancia de este despliegue radica en que el diseño de vacunas y fármacos depende directamente del conocimiento de la arquitectura de las proteínas. Mientras que durante la crisis del COVID-19 los investigadores contaban con décadas de estudios previos sobre los coronavirus, la próxima pandemia podría originarse a partir de un agente patógeno desconocido. Para mitigar este riesgo, la coalición ha decidido almacenar preventivamente el conocimiento estructural de miles de virus, evitando que los científicos tengan que empezar desde cero ante un nuevo brote.
El conjunto de datos ha sido generado mediante AlphaFold2, el modelo de inteligencia artificial de Google DeepMind especializado en predecir cómo se pliegan las proteínas para adoptar sus formas tridimensionales. Para lograr que este proceso fuera viable a gran escala, se utilizó NVIDIA BioNeMo Inference Runtime, una herramienta de optimización que permitió ejecutar la inferencia de miles de proteomas virales en tiempos reducidos, identificando los complejos o grupos de proteínas que interactúan entre sí dentro de cada virus.
La metodología tradicional para determinar la estructura de una proteína implica procesos costosos y lentos, como la cristalización de la proteína y el uso de rayos X. Estos métodos pueden requerir años de trabajo y costar miles de dólares por cada estructura individual. En contraste, el flujo de trabajo optimizado con BioNeMo sobre GPUs de NVIDIA permite obtener predicciones en cuestión de minutos, facilitando que los científicos validen posteriormente las predicciones de alta confianza mediante métodos experimentales.
Un dato revelador de este proyecto es que aproximadamente el 30 % de las interacciones proteicas añadidas a la base de datos son completamente nuevas para la ciencia. Estas formas de interacción no habían sido documentadas previamente en el Protein Data Bank, que es el repositorio principal de estructuras determinadas experimentalmente. Esto significa que la IA no solo ha automatizado lo conocido, sino que ha generado hipótesis sobre estructuras biológicas que el ojo humano y los métodos tradicionales no habían detectado.
La capacidad de analizar complejos proteicos, y no solo moléculas aisladas, es fundamental. La mayoría de las proteínas no operan solas, sino que se agrupan en complejos para ejecutar funciones sofisticadas. Estos complejos suelen ser el objetivo principal de las vacunas o los medicamentos, ya que interrumpir su funcionamiento es la clave para neutralizar la capacidad infectiva de un virus. El ejemplo más claro fue la proteína spike del SARS-CoV-2, cuyo conocimiento estructural fue el pilar para el desarrollo rápido de las vacunas.
Para garantizar que este avance no se limite a los centros de investigación con mayores recursos, NVIDIA ha liberado el BioNeMo Structure Prediction Pipeline. Este flujo de trabajo acelerado por GPU permite que cualquier investigador pueda pasar de una secuencia de proteínas a una estructura 3D predicha para sus propios objetivos de estudio, eliminando barreras técnicas y económicas.
La coalición que sostiene este proyecto es extensa y multidisciplinar. Además de NVIDIA y Google DeepMind, participan la Coalición para Innovaciones en Preparación ante Epidemias (CEPI), el EMBL-EBI, la Universidad Nacional de Seúl, la Universidad Sungkyunkwan, el Instituto Suizo de Bioinformática y la Universidad de Glasgow. Esta red asegura que el conocimiento fluya hacia regiones con menos recursos, que suelen ser las primeras en enfrentar brotes infecciosos.
La publicación de estos datos coincide con una reunión de la Asamblea General de las Naciones Unidas convocada por el Foro Económico Mundial sobre prevención y respuesta a pandemias. Con esta adición, la base de datos AlphaFold supera las 260 millones de predicciones de proteínas y complejos proteicos, cubriendo prácticamente todas las proteínas catalogadas por la ciencia hasta la fecha.
La urgencia de este proyecto se apoya en análisis realizados por el Center for Global Development, que estima que existe una probabilidad cercana al 50 % de que el mundo enfrente una pandemia con una gravedad similar a la del COVID-19 para el año 2050. La estrategia de la coalición no es predecir exactamente qué virus causará la próxima crisis, sino crear un inventario masivo de conocimiento estructural previo.
Joe Grove, profesor de virología molecular en el Centro de Investigación de Virus de la Universidad de Glasgow, señala que el objetivo es evitar el trabajo a ciegas que caracterizó a la investigación biológica en décadas pasadas. Al proporcionar datos estructurales de alta calidad a los investigadores actuales y a los estudiantes de doctorado, se acelera la ciencia fundamental, permitiendo que la respuesta ante un patógeno emergente sea inmediata y basada en datos ya existentes.
El sistema de la base de datos incluye etiquetas de confianza para cada predicción, lo que permite a los biólogos distinguir entre los modelos más probables y aquellos que requieren una verificación experimental más exhaustiva. Este enfoque convierte a la base de datos en un motor de generación de hipótesis, donde la comunidad de IA y la biológica pueden colaborar para investigar cómo interactúan las proteínas dentro de un proteoma viral completo.
La disponibilidad de estas estructuras tiene consecuencias directas en el desarrollo de diagnósticos virales y tratamientos. Al conocer la forma de los complejos proteicos de virus que afectan a los humanos, desde el resfriado común hasta amenazas emergentes como el Mpox, las farmacéuticas pueden diseñar moléculas que encajen con precisión quirúrgica en los sitios activos del virus, reduciendo drásticamente el tiempo de ensayo y error en el laboratorio.
Para los desarrolladores de software y expertos en IA, la liberación del pipeline de BioNeMo establece un estándar de cómo la computación acelerada puede aplicarse a la biología digital. La capacidad de escalar la inferencia a miles de proteomas demuestra que el cuello de botella ya no es la capacidad de cálculo, sino la disponibilidad de datos de calidad y la validación biológica.
Este ecosistema de ciencia abierta desplaza el paradigma de la investigación cerrada hacia un modelo de colaboración masiva. Al hacer que los datos sean abiertos, se reduce la duplicidad de esfuerzos en diferentes laboratorios del mundo y se permite que los científicos de países en vías de desarrollo tengan las mismas herramientas de análisis que los centros de élite, equilibrando la capacidad de respuesta global ante crisis sanitarias.
El despliegue técnico de NVIDIA BioNeMo Inference Runtime resuelve un problema crítico de escalabilidad en la biología computacional. Hasta ahora, la ejecución de modelos como AlphaFold2 requería una gestión manual y fragmentada de los recursos de cómputo, lo que hacía inviable procesar miles de proteomas virales de forma simultánea. El runtime de BioNeMo optimiza la carga de trabajo en las GPUs, permitiendo que la inferencia de estructuras complejas se realice en lotes masivos sin degradar la precisión de la predicción. Esto transforma la predicción de proteínas de un proceso artesanal, centrado en moléculas individuales, a un proceso industrial de análisis de proteomas completos.
La distinción entre proteínas aisladas y complejos proteicos es el núcleo técnico de este avance. Una proteína individual es una cadena de aminoácidos plegada, pero en el entorno biológico real, estas cadenas se ensamblan en máquinas moleculares llamadas complejos. Estos complejos son los que realmente ejecutan la entrada del virus en la célula humana o la replicación del material genético viral. Al mapear la estructura de estos complejos, la IA permite identificar puntos de vulnerabilidad que eran invisibles cuando solo se analizaban las proteínas por separado. Este enfoque es el que permite pasar de una comprensión teórica de la secuencia genética a una comprensión física de la maquinaria viral.
En términos de impacto para el sector biotecnológico, la reducción de costes es masiva. La cristalografía de rayos X y la criomicroscopía electrónica, aunque precisas, son procesos lentos que dependen de la capacidad de aislar y purificar la proteína en el laboratorio. El uso de BioNeMo permite que las empresas farmacéuticas realicen un cribado virtual previo. En lugar de intentar cristalizar cien proteínas diferentes para ver cuál es un buen objetivo terapéutico, pueden utilizar las predicciones de AlphaFold para seleccionar las tres estructuras con mayor confianza y mayor probabilidad de éxito, optimizando la inversión en I+D y reduciendo los tiempos de desarrollo de fármacos de años a meses.
La implementación de este sistema también altera la formación académica en virología. Como indica Joe Grove, la generación anterior de investigadores trabajaba en la oscuridad, basando sus hipótesis en suposiciones sobre la forma de las proteínas. Los actuales doctorandos tienen acceso inmediato a datos estructurales de alta calidad, lo que significa que sus investigaciones pueden comenzar directamente en la fase de validación y aplicación, en lugar de dedicar años a la mera identificación estructural. Esto acelera el ritmo de la ciencia fundamental y permite que el talento humano se centre en la resolución de problemas complejos en lugar de en la recolección de datos básicos.
Respecto a la gestión de la incertidumbre, la coalición ha implementado un sistema de etiquetado de confianza. No todas las predicciones de la IA son igualmente precisas. Al asignar un valor de confianza a cada estructura, se evita que la comunidad científica tome decisiones basadas en modelos erróneos. Los biólogos pueden filtrar la base de datos para trabajar solo con las estructuras de alta confianza o, por el contrario, utilizar las de baja confianza como objetivos para nuevas investigaciones experimentales, convirtiendo la incertidumbre de la IA en una hoja de ruta para la experimentación biológica.
El alcance geográfico de esta iniciativa es un factor determinante para la salud pública global. Los brotes virales suelen emerger en regiones con infraestructuras de laboratorio limitadas. Al liberar el BioNeMo Structure Prediction Pipeline y los datos en la base de datos AlphaFold, se elimina la dependencia de que las muestras biológicas tengan que viajar a centros de élite en Estados Unidos o Europa para ser analizadas. Un investigador en una zona afectada puede utilizar la secuencia genética del virus local y, mediante el pipeline de NVIDIA, obtener una predicción estructural inmediata, permitiendo una respuesta local coordinada y basada en datos.
La integración de estos datos en el contexto de la Asamblea General de las Naciones Unidas y el Foro Económico Mundial subraya que la IA ya no es solo una herramienta de optimización empresarial, sino un componente de la infraestructura de seguridad sanitaria global. La creación de este inventario estructural preventivo actúa como un seguro biológico. Al cubrir familias virales que infectan a humanos, desde virus comunes hasta amenazas como el Mpox, se establece una línea base de conocimiento que reduce la ventana de vulnerabilidad entre la aparición de un virus y el desarrollo de una contramedida efectiva.
Finalmente, la arquitectura de ciencia abierta adoptada por NVIDIA y Google DeepMind rompe con el modelo de propiedad intelectual cerrada en la fase de descubrimiento básico. Al hacer que más de 260 millones de predicciones sean públicas, se fomenta un ciclo de retroalimentación donde cualquier científico del mundo puede corregir o mejorar un modelo. Esta democratización del acceso a la biología fundamental es la única vía para escalar la capacidad de respuesta humana frente a la velocidad de mutación de los virus, asegurando que el conocimiento estructural no sea un privilegio de unas pocas instituciones, sino un bien público global.




