Despliegue de Vera Rubin NVL72 y redes Spectrum-X
CoreWeave ha integrado la arquitectura de computación, redes y software de NVIDIA en una nube diseñada específicamente para las demandas de la inteligencia artificial. Durante el evento CoreWeave Fully Connected en San Francisco, la compañía anunció la disponibilidad de los sistemas NVIDIA Vera Rubin NVL72, apoyados por la tecnología de redes Ethernet Spectrum-X 102.4T. Esta infraestructura permite que los modelos de IA no solo se entrenen, sino que operen en entornos de producción con una eficiencia significativamente mayor.
La implementación de Vera Rubin NVL72 representa un salto en el rendimiento de la inferencia, que es el proceso mediante el cual un modelo ya entrenado genera una respuesta a partir de una entrada. Cognition, el laboratorio responsable del ingeniero de software de IA llamado Devin, se ha convertido en el primer cliente en ejecutar cargas de trabajo de producción sobre este hardware. En las pruebas realizadas por Cognition, el sistema Vera Rubin NVL72 alcanzó un incremento de hasta 4,8 veces en el rendimiento total de tokens en comparación con la línea base de GB200 NVL72, utilizando tareas reales de ingeniería de software extraídas de FrontierCode.
Este aumento en el rendimiento de tokens es crítico para la IA agéntica, ya que los agentes autónomos requieren generar código en tiempo real y realizar razonamientos complejos de múltiples pasos. Para Devin, estas mejoras se traducen en una mayor capacidad de respuesta y una generación de código más fluida. La arquitectura de CoreWeave permite gestionar estas capacidades a través de diversas herramientas de control y despliegue, incluyendo el servicio de Kubernetes de CoreWeave, SUNK, Mission Control, Sandboxes e Inference.
La CPU NVIDIA Vera y la gestión de entornos aislados
El despliegue de la IA agéntica introduce presiones específicas en la infraestructura tecnológica. Por un lado, la ejecución de agentes exige una computación de baja latencia a gran escala. Por otro lado, la mejora de estos agentes mediante el postentrenamiento requiere la ejecución simultánea de miles de entornos aislados. Para resolver este cuello de botella, CoreWeave ha incorporado la CPU NVIDIA Vera, el primer procesador diseñado específicamente para cargas de trabajo agénticas.
La CPU Vera permite concentrar 128 CPUs y 11.264 núcleos en un solo rack, lo que proporciona capacidad suficiente para ejecutar más de 11.000 entornos concurrentes, asignando un núcleo por cada entorno. Estos entornos se gestionan a través de CoreWeave Sandboxes, que ofrecen aislamiento a nivel de hardware. Esta separación es fundamental para que los agentes puedan ejecutar código, utilizar herramientas y someterse a evaluaciones de refuerzo sin interferir entre sí ni comprometer la seguridad del sistema.
En las pruebas de rendimiento, el uso de CPUs NVIDIA Vera ha reducido los tiempos de inicio de los sandboxes de agentes en más de tres veces. Asimismo, en el benchmark Terminal-Bench, se ha registrado una ganancia de rendimiento de 1,7 veces en todas las tareas superadas. La comunicación entre estos entornos se optimiza mediante switches Ethernet Spectrum-X y DPUs BlueField-4, que aseguran que la transferencia de datos sea segura y mantenga una latencia mínima.
CoreWeave Forge y el ciclo de mejora continua
Para cerrar la brecha entre el entrenamiento y la producción, CoreWeave ha lanzado CoreWeave Forge. Se trata de un entorno conectado diseñado para entrenar, evaluar y perfeccionar modelos y agentes sobre computación acelerada de NVIDIA. Tradicionalmente, el ciclo de mejora de la IA estaba fragmentado entre herramientas de distintos proveedores, lo que provocaba una pérdida de información en cada transferencia de datos. Forge unifica este proceso integrando capacidades de Weights & Biases, la experiencia en postentrenamiento de OpenPipe y el proyecto de notebooks de código abierto marimo.
Dentro de este ecosistema, CoreWeave ARIA permite a los usuarios investigar, codificar e iterar en el ciclo de la IA. Esta herramienta analiza las ejecuciones, propone experimentos y recomienda cambios de código que se almacenan directamente en GitHub, aportando evidencia basada en datos sobre qué cambios impulsaron la mejora del modelo. Complementariamente, CoreWeave Agent Lens transforma la observabilidad de los agentes en producción en conclusiones accionables, mejorando la detección de fallos en un 20 % y reduciendo el coste de reparación a la mitad al analizar millones de trazas de ejecución.
El sistema de Sandboxes de CoreWeave, ahora disponible de forma general, permite ejecutar llamadas a herramientas, aprendizaje por refuerzo (RL) y evaluaciones en entornos aislados de CPU o GPU. Estos pueden operar en infraestructura serverless o en la misma infraestructura donde se realiza el entrenamiento. El uso de RL serverless ha demostrado ser 1,4 veces más rápido y un 40 % más económico que las configuraciones autogestionadas.
Optimización de inferencia y aplicaciones sectoriales
La infraestructura de CoreWeave utiliza NVIDIA Dynamo, un marco de inferencia de código abierto para fábricas de IA, que potencia tanto el servicio de inferencia gestionada como la función RL Rollouts. Esta última capacidad, actualmente en vista previa privada, permite cargar nuevos checkpoints o puntos de control del modelo en un despliegue activo sin necesidad de reiniciar el servicio. De este modo, el aprendizaje por refuerzo puede continuar sin interrupciones, manteniendo la misma eficiencia de inferencia que en el entorno de producción.
Empresas como Canva, Capital One y MasterClass ya están utilizando CoreWeave Forge para sus flujos de trabajo. Asimismo, la disponibilidad de los modelos abiertos NVIDIA Nemotron facilita que los equipos personalicen y desplieguen modelos de razonamiento y multimodales específicos para tareas agénticas.
El impacto de esta colaboración se extiende a sectores críticos como la salud. Ennoble Care, un proveedor de cuidados domiciliarios que atiende a unos 50.000 pacientes de Medicare en 15 estados, ha seleccionado CoreWeave para ejecutar su inferencia de IA clínica. La empresa utilizará capacidad reservada de GPUs NVIDIA RTX PRO 6000 mediante el servicio de Kubernetes de CoreWeave para escalar agentes de IA dedicados a la documentación clínica, el soporte en la toma de decisiones y la automatización de procesos administrativos.
Coingeniería y sostenibilidad del hardware
La alianza entre NVIDIA y CoreWeave se sustenta en casi una década de coingeniería. Esta relación ha permitido que la infraestructura sea flexible y rentable a largo plazo. Ian Buck, vicepresidente de computación de alto rendimiento e hiperscala en NVIDIA, ha destacado que las GPUs NVIDIA V100 de CoreWeave siguen ejecutando cargas de trabajo de clientes casi diez años después del lanzamiento de la arquitectura Volta, incluso mientras se integran los nuevos sistemas Vera Rubin NVL72.
Esta capacidad de mantener la utilidad del hardware a través de múltiples generaciones demuestra la robustez de la plataforma, permitiendo asignar la GPU adecuada a cada tipo de carga de trabajo según sus necesidades específicas. CoreWeave es actualmente el único proveedor de nube que ostenta el ranking Platinum en SemiAnalysis ClusterMAX 1.0, 2.0 y 3.0, y presta servicios a nueve de los diez laboratorios de IA más importantes del mundo.
Aunque se han confirmado los resultados de rendimiento y la disponibilidad de los componentes, no se han detallado las fechas exactas de despliegue total para todos los niveles de clientes ni las métricas financieras precisas sobre el retorno de inversión mencionado. No obstante, la integración de hardware especializado para CPUs y GPUs, junto con el software de orquestación de Forge, establece un marco técnico para que los agentes de IA pasen de ser prototipos experimentales a sistemas productivos capaces de escribir software y asistir en entornos clínicos reales.



