La nueva arquitectura de costes en computación IA
Las AI Factories representan un cambio estructural en la forma de entender la infraestructura de inteligencia artificial. En lugar de adaptarse a centros de datos convencionales, estas instalaciones se conciben desde su origen para albergar cargas de trabajo de IA, operando a escalas de potencia que alcanzan los megavatios e incluso los gigavatios. El precio del despliegue es elevado: cada megavatio requiere una inversión cercana a los 60 millones de dólares, según la documentación publicada por NVIDIA en su blog.
Esta cifra implica que las decisiones de construcción no pueden tomarse sin una proyección financiera sólida. Los operadores solo comprometerán capital cuando dispongan de una visión clara sobre cómo recuperarán la inversión. Eso coloca a las AI Factories en un terreno muy distinto al de los centros de datos tradicionales, donde los márgenes eran menores y la planificación energética se ajustaba a patrones establecidos.
El anuncio se ha enmarcado dentro del proceso de comunicación previo al evento GTC Berlin, programado para el miércoles 21 de octubre de 2026, donde Jensen Huang, fundador y consejero delegado de NVIDIA, impartirá una conferencia magistral a las 11:00 hora central europea. La empresa publicó el texto explicativo el 1 de octubre de 2026, firmado por Shruti Koparkar.
Productividad: máximo rendimiento por vatio
La primera variable que determina el retorno de una AI Factory es la capacidad de generación de ingresos. En términos concretos, se refiere a lo que la instalación podría obtener en un año si vendiera todos los tokens que es capaz de producir. Aquí la métrica decisiva es la cantidad de tokens por segundo por cada megavatio, puesto que la energía constituye el principal cuello de botella. A mayor cantidad de tokens generados dentro de un límite energético fijo, mayores ingresos potenciales.
El segundo aspecto vinculado a esta variable es el coste por token. Menor coste operativo significa mayor margen por cada unidad vendida. Según datos de SemiAnalysis AgentX, los sistemas Vera Rubin NVL72 de NVIDIA superan en más de 30 veces el rendimiento por megavatio de los GB300 NVL72, y logran una reducción de hasta el 45 por ciento en el coste por millón de tokens cuando se trabaja con el modelo DeepSeek V4 Pro.
Estas diferencias provienen de un trabajo de codiseño a lo largo de toda la pila tecnológica: desde los modelos y las cargas de trabajo, pasando por el software, hasta el hardware de computación, redes y memoria, optimizados de forma integrada. El resultado es un sistema que aprovecha cada vatio desplegado con la máxima eficiencia posible.
¿Menos costes significará menos demanda?
Un escenario de generación de tokens progresivamente más baratos plantea una pregunta natural: si cada nueva generación abarata drásticamente el coste, ¿se reducirá la demanda de computación? La respuesta, según el análisis de NVIDIA, es negativa. La reducción de costes hace que más casos de uso resulten económicamente viables, y esos nuevos casos consumen más tokens de los que se ahorran por la ganancia de eficiencia. La demanda se expande en lugar de contraerse.
Durabilidad: hardware que sigue generando años después
La segunda variable que condiciona la rentabilidad es la vida útil del hardware. No todas las cargas de trabajo requieren la última generación de sistemas, y la adecuación entre hardware y tarea depende de la complejidad y la naturaleza de cada trabajo. Por ello, las generaciones previas continúan generando ingresos incluso después de la llegada de nuevas plataformas.
Un ejemplo destacado es el GPU A100, lanzado en 2020 y que seis años después sigue prestando servicio comercial. CoreWeave ha prorrogado sus reservas de unidades introducidas en 2020 hasta 2029, lo que ilustra una tendencia general: todos los principales operadores han ampliado sus plazos de depreciación de servidores, estimación que se ha ido desplazando hacia fechas más lejanas.
Un análisis de Sprout de septiembre de 2026, titulado «The Productive Life of a Data Center GPU», recopila cómo se han movido esos plazos a lo largo del tiempo en las principales empresas del sector. Los datos provienen de divulgaciones corporativas y reportajes de prensa. Microsoft, por ejemplo, utilizó su flota de GPUs V100 durante 8,4 años frente a una vida contable de seis años. Barkr sitúa la vida útil entre cinco y seis años para un sistema de ocho GPUs H100, y entre nueve y diez años para un GB300 NVL72, basándose en los precios de reventa de esos equipos. Silicon Data indica que un A100 de seis años conserva la cuarta parte de su valor original, mientras que hace poco más de un año un plan de depreciación de cinco años lo habría dado por amortizado. Ornn Data, por su parte, halla que el mercado paga el 80 por ciento de lo mismo por alquilar un A100 en un contrato de cinco años que en uno de un mes.
Fungibilidad: un mismo chip para múltiples cargas
La tercera variable clave es la demanda. Una fábrica construida exclusivamente para un tipo de trabajo arriesga volverse obsoleta si ese trabajo desaparece o se desplaza. La alternativa es ofrecer infraestructura capaz de ejecutar cualquier tipo de modelo de IA, abiertos y propietarios, en áreas como lenguaje, visión, biología, física y robótica. La plataforma debe funcionar en todas las fases: procesamiento de datos, preentrenamiento, postentrenamiento e inferencia, y en cualquier ubicación: desde hiperescalas y nubes de IA hasta programas soberanos, centros de datos empresariales y el edge.
La versatilidad no se limita a la IA. La misma infraestructura soporta procesamiento de datos, computación científica, simulación, gráficos y otras tareas. Todas estas cargas se reducen a operaciones matemáticas en paralelo que los GPUs ejecutan a través de sus miles de núcleos. CUDA permite que un mismo chip pueda simular luz, plegar proteínas o predecir el siguiente token. Por encima de CUDA, más de 1000 bibliotecas y modelos CUDA-X cubren campos que van desde redes neuronales y litografía computacional hasta simulación de circuitos cuánticos, búsqueda vectorial y modelado climático, con más de 10 millones de desarrolladores trabajando sobre esa base.
Esto convierte a los GPUs NVIDIA en unidades de computación acelerada de propósito general, no en ASIC diseñados para una sola carga. Los Tensor Cores y el Transformer Engine incorporan especialización para IA dentro de una arquitectura programable, combinando flexibilidad y optimización en un solo chip. Esa combinación mantiene altas las tasas de utilización y, con ello, los retornos económicos.
Ejemplos en producción
Varias empresas ya operan con esta arquitectura. Lilly construye y ejecuta modelos de proteínas, moléculas pequeñas y genómica en un cluster on-premises de 1016 GPUs, además de chatbots y flujos de trabajo de agentes para sus equipos. Pinterest completa el post-entrenamiento e implementación de un modelo de visión y lenguaje en una nube de IA, utilizando 14 000 GPUs que abarcan arquitecturas Blackwell, Hopper y anteriores. Revolut procesa datos de miles de millones de registros de transacciones con cuDF y entrena un modelo fundacional en una nube de IA. Runway entrena un modelo de mundo sobre Hopper y lo sirve en Blackwell a través de infraestructura cloud. La Universidad Texas A&M ejecuta simulaciones moleculares y descubrimiento de fármacos asistido por IA en su supercomputador, alcanzando un 95-98 por ciento de utilización en 26 proyectos repartidos entre siete instituciones.
Más allá de la IA, Cosm opera un centro de datos distribuido con GPUs NVIDIA para reproducción de vídeo en alta resolución, streaming, gráficos en tiempo real y visualización sincronizada. Dassault Systèmes potencia la simulación de gemelos virtuales para la certificación de aeronaves en Wichita State y el diseño de vehículos en Lucid Motors. Unilever genera imágenes de producto a partir de gemelos digitales en lugar de sesiones fotográficas, reduciendo a la mitad los costes de producción.
El mercado confirma la extendida vida útil del hardware NVIDIA
Los datos de reventa y alquiler respaldan la idea de que el hardware de NVIDIA mantiene valor económico mucho más allá de los ciclos habituales de renovación. Las proyecciones de vida útil se han extendido consistentemente en todo el sector, y los operadores ajustan sus expectativas contables conforme observan que los equipos siguen produciendo ingresos de forma rentable. La combinación de durabilidad y fungibilidad significa que una instalación puede adaptarse a nuevas demandas sin requerir sustitución de hardware, sino reconfiguración de cargas de trabajo.
NVIDIA señala que su plataforma está diseñada para maximizar los tres factores simultáneamente: más tokens rentables por vatio, mayor vida útil y demanda más profunda y amplia. La ingeniería de codiseño en toda la pila garantiza el máximo rendimiento, mientras que la optimización continua del software mantiene productivo el hardware instalado años después de su comercialización. La arquitectura estandarizada, basada en diseños de referencia validados, pone todo el conjunto al alcance de cualquier operador.
La consecuencia para el mercado es clara: solo los actores con estrategia financiera consolidada y visión clara del retorno podrán construir y operar estas instalaciones a escala de gigavatios. Eso tiende a concentrar aún más la capacidad de cómputo avanzado en manos de quienes disponen de los medios para asumir inversiones de decenas de millones de dólares por megavatio, con plazos de amortización que se alargan y plataformas capaces de generar ingresos durante muchos años gracias a su versatilidad.




