IBM Research y Red Hat han demostrado la viabilidad de ejecutar modelos de lenguaje de gran escala en infraestructuras de hardware ya desplegadas en entornos empresariales. A través del proyecto llm-d, una iniciativa colaborativa en la que también participa Google, el equipo ha logrado desplegar el modelo GLM-5.2, un sistema de pesos abiertos basado en la arquitectura Mixture-of-Experts (MoE) con aproximadamente 753.000 millones de parámetros, utilizando un clúster de 544 GPUs NVIDIA H100.
Optimización para cargas de trabajo agénticas
La implementación se ha centrado específicamente en las cargas de trabajo agénticas, que difieren sustancialmente de los chatbots tradicionales. Mientras que un chat convencional se basa en la generación de texto, los agentes de programación procesan repetidamente contextos masivos, como repositorios completos de software, y generan respuestas relativamente cortas. Según los datos analizados en sesiones reales de Claude Code, la solicitud mediana procesa unos 195.000 tokens pero solo produce 317, lo que desplaza la carga computacional desde la generación hacia el procesamiento del contexto entrante.
Para resolver este cuello de botella, el marco llm-d introduce seis capacidades técnicas diseñadas para optimizar el uso de la memoria y el cómputo. Una de las más críticas es el enrutamiento consciente del prefijo (prefix-aware routing), que dirige cada solicitud al servidor que ya posee el contexto almacenado en su caché. En las pruebas realizadas con el benchmark CyberGym, el paso de un enrutamiento aproximado a uno de coincidencia precisa de prefijos incrementó el rendimiento en un 79 % y redujo el tiempo hasta el primer token en un 67 %.
Gestión de memoria y caché KV
El sistema implementa además una gestión de caché KV (Key-Value) por niveles. Esta técnica extiende la memoria de trabajo desde la VRAM de la GPU hacia la memoria DRAM de la CPU, evitando que los prefijos útiles sean eliminados por la presión de memoria y tengan que ser recalculados desde cero. Complementando esto, llm-d incorpora el intercambio de caché KV peer-to-peer (P2P), que permite a un servidor extraer bloques de caché reutilizables de otro nodo en lugar de procesar el prefijo localmente.
Dado que un modelo de 753B de parámetros no puede residir en un único servidor, IBM y Red Hat han aplicado un paralelismo de expertos amplio con atención paralela de datos. Esta configuración distribuye el modelo entre múltiples nodos evitando la replicación innecesaria de la caché KV que ocurriría con el paralelismo de tensores estándar en la arquitectura de atención latente multi-cabezal de GLM-5.2.
Desagregación de prefill y decode
Otra innovación clave es la desagregación de prefill y decode. El prefill es la fase donde el modelo procesa el contexto inicial, mientras que el decode es la fase de generación de tokens. llm-d separa estas funciones en grupos independientes que escalan según la demanda, comunicándose a través de la librería de transferencia zero-copy NIXL de NVIDIA. Durante las pruebas, NIXL gestionó 6,2 millones de transferencias de caché KV con un promedio de 2,71 GiB por transferencia y una velocidad sostenida de 580 Gb/s sin registrar fallos.
Para maximizar la velocidad de salida, el sistema utiliza la predicción de múltiples tokens (MTP), que permite generar varios tokens de salida en una sola pasada hacia adelante del modelo. Esta capacidad, sumada a las optimizaciones de caché y enrutamiento, permite que el sistema maneje picos de actividad impredecibles causados por la activación de subagentes paralelos, una característica intrínseca de los flujos de trabajo de codificación autónoma.
Rendimiento y métricas de despliegue
En términos de rendimiento bruto, el despliegue sobre las 544 H100 alcanzó un pico de 6,6 millones de tokens de salida por minuto en benchmarks agénticos. El sistema fue capaz de soportar hasta 3.000 agentes de programación concurrentes sin que se produjeran interrupciones de tareas por falta de recursos (preemption). En el benchmark AutomationBench, con 2.500 agentes, se sostuvieron 7.612 solicitudes por minuto y un rendimiento de entrada pico de 134,89 millones de tokens por minuto.
El impacto económico de este despliegue es significativo para las organizaciones que buscan soberanía de datos y control de costes. Según IBM Research, el autoalojamiento de GLM-5.2 mediante llm-d es entre 5 y 10 veces más económico por token que el uso de API comerciales equivalentes. El ahorro es especialmente pronunciado en patrones de tráfico con alta carga de entrada, típicos de los agentes que deben leer grandes volúmenes de código antes de proponer una modificación.
Carlos Costa, ingeniero distinguido de IBM Research y mantenedor de llm-d, ha señalado que el objetivo era demostrar que un modelo de este tamaño puede ejecutar cargas agénticas reales con un rendimiento interactivo competitivo utilizando la flota de GPUs que la mayoría de las organizaciones ya operan, cerrando la brecha tecnológica entre las generaciones de hardware H100 y las más recientes H200.
Análisis de tráfico y validación en benchmarks
El análisis de tráfico real reveló que el 96 % de las solicitudes de los agentes principales reutilizaban al menos el 90 % del input de una solicitud anterior. Esta redundancia es la que permite que las optimizaciones de caché de llm-d sean tan efectivas. Sin estas técnicas, el sistema tendría que recomputar la misma información una y otra vez, disparando la latencia y el consumo energético.
En las pruebas de CyberGym, donde 400 agentes procesaron contextos de 376.000 caracteres a lo largo de 10 turnos, el sistema completó todas las trayectorias en 248 segundos. La tasa de aciertos de prefijos locales alcanzó el 73,18 %, una mejora sustancial frente al 44,46 % obtenido con el enrutamiento aproximado. Por su parte, el benchmark AgentX, con 128 agentes procesando contextos de 195.000 tokens, completó 7.251 solicitudes con un tiempo hasta el primer token (p90) de 5,77 segundos.
Implicaciones para la infraestructura de inferencia
Este avance representa un cambio de paradigma en la infraestructura de inferencia. Hasta ahora, el despliegue de modelos de casi un billón de parámetros requería hardware de última generación o presupuestos masivos en servicios de nube. La capacidad de llm-d para optimizar el hardware existente permite que las empresas desplieguen modelos de pesos abiertos en sus propias instalaciones, asegurando la privacidad de los datos propietarios y eliminando la dependencia de proveedores externos de API.
La arquitectura de llm-d aborda tres características definitorias de las cargas agénticas: contextos extremadamente largos, reutilización intensiva de información y ráfagas de actividad paralela. Al tratar la inferencia no como una generación lineal de texto, sino como una gestión eficiente de memoria y contexto, IBM y Red Hat han validado un modelo de operación sostenible para la próxima generación de asistentes de IA autónomos.




