TITULAR: IBM lanza Granite 4.2 con razonamiento nativo para agentes de IA empresariales
Razonamiento nativo y arquitectura de Granite 4.2
IBM ha hecho oficial el lanzamiento de Granite 4.2, una nueva familia de modelos de lenguaje abiertos orientados a potenciar la IA agéntica en el sector empresarial. Esta actualización introduce capacidades de razonamiento nativo, lo que permite a los modelos planificar sus acciones, evaluar posibles soluciones y corregir errores antes de ejecutar una tarea. Los modelos están disponibles en tres tamaños distintos según la carga de trabajo requerida: 3.000 millones (3B), 8.000 millones (8B) y 30.000 millones (30B) de parámetros.
La arquitectura de Granite 4.2 está diseñada para resolver la ambigüedad inherente a los procesos corporativos, donde las tareas suelen requerir múltiples pasos coordinados. A diferencia de los modelos reactivos que generan respuestas basadas en probabilidades estadísticas, estos modelos implementan una capacidad de «pensamiento» que les permite seguir instrucciones complejas, recuperar información precisa, seleccionar las herramientas adecuadas y verificar los resultados finales. Esta capacidad de razonamiento es fundamental para evitar la ejecución ciega de comandos y asegurar que la secuencia de acciones sea la más eficiente.
Metodología de entrenamiento y aprendizaje por refuerzo
En el ámbito de la ingeniería de software, los agentes basados en Granite 4.2 pueden navegar por bases de código extensas, gestionar tareas de desarrollo multietapa y operar directamente en entornos de terminal. Para lograr este rendimiento, IBM ha rediseñado el proceso de entrenamiento basándose en los modelos fundacionales de la versión 4.0. El equipo de IBM Research ha implementado un régimen de aprendizaje por refuerzo (RL, por sus siglas en inglés) en varias etapas, comenzando con un ajuste fino supervisado (supervised fine-tuning).
La primera fase de este entrenamiento, denominada RL fundacional, se ha aplicado a todos los modelos de la familia 4.2 para reforzar competencias en matemáticas, ciencias, programación y uso de herramientas. En este proceso se combinan recompensas verificables con evaluaciones basadas en modelos de recompensa, lo que ayuda a la IA a distinguir entre la precisión técnica y la calidad general de la respuesta. Para los modelos de 8B y 30B, IBM ha añadido una fase posterior de RL agéntico, centrada específicamente en tareas empresariales como flujos de trabajo basados en búsqueda y codificación en terminales, complementada con el alineamiento mediante RLHF (aprendizaje por refuerzo a partir de retroalimentación humana).
Datos sintéticos, optimización y seguridad del modelo
Otro pilar técnico de Granite 4.2 es la utilización de datos sintéticos. Los modelos han sido entrenados con un billón de tokens de código sintético generado a través del pipeline CodeAlchemy de IBM. Además, se ha incorporado un paso de entrenamiento intermedio conocido como mid-training, que ha demostrado incrementar la capacidad de razonamiento del modelo. Para optimizar la experiencia de usuario y reducir los costes operativos de las empresas, IBM ha incluido una capa de decodificación especulativa, que acelera la salida de texto y permite atender a un mayor volumen de usuarios simultáneamente.
La robustez del modelo se ha trabajado en colaboración con Hirundo, utilizando tecnología de desaprendizaje automático (machine unlearning). Esta técnica permite identificar y reducir la generación de salidas no deseadas o perjudiciales después del entrenamiento, eliminando la necesidad de reentrenar el modelo completo desde cero. Respecto a la distribución, Granite 4.2 se publica bajo la licencia Apache 2.0, lo que permite a las organizaciones descargar, ajustar mediante fine-tuning y desplegar los modelos en producción sin restricciones de licencia.
Modelos de voz Granite Speech 5.0 Turbo CTC
Paralelamente al lanzamiento de los modelos de lenguaje, IBM ha introducido dos nuevos modelos de voz: Granite Speech 5.0 Turbo CTC y 5.0 Turbo CTC NC. Estos modelos representan un salto estructural respecto a la versión 4.1 y cuentan con solo 470 millones de parámetros. Debido a su tamaño reducido, están optimizados para el despliegue en dispositivos de borde (edge), como teléfonos inteligentes y portátiles, permitiendo que la IA se ejecute localmente sin depender totalmente de la nube.
La tecnología CTC (Connectionist Temporal Classification) permite que estos modelos mapeen el audio a texto de manera eficiente, aprendiendo directamente de audio bruto y texto sin necesidad de un backbone de modelo de lenguaje extenso. Esto los hace extremadamente rápidos en tareas de reconocimiento automático de voz (ASR). En pruebas internas utilizando una sola GPU H200, el modelo Granite Speech 5.0 Turbo CTC alcanzó una puntuación de procesamiento (RTFx) de 12.600, superando significativamente la media de los líderes actuales en el leaderboard de Open ASR de Hugging Face, que se sitúa en torno a los 6.000.
Esta eficiencia permite procesar tres horas de grabaciones de voz en un solo segundo mediante el uso de muestreo reducido. Sus aplicaciones principales incluyen la transcripción en tiempo real de videollamadas directamente desde el hardware del usuario o el análisis masivo de datos provenientes de centros de llamadas (call centers). IBM también ha lanzado una versión no comercial (NC) de este modelo de voz, entrenada con datos de uso restringido.
Implementación de IA agéntica y contexto del mercado
El despliegue de Granite 4.2 se integra en una tendencia más amplia de la IA empresarial donde el objetivo ya no es solo la generación de texto, sino la ejecución autónoma de tareas. La capacidad de desplegar estos modelos en entornos cloud, on-premises (servidores locales) y edge ofrece flexibilidad a las empresas. Mientras que los modelos pequeños (3B) pueden gestionar tareas agénticas de alto rendimiento con eficiencia, los modelos más grandes (30B) quedan reservados para flujos de codificación y razonamientos profundos.
El ecosistema de agentes de IA está avanzando hacia la resolución de problemas críticos de infraestructura. Como ejemplo de esta capacidad de automatización, Mistral ha utilizado agentes de IA para migrar 40.000 líneas de código de Fortran 77 a C++ para un operador energético europeo, demostrando que la IA puede manejar la modernización de código legacy en sectores industriales. Asimismo, otras compañías como Nous Research han expandido su oferta de agentes para usuarios de negocios, alcanzando una valoración de 1.500 millones de dólares tras una ronda de financiación Serie B de 90 millones de dólares.
Verificación de fuentes y prevención de errores de atribución
La evolución hacia la IA agéntica introduce nuevos retos de verificación. En este sentido, se han desarrollado capas de verificación postgeneración, como ProvenanceGuard, para combatir la conflación de fuentes. Este problema ocurre cuando un agente de IA utiliza el Model Context Protocol (MCP) para consultar múltiples herramientas (bases de datos, registros de pacientes, documentos de política) y atribuye un dato correcto a una fuente equivocada. Un verificador ciego a la fuente podría validar la respuesta porque el dato existe en el conjunto de evidencias, pero un verificador consciente de la fuente detectaría el error de atribución, algo crítico en entornos médicos o financieros.
El sistema de verificación propuesto analiza la traza del MCP, descompone la respuesta en afirmaciones específicas y comprueba si la fuente citada realmente respalda la afirmación. Este proceso de verificación no requiere el reentrenamiento del agente y actúa como un filtro de seguridad que puede bloquear respuestas erróneas o enviarlas a un proceso de reparación. Este nivel de rigor es el que complementa la capacidad de razonamiento de modelos como Granite 4.2, asegurando que la autonomía del agente no comprometa la precisión de la información.
En resumen, el lanzamiento de Granite 4.2 marca un desplazamiento desde la IA generativa simple hacia sistemas capaces de planificar y actuar. La combinación de razonamiento nativo, modelos de voz ligeros para el borde y licencias abiertas busca reducir las barreras de coste y complejidad para que las empresas implementen agentes autónomos que puedan operar de forma fiable en el mundo real, desde la terminal de un desarrollador hasta la gestión de datos en tiempo real en dispositivos móviles.



