Syamantak Kumar y otros ocho autores han publicado en arXiv el marco de trabajo denominado Plan-and-Patch (arXiv:2610.10786v1), diseñado específicamente para resolver las limitaciones de los agentes de inteligencia artificial que operan en horizontes temporales extensos. Estos agentes requieren la coordinación de múltiples subobjetivos, el uso preciso de herramientas y la gestión de resultados intermedios a lo largo de numerosos pasos para completar una tarea compleja.
El núcleo de esta propuesta es la sustitución de los modelos autorregresivos tradicionales por un modelo de lenguaje de difusión o dLLM. Mientras que los modelos autorregresivos generan texto de forma secuencial, token a token, los modelos de difusión permiten una generación mediante el desenmascarado paralelo. En el contexto de Plan-and-Patch, esto se traduce en la capacidad de crear planes estructurados, similares a programas informáticos, que pueden ser modificados de manera no lineal.
La principal innovación reside en la capacidad de reparación del plan. En los entornos reales, las suposiciones iniciales de un agente pueden quedar invalidadas por cambios en el entorno, las herramientas pueden devolver resultados inesperados o ciertas acciones pueden fallar. Hasta ahora, la respuesta habitual de los agentes era regenerar el plan completo, lo que introducía el riesgo de cambiar pasos previos que ya eran correctos y consumía recursos computacionales innecesarios.
Plan-and-Patch soluciona este problema mediante la técnica de parcheo. El sistema identifica la región específica del plan que ha fallado y regenera únicamente ese segmento, manteniendo fijos el prefijo y el sufijo del plan original. Esta capacidad de edición localizada asegura que la estructura global del plan se preserve mientras se corrige el error puntual, optimizando la estabilidad de la ejecución.
Para validar la eficacia de Plan-and-Patch, los investigadores compararon el rendimiento de DreamReasoner-8B, un modelo de difusión, frente a Qwen3-8B, un modelo autorregresivo. Las pruebas se centraron en la capacidad de reparación de planes y la velocidad de generación en diversos benchmarks de agentes.
En el benchmark Natural Plan, donde no se aplicó un entrenamiento específico para la tarea, los resultados mostraron una superioridad clara del modelo de difusión. El dLLM alcanzó una tasa de éxito en la reparación de planes del 53,7 %, una cifra que casi duplica el 27,0 % obtenido por el modelo autorregresivo. Este dato confirma que la arquitectura de difusión es intrínsecamente más apta para realizar ajustes precisos en estructuras de planificación ya existentes.
Cuando los modelos fueron sometidos a un entrenamiento específico en los benchmarks ALFWorld y TextCraft, ambos enfoques mostraron niveles similares de éxito en la generación inicial de planes. Sin embargo, la diferencia fundamental persistió en la eficiencia operativa. Los modelos basados en difusión lograron reducir la latencia media de generación de planes entre un 39 % y un 46 % en comparación con los modelos autorregresivos.
Esta reducción de la latencia es crítica para los agentes que operan en tiempo real o en entornos dinámicos, donde la velocidad de reacción y la capacidad de ajustar la estrategia sobre la marcha determinan la viabilidad del sistema. La capacidad de generar y reparar planes más rápidamente permite que el agente interactúe con el entorno de forma más fluida y con menos interrupciones por procesamiento.
El despliegue de Plan-and-Patch implica un cambio técnico en la forma en que los desarrolladores gestionan los errores de ejecución. Anteriormente, la corrección de un plan fallido requería un ciclo completo de retroalimentación donde el agente debía analizar el error, volver al estado inicial de planificación y generar una nueva secuencia de tokens. Este proceso no solo era lento, sino que a menudo introducía alucinaciones en pasos que ya habían sido validados, degradando la fiabilidad del agente en tareas de largo horizonte.
Con la implementación de dLLMs, la reparación se convierte en un proceso de relleno selectivo. El modelo de difusión puede tratar el plan como un lienzo donde solo se modifican los píxeles (o tokens) afectados, manteniendo la coherencia del resto de la estructura. Esto reduce la carga computacional y evita la deriva del plan, donde el agente pierde el objetivo original al intentar corregir un detalle menor.
En paralelo a este avance, se ha publicado AegisFlow (arXiv:2610.06971v1), un marco de IA multiagente centrado en la remediación autónoma. AegisFlow aborda la fragilidad de los ecosistemas de datos, permitiendo que los sistemas se autocuren cuando ocurren cambios en las API o en los esquemas de datos, evitando que los flujos de trabajo de automatización se rompan.
La integración de AegisFlow resuelve un problema crítico en la automatización empresarial: la dependencia de infraestructuras de datos estáticas. En la arquitectura tradicional, cualquier cambio en la estructura de una base de datos o en la respuesta de una API externa provocaba el colapso del pipeline de datos, requiriendo una intervención manual del equipo de ingeniería para actualizar los scripts de integración. AegisFlow permite que los agentes detecten estas discrepancias y ajusten el flujo de datos de forma autónoma, asegurando la continuidad del servicio.
Por otro lado, Google ha integrado capacidades de comprensión de vídeo agéntico en sus modelos Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite. A diferencia del procesamiento estático, que analiza el vídeo a una tasa fija de fotogramas por segundo (habitualmente 1 FPS), el enfoque agéntico permite que el modelo decida dinámicamente qué segmentos observar, a qué velocidad y a través de qué modalidad, ya sea fotogramas, audio o transcripciones.
Esta capacidad de análisis activo permite a Gemini realizar tareas de alta precisión, como la recuperación de momentos en fracciones de segundo, la detección de anomalías mediante el remuestreo de ventanas temporales a mayor resolución y el conteo preciso de objetos o acciones. En términos de eficiencia, Google reporta que este método reduce el consumo de tokens hasta en un 88 % y los costes operativos hasta en un 66 %, mejorando además la precisión en un 7 %.
El funcionamiento técnico de la comprensión de vídeo agéntico se basa en un bucle de decisión. En lugar de ingerir el flujo de medios de forma lineal, Gemini utiliza herramientas internas para cargar solo las partes relevantes del archivo de vídeo. Esto es especialmente efectivo en vídeos de larga duración, como guías técnicas de 10 minutos o conferencias de 90 minutos, donde el procesamiento estático obligaba a los desarrolladores a elegir entre costes prohibitivos de tokens o una pérdida masiva de detalles críticos al reducir la tasa de fotogramas.
Para los desarrolladores, esta funcionalidad está disponible configurando el parámetro de procesamiento como "agentic" en Google AI Studio o en la Gemini Enterprise Agent Platform. Esto elimina la necesidad de programar manualmente la lógica de segmentación de vídeo, delegando la selección de los fotogramas y la modalidad de análisis al propio modelo.
La convergencia de Plan-and-Patch, AegisFlow y el análisis de vídeo de Gemini indica un movimiento hacia agentes que pueden planificar con flexibilidad mediante difusión, mantener sus infraestructuras de datos mediante marcos de auto-curado y percibir el entorno visual de forma eficiente y selectiva.
Este ecosistema técnico redefine el valor empresarial en la automatización agéntica. Se ha propuesto un nuevo marco de retorno de inversión (ROI) que busca superar las limitaciones del modelo utilizado en la era de la Automatización Robótica de Procesos (RPA). El modelo de ROI tradicional se centraba primordialmente en el ahorro de horas hombre y la reducción de costes directos mediante la eliminación de tareas repetitivas.
Sin embargo, la naturaleza probabilística y autónoma de los agentes de IA requiere una medición más sofisticada. El nuevo marco propone integrar tres dimensiones fundamentales: la calidad de las decisiones tomadas por el agente, la eficacia en la gestión de excepciones y la economía del mantenimiento a largo plazo.
En el caso de Plan-and-Patch, la reducción de la latencia y la mejora en la tasa de reparación de planes impactan directamente en la economía del mantenimiento. Un agente que puede corregir sus propios errores sin intervención humana o sin reiniciar procesos completos reduce drásticamente la supervisión necesaria y el coste de fallo operativo. La gestión de excepciones se convierte así en un valor cuantificable: mientras que un sistema rígido de RPA falla ante cualquier desviación del flujo predefinido, un agente dotado de capacidades de planificación y reparación puede navegar la incertidumbre.
Desde una perspectiva de negocio, esto transforma la capacidad de recuperación en una ventaja competitiva medible. La reducción de costes operativos en el análisis de vídeo de Gemini (hasta un 66 %) y la optimización de tokens (hasta un 88 %) demuestran que la eficiencia agéntica no es solo una mejora técnica, sino una reducción directa de los costes de infraestructura en la nube para las empresas que procesan grandes volúmenes de datos multimedia.
En cuanto a lo que se sabe y lo que permanece en el ámbito de la incertidumbre, los datos confirman que los modelos de difusión son superiores a los autorregresivos en la reparación de planes en benchmarks como Natural Plan, ALFWorld y TextCraft. También está comprobado que la comprensión de vídeo agéntica mejora la precisión en la detección de anomalías y el conteo de objetos en comparación con el procesamiento estático.
No obstante, aún no se ha detallado el coste computacional del entrenamiento inicial de los dLLMs frente a los modelos AR tradicionales, ni se ha especificado el límite de escalabilidad de AegisFlow en ecosistemas de datos con miles de API interconectadas. Asimismo, queda por determinar si la reducción de latencia de Plan-and-Patch se mantiene constante a medida que el horizonte temporal de la tarea aumenta de forma exponencial.
Para los desarrolladores de agentes de largo horizonte, la implementación de modelos de lenguaje de difusión marca un cambio de paradigma. La transición de la generación secuencial a la regeneración selectiva permite abordar tareas que antes eran prohibitivas debido a la acumulación de errores en planes extensos. Esto implica una reducción en la complejidad de la ingeniería de prompts y una menor dependencia de bucles de retroalimentación externos extremadamente costosos.
La capacidad de realizar un parcheo interno en el plan permite que el agente sea más resiliente y autónomo, reduciendo la tasa de abandono de tareas complejas. La integración de estas herramientas sugiere que el futuro de la IA agéntica no reside únicamente en el aumento del tamaño de los modelos, sino en la optimización de cómo estos modelos razonan y ajustan sus acciones en función de la realidad del entorno.
La combinación de una planificación flexible, una percepción visual eficiente y una infraestructura de datos autocurada establece la base para una automatización industrial y profesional mucho más robusta y escalable. La capacidad de un agente para reconocer que una acción ha fallado, localizar el error en su plan, repararlo mediante difusión sin alterar el resto de la estrategia y, simultáneamente, ajustar su flujo de datos mediante AegisFlow, representa la transición de la IA como herramienta de asistencia a la IA como entidad operativa autónoma.




