El estudio On the Clock, presentado formalmente el 7 de octubre de 2026 y aceptado en el Workshop de NeurIPS 2026 sobre Resource-Aware Agentic AI, examina si los agentes basados en modelos de lenguaje extensos (LLM) de tamaño reducido pueden trabajar eficazmente bajo presupuestos de tiempo explícitos. La investigación, liderada por Aaron Wang y otros siete autores, se centra en dos dimensiones críticas: la capacidad del agente para respetar el tiempo asignado y su habilidad para utilizar ese margen temporal de manera productiva para mejorar el resultado de la tarea.
Para llevar a cabo estas pruebas, los investigadores utilizaron el modelo Qwen3.6-27B en cinco competiciones integradas en MLE-Bench Lite, un benchmark diseñado para evaluar capacidades de aprendizaje automático. Paralelamente, emplearon el modelo Qwen3-4B en el entorno Zork I, a través de Jericho, que es un marco de evaluación para agentes en juegos de texto. Ambos escenarios representan entornos donde disponer de más tiempo de computación debería, teóricamente, traducirse en un incremento del rendimiento y una mayor precisión en las respuestas.
Los resultados indican que, en la configuración más básica donde el presupuesto de tiempo se indica únicamente mediante el prompt, los agentes son incapaces de traducir esa instrucción en un control real de su ejecución. Esta deficiencia se debe a una falta de conciencia temporal, ya que el sistema que ejecuta el modelo no proporciona retroalimentación sobre el tiempo transcurrido. Además, los modelos no pueden predecir con fiabilidad la duración de sus propias acciones ni poseen un mapa aprendido que relacione el tiempo disponible con una estrategia de resolución específica.
Esta incapacidad de gestión implica que el agente puede ignorar el límite establecido o, por el contrario, finalizar la tarea prematuramente sin haber aprovechado los recursos disponibles. La brecha entre la instrucción textual y la ejecución temporal demuestra que el simple prompting no es suficiente para dotar a un agente de una noción de tiempo real, lo que limita su utilidad en entornos operativos donde los plazos son estrictos y los recursos computacionales están limitados.
Para mitigar estos fallos, el equipo de investigación implementó dos tipos de intervenciones. La primera consistió en mecanismos basados en el harness, que es la infraestructura de software que envuelve al modelo. Estas herramientas permiten inyectar información sobre el tiempo restante directamente en el flujo de trabajo y aplicar ganchos de ejecución que fuerzan el cumplimiento de las fechas límite. En el caso del modelo Qwen3.6-27B, esta técnica mejoró sustancialmente el cumplimiento del presupuesto sin degradar el rendimiento general en las tareas.
La segunda intervención se basó en el aprendizaje por refuerzo (RL) utilizando el algoritmo GRPO (Group Relative Policy Optimization). Este método busca optimizar la política del modelo mediante recompensas vinculadas específicamente al cumplimiento del presupuesto temporal. En el entorno Zork I, el entrenamiento con RL logró que los agentes respetaran el presupuesto casi a la perfección, demostrando además que el modelo podía generalizar este comportamiento a presupuestos de tiempo que no había encontrado durante su fase de entrenamiento.
A pesar de que los agentes lograron volverse puntuales mediante el entrenamiento y las herramientas de control, el estudio revela un problema persistente: la incapacidad de usar el tiempo extra para mejorar la calidad de la tarea. Una vez que el agente aprende a respetar el límite, no emplea el tiempo adicional de forma inteligente para refinar sus respuestas o explorar mejores soluciones. En lugar de optimizar el proceso, los modelos entrenados con RL tienden a llenar el tiempo restante repitiendo acciones ya realizadas.
Este fenómeno se agrava cuando se entrena al modelo con múltiples presupuestos temporales simultáneamente. El proceso de GRPO tiende a colapsar hacia la estrategia aprendida para el presupuesto más corto, lo que significa que el agente adopta un comportamiento conservador y rápido incluso cuando dispone de más tiempo. Esta falta de escalabilidad en la productividad temporal sugiere que saber cuándo detenerse es una capacidad distinta y más sencilla de adquirir que saber cómo invertir el tiempo para obtener un mejor resultado.
La distinción entre la adherencia al presupuesto y la asignación productiva del tiempo marca un desafío central para la próxima generación de agentes autónomos. Actualmente, la mayoría de los LLM operan en un vacío temporal donde la velocidad de respuesta depende del hardware y la longitud del token, pero no de una planificación estratégica del tiempo. El hecho de que modelos pequeños como Qwen3.6-27B puedan ser puntuales pero no productivos indica que la eficiencia temporal requiere una arquitectura de razonamiento más profunda.
Para los desarrolladores, esto implica que no basta con implementar restricciones externas o penalizaciones por exceso de tiempo. Es necesario desarrollar métodos de entrenamiento que incentiven la reflexión y la iteración proporcional al tiempo disponible. Si un agente no puede discernir que tener diez minutos en lugar de un minuto le permite realizar una verificación de errores más exhaustiva, su capacidad de razonamiento seguirá siendo estática independientemente de los recursos asignados.
Este avance se sitúa en un marco donde la industria busca reducir la dependencia de modelos masivos y costosos, apostando por modelos más pequeños y eficientes que puedan ejecutarse en entornos locales o con presupuestos computacionales restringidos. La capacidad de un agente para gestionar su propio tiempo de ejecución es fundamental para la integración de la IA en flujos de trabajo industriales, donde el coste de la computación y la latencia de respuesta impactan directamente en la viabilidad económica del producto.
La investigación On the Clock subraya que la gestión de recursos no es solo una cuestión de optimización de hardware o de reducción de tokens, sino de una capacidad cognitiva del modelo. Mientras que la puntualidad puede resolverse con ganchos de software y aprendizaje por refuerzo básico, la productividad temporal sigue siendo una frontera abierta que requiere nuevas estrategias de alineación y entrenamiento para que la IA pueda realmente planificar sus procesos en el tiempo.
En términos técnicos, la implementación de GRPO para la gestión temporal representa un cambio en el enfoque de optimización. A diferencia de los métodos de entrenamiento supervisado tradicionales, donde el modelo imita respuestas correctas, el GRPO permite que el agente experimente con diferentes trayectorias de ejecución y sea recompensado cuando el tiempo de finalización coincide con el presupuesto asignado. Sin embargo, la tendencia al colapso hacia el presupuesto más corto revela que el modelo prioriza la seguridad de no exceder el tiempo sobre el beneficio de mejorar el resultado, lo que indica un sesgo hacia la eficiencia mínima aceptable.
El uso de MLE-Bench Lite y Zork I como entornos de prueba permite diferenciar entre tareas de razonamiento técnico y tareas de navegación en entornos dinámicos. En MLE-Bench Lite, el tiempo adicional debería permitir que el modelo Qwen3.6-27B realice más iteraciones de código, pruebe más hipótesis y corrija errores de sintaxis. En Zork I, el tiempo extra debería traducirse en una exploración más exhaustiva del mapa y una mejor gestión del inventario. El hecho de que el modelo no mejore su rendimiento en ninguna de las dos modalidades confirma que la gestión del tiempo es un problema transversal a la naturaleza de la tarea.
Desde la perspectiva de la arquitectura de software, el harness actúa como una capa de middleware que compensa la ceguera temporal del LLM. Al inyectar datos de tiempo real en el contexto del modelo, se transforma una instrucción estática en un flujo de datos dinámico. No obstante, esta solución es externa al modelo; el LLM no desarrolla una intuición temporal propia, sino que reacciona a señales externas. Esto diferencia la puntualidad forzada por el sistema de la productividad autónoma, que requeriría que el modelo planificara sus pasos basándose en la magnitud del tiempo disponible.
Para las empresas que implementan agentes autónomos en producción, estos hallazgos tienen consecuencias directas en el cálculo de costes operativos. Si un agente consume el presupuesto total de tiempo sin mejorar la calidad de la respuesta, se produce un desperdicio de recursos computacionales (GPU/TPU) y un aumento innecesario de la latencia. La incapacidad de los modelos para escalar su razonamiento según el tiempo disponible impide la creación de niveles de servicio (SLA) basados en la calidad: no es posible ofrecer una respuesta 'estándar' rápida y una 'premium' más lenta y precisa si el modelo no sabe aprovechar el tiempo extra.
En comparación con el estado anterior del sector, donde la optimización se centraba casi exclusivamente en la reducción de la latencia por token o en la cuantización de pesos para reducir la memoria, el estudio On the Clock desplaza el foco hacia la gestión estratégica del tiempo de ejecución. Anteriormente, se asumía que un modelo más potente o con más tiempo de computación (como en los procesos de Chain-of-Thought extendidos) mejoraría automáticamente el resultado. Esta investigación demuestra que el tiempo por sí solo no es un catalizador de calidad si el agente no posee la capacidad cognitiva de asignar ese tiempo a procesos de refinamiento.
Respecto a lo que se sabe y lo que permanece incierto, la investigación confirma que la puntualidad es una capacidad adquirible mediante RL y herramientas de control externo. Se ha comprobado que el modelo Qwen3-4B puede generalizar el respeto a los límites temporales incluso en presupuestos no vistos previamente. Sin embargo, permanece sin resolver cómo incentivar la productividad temporal. No se ha encontrado un mecanismo de recompensa que obligue al modelo a utilizar el tiempo extra para el razonamiento profundo en lugar de repetir acciones redundantes.
La incertidumbre reside también en si esta limitación es inherente a los modelos de tamaño reducido o si persiste en modelos de frontera más grandes. El estudio se centró en modelos de 4B y 27B parámetros, los cuales son representativos de la tendencia actual hacia la eficiencia. Queda por determinar si una mayor capacidad de parámetros conlleva una comprensión intrínseca del tiempo o si la gestión de presupuestos temporales requiere una nueva arquitectura de memoria que permita al modelo rastrear el progreso de la tarea en relación con el reloj.
Otro punto crítico es la interacción entre el entrenamiento de múltiples presupuestos y la degradación de la estrategia. El colapso hacia el presupuesto más corto sugiere que el modelo aprende una política de 'mínimo riesgo'. Para resolver esto, sería necesario desarrollar funciones de recompensa que no solo penalicen el exceso de tiempo, sino que premien la correlación positiva entre el tiempo invertido y la mejora en la métrica de éxito de la tarea. Sin este vínculo, el agente seguirá percibiendo el tiempo extra como un espacio vacío que debe llenar para cumplir la norma, y no como una herramienta para la optimización.
La aplicación de estos resultados al desarrollo de agentes de IA implica que la planificación debe ser tratada como una habilidad separada de la generación de lenguaje. La capacidad de descomponer una tarea en pasos y asignar a cada paso una duración estimada es lo que falta en los modelos actuales. Mientras que el GRPO puede enseñar al modelo a detenerse, no puede enseñarle a priorizar qué partes de la tarea requieren más tiempo de reflexión y cuáles pueden resolverse rápidamente.
En conclusión, el estudio On the Clock establece que existe una brecha fundamental entre la adherencia temporal y la productividad temporal. La puntualidad es una cuestión de control y alineación, mientras que la productividad es una cuestión de razonamiento y estrategia. Para que los agentes de LLM sean verdaderamente autónomos en entornos industriales, deben evolucionar desde la simple obediencia a un límite horario hacia una gestión inteligente de los recursos temporales que maximice la calidad del resultado final.




