Limitaciones de los benchmarks actuales y propuesta de StoreBench

StoreBench surge como respuesta a las limitaciones de los benchmarks actuales para los grandes modelos de lenguaje (LLM). Hasta ahora, la mayoría de las pruebas para agentes de IA se basaban en entornos estáticos donde el mundo solo cambiaba cuando el agente realizaba una acción y la recompensa se entregaba como un veredicto final al terminar la tarea. Esta estructura no refleja la complejidad de los entornos operativos reales, donde el tiempo transcurre independientemente de las decisiones del operador y existen variables externas que no dependen de la interacción del modelo.

El nuevo entorno propuesto implementa un sistema de comercio en vivo basado en un backend de comercio de grado de producción. En este escenario, un agente de IA debe gestionar una tienda de ropa de tamaño medio, enfrentándose a una dinámica en la que los clientes realizan pedidos las veinticuatro horas del día. A diferencia de los simuladores tradicionales, StoreBench introduce variables externas impredecibles, como proveedores que cambian sus precios sin previo aviso o fallos en la cadena de suministro, obligando al modelo a demostrar capacidad de planificación a largo plazo y juicio económico bajo condiciones de incertidumbre.

Arquitectura técnica y sistema de evaluación

Para garantizar que la evaluación sea justa y no dependa de la velocidad de procesamiento del modelo, los investigadores han implementado un presupuesto operativo basado en ventanas. Esto significa que el tiempo simulado es una función directa de las acciones ejecutadas y no de la latencia del modelo. Esta arquitectura evita que un LLM con una velocidad de inferencia superior tenga una ventaja artificial sobre uno más lento, ya que el avance del reloj del simulador está vinculado a la ejecución de comandos y no al tiempo real de respuesta del hardware.

El agente de IA en StoreBench no interactúa con el sistema mediante prompts abstractos, sino que utiliza exactamente las mismas veintinueve herramientas de gestión que emplearía un operador humano. Estas herramientas cubren el ciclo completo de operación: desde la gestión de inventarios y la interacción con proveedores hasta el procesamiento de pedidos y la logística de envío. La arquitectura del sistema permite que cada episodio sea reproducible, lo que significa que, dada una secuencia idéntica de acciones, el resultado será siempre el mismo, facilitando así el análisis de errores y la optimización del modelo.

Para evitar que los modelos encuentren atajos matemáticos para obtener puntuaciones altas sin resolver realmente el problema —fenómeno conocido como reward hacking—, los autores han blindado el sistema de recompensas. Las puntuaciones no se basan en criterios arbitrarios, sino que están calibradas frente a políticas de anclaje programadas. Estas políticas actúan como un estándar de referencia técnico sobre cómo debería operar una tienda eficiente, asegurando que la recompensa esté ligada a la eficiencia económica real y no a la manipulación de las métricas del simulador.

Metodología de prueba y resultados comparativos

La evaluación se ha llevado a cabo utilizando siete modelos de lenguaje de vanguardia en once escenarios diferentes. Estas pruebas abarcaron periodos de tiempo simulado que oscilaron entre los treinta y cuarenta y cinco días, extendiéndose en algunos casos hasta completar un año entero de gestión comercial. Para asegurar la robustez de los datos, se utilizaron tres semillas de mundo distintas, manteniendo el mismo esfuerzo de razonamiento en todos los modelos analizados para evitar sesgos derivados de la complejidad variable de los escenarios.

Los datos obtenidos revelan una brecha significativa entre la capacidad actual de los LLM y la eficiencia de los sistemas programados o humanos. Ninguno de los modelos evaluados logró igualar la política de triaje inteligente programada por los investigadores. El modelo con mejor rendimiento fue DeepSeek-V4-Pro, que alcanzó una tasa de éxito del cuarenta y nueve por ciento en las celdas de tarea y semilla, una cifra considerablemente inferior al noventa y siete por ciento obtenido por la heurística programada.

Cuando se comparan los resultados de la IA con los de expertos humanos que operaban con las mismas herramientas y presupuestos, la superioridad humana permanece clara. Los expertos alcanzaron una puntuación compuesta media de 0,708, mientras que los modelos de IA se quedaron en una media de 0,700. Aunque la diferencia numérica parece estrecha, el contexto de la prueba demuestra que la gestión autónoma de un negocio complejo, que requiere equilibrar el flujo de caja con la satisfacción del cliente y la gestión de riesgos de suministro, sigue siendo un desafío para la arquitectura actual de los agentes.

Optimización mediante GRPO y aprendizaje continuo

Sin embargo, el estudio destaca la capacidad de aprendizaje de estos modelos a través del tiempo. Al utilizar el entorno de Claude Code durante un año simulado, la mayoría de los LLM mostraron una mejora drástica en su rendimiento operativo. Este resultado indica que la exposición prolongada a entornos dinámicos y la retroalimentación constante son claves para el desarrollo de agentes capaces de gestionar procesos de negocio reales, sugiriendo que el entrenamiento continuo en simulaciones de alta fidelidad puede cerrar la brecha con el rendimiento humano.

Uno de los hallazgos más relevantes de la investigación es la eficacia del post-entrenamiento utilizando GRPO (Group Relative Policy Optimization). Esta técnica de optimización permite ajustar el comportamiento del modelo basándose en comparaciones relativas entre diferentes salidas para una misma tarea, mejorando la toma de decisiones sin necesidad de un modelo de recompensa externo complejo. El GRPO optimiza la política del modelo comparando un grupo de respuestas generadas y reforzando aquellas que se acercan más al objetivo óptimo.

En las pruebas realizadas con el modelo Qwen3.5-27B, los investigadores aplicaron este entrenamiento utilizando únicamente cinco tareas disjuntas. El resultado fue una mejora sustancial en la capacidad de generalización del modelo. En las tareas de evaluación que el modelo no había visto durante el entrenamiento, su puntuación compuesta media aumentó de 0,136 a 0,373. Este incremento demuestra que es posible elevar significativamente la competencia de un agente autónomo mediante el entrenamiento en entornos de simulación bien diseñados, incluso con un conjunto de datos de entrenamiento reducido.

Este avance es fundamental para el desarrollo de la IA agéntica, ya que prueba que los modelos no solo pueden ejecutar comandos simples, sino que pueden adquirir competencias en gestión económica y logística si se les entrena en entornos que imitan la volatilidad del mercado real. La capacidad de pasar de una puntuación marginal a una aceptable mediante un entrenamiento focalizado abre la puerta a la creación de operadores autónomos para sectores comerciales, reduciendo la dependencia de la supervisión humana constante en tareas de gestión rutinaria.

Impacto en la industria y análisis de incertidumbres

La implementación de StoreBench marca un cambio en la metodología de evaluación de agentes. Mientras que los benchmarks anteriores se centraban en la resolución de problemas aislados o tareas de razonamiento lógico en entornos controlados, StoreBench introduce la dimensión temporal y la incertidumbre económica. Para los desarrolladores de LLM, esto implica que la optimización ya no puede basarse únicamente en la precisión de la respuesta, sino en la capacidad del modelo para mantener la viabilidad de un sistema complejo a lo largo de semanas o meses de operación.

Para las empresas del sector del comercio electrónico, estos resultados subrayan que, aunque la IA puede asistir en la gestión, la autonomía total en la toma de decisiones económicas críticas aún no es viable sin un riesgo operativo considerable. La diferencia entre el 49% de éxito de DeepSeek-V4-Pro y el 97% de la heurística programada indica que los modelos actuales tienden a cometer errores de juicio económico que un sistema basado en reglas simples no comete, lo que podría traducirse en pérdidas financieras en un entorno real.

En cuanto a lo que se conoce y lo que permanece en la incertidumbre, el estudio confirma que el post-entrenamiento mediante GRPO es una vía efectiva para mejorar la generalización de los agentes en tareas de gestión. También queda demostrado que el tiempo de exposición al entorno es un factor determinante en la mejora del rendimiento. No obstante, el estudio no aclara si existe un techo de rendimiento para los LLM que les impida alcanzar la puntuación de los expertos humanos, o si la diferencia de 0,008 en la puntuación compuesta es simplemente un reflejo de la falta de entrenamiento específico en el dominio comercial.

Otra incertidumbre reside en la escalabilidad de estos resultados a otros sectores. StoreBench se ha centrado en una tienda de ropa, pero no se ha determinado si la capacidad de planificación económica transferida sería aplicable a otros tipos de comercio con dinámicas de inventario diferentes, como productos perecederos o servicios digitales, donde los riesgos y las métricas de éxito varían significativamente.

Estrategia de acceso y prevención de la contaminación de datos

Con el objetivo de fomentar la investigación pero proteger la integridad del benchmark, los autores han adoptado una estrategia de lanzamiento parcial de los recursos. Se han hecho públicos cinco ejemplos de tareas para el conjunto de entrenamiento, diez trayectorias de muestra y todas las herramientas de verificación y puntuación necesarias para que otros investigadores comprendan la metodología y puedan replicar los experimentos bajo condiciones controladas.

No obstante, el entorno completo y la suite de evaluación total se mantienen restringidos. Esta decisión responde a un problema creciente en el campo de la inteligencia artificial: la contaminación de los benchmarks. Cuando los datos de prueba de un benchmark se filtran o se incluyen en los conjuntos de datos de entrenamiento de los LLM, los modelos dejan de resolver los problemas mediante el razonamiento y comienzan a resolverlos mediante la memorización de las respuestas correctas, invalidando cualquier conclusión sobre su capacidad real de planificación.

Al mantener el núcleo de StoreBench cerrado, los investigadores aseguran que cualquier mejora futura en los modelos sea el resultado de una capacidad real de planificación y juicio económico, y no de un entrenamiento previo con las respuestas del examen. Esto posiciona a StoreBench no solo como una herramienta de medición, sino como un estándar de rigor para el entrenamiento de agentes autónomos en el sector del comercio electrónico, obligando a los modelos a enfrentarse a escenarios nunca antes vistos en sus datos de pre-entrenamiento.