Yipeng Li, Ashutosh Hathidara y otros investigadores han presentado AutoSynthData, un sistema diseñado para generar datos de entrenamiento para agentes de IA empresariales mediante la interacción escalable entre agentes y sistemas, según el documento Synthesis Through Simulation (arXiv:2610.10549v1). El sistema propone un marco de trabajo donde la generación de datos no depende de la imitación de registros existentes, sino de la ejecución de operaciones reales dentro de entornos corporativos simulados.
El entrenamiento de agentes de IA capaces de ejecutar tool-calling —la capacidad de invocar herramientas y funciones externas para resolver tareas— se enfrenta a un obstáculo crítico en el sector empresarial. El acceso a esquemas de bases de datos reales, flujos de trabajo internos y datos de producción está severamente restringido por normativas legales de privacidad, como el RGPD en Europa, y políticas de seguridad corporativa estrictas. Esta falta de datos reales impide que los desarrolladores entrenen y evalúen la eficacia de los agentes a escala, ya que no disponen de entornos representativos donde probar la interacción del modelo con sistemas complejos sin exponer información sensible.
Antes de la llegada de AutoSynthData, la industria recurría principalmente a dos alternativas para suplir esta carencia. La primera es la síntesis de datos tabulares, que intenta crear tablas artificiales que imiten la estructura de las reales. Este enfoque falla frecuentemente al mantener la validez estructural y la coherencia lógica entre diferentes tablas relacionadas, generando datos que, aunque parecen correctos individualmente, son inconsistentes en el conjunto. La segunda alternativa son los enfoques basados en procedimientos, que definen reglas manuales para generar datos. Estos carecen de fidelidad distributiva, lo que significa que no reflejan la variedad y los patrones reales de los datos de un negocio a menos que se dedique un esfuerzo masivo de autoría manual para cada dominio específico, lo que hace que el proceso sea inescalable.
El sistema AutoSynthData introduce un paradigma denominado schema-free. En lugar de intentar replicar una base de datos basándose en su estructura técnica preexistente, utiliza un modelo de lenguaje extenso (LLM) que actúa como un agente generador. Este agente interactúa con entornos empresariales simulados a través de interfaces de programación de aplicaciones (API) que imponen políticas y reglas de negocio estrictas. La diferencia fundamental es que los datos se generan mediante la ejecución de operaciones reales dentro de la simulación; la información es el resultado directo de interactuar con el entorno que define qué es válido y qué no.
Esta metodología garantiza la validez estructural por construcción. No es necesario que el agente conozca el esquema de la base de datos de antemano; basta con que interactúe con las API disponibles. Cualquier dato resultante será coherente con las reglas del sistema simulado porque el propio sistema rechaza cualquier operación que no cumpla con las restricciones lógicas. Este diseño permite desacoplar la validación de los datos del modelado de su distribución. Mientras que la validez estructural está asegurada por el entorno simulado, la calidad y variedad de los datos generados dependen del agente que opera el sistema, permitiendo que ambos aspectos se optimicen de manera independiente.
Para resolver los problemas de escalabilidad y fidelidad distributiva, los autores han desarrollado el Generalist Populator (GP). Se trata de un agente agnóstico al dominio, capaz de operar en diferentes tipos de entornos empresariales sin necesidad de una configuración específica para cada uno. El GP tiene la tarea de poblar los entornos simulados generando datos que no solo sean válidos técnicamente, sino que también sean representativos de un uso real en el mundo corporativo.
Los resultados presentados en el estudio indican que el Generalist Populator alcanza una fidelidad marginal promedio de 0,88 y un cumplimiento de las restricciones del 100 % en diez entornos diferentes. Lo más relevante es que logra estos hitos sin tener acceso previo a los esquemas de las bases de datos. Este rendimiento contrasta drásticamente con los sintetizadores estadísticos tradicionales, que resultaron inaplicables en siete de los diez entornos probados debido a que requerían datos semilla previos para poder funcionar, una limitación que AutoSynthData elimina por completo.
El estudio comparó el rendimiento del GP con agentes que sí tenían privilegios de acceso al esquema. En el entorno simulado de una aerolínea, donde los flujos de trabajo están estrechamente vinculados y son complejos, los agentes con acceso al esquema fallaron en el 82 % de las trayectorias. Este fallo se atribuye a una composición de tareas frágil, demostrando que el enfoque de simulación interactiva es más robusto que el simple conocimiento de la estructura de los datos. El acceso al esquema puede llevar al modelo a intentar atajos lógicos que no se traducen en operaciones válidas a través de las API del sistema.
La implementación de AutoSynthData tiene consecuencias directas para las empresas que buscan desplegar agentes de IA especializados en el uso de herramientas. Al permitir la generación de conjuntos de datos coherentes y a gran escala sin comprometer la privacidad, las organizaciones pueden acelerar la fase de entrenamiento y evaluación de sus modelos. Los desarrolladores ya no dependen de procesos lentos de anonimización de datos reales, que a menudo eliminan señales críticas para el entrenamiento, ni de la creación manual de escenarios de prueba que suelen ser insuficientes para cubrir casos borde (edge cases).
La disponibilidad del marco completo, junto con los diez entornos de simulación y los conjuntos de datos generados en formato de código abierto, facilita que otros investigadores y empresas adopten este paradigma. Esto permite crear bancos de pruebas estandarizados para medir la capacidad de tool-calling de los LLM en contextos corporativos, eliminando la opacidad que suele rodear a los datos de entrenamiento privados de las grandes compañías tecnológicas.
Desde un punto de vista técnico, este avance valida la idea de que la simulación activa es un camino más viable que la síntesis estática para generar datos complejos. La capacidad de un agente para aprender y generar datos interactuando con una API refleja mejor la dinámica de un sistema empresarial que una tabla generada mediante procesos probabilísticos. La simulación captura la causalidad de las operaciones: una reserva de vuelo solo existe si se ha procesado un pago y hay disponibilidad de asientos, una secuencia lógica que la síntesis estática a menudo ignora.
En cuanto a lo que se sabe y lo que permanece en el terreno de la incertidumbre, el documento confirma la eficacia del Generalist Populator en la creación de datos con alta fidelidad marginal y cumplimiento total de restricciones. Se ha demostrado que el sistema es superior a los sintetizadores estadísticos en entornos donde no hay datos semilla y más robusto que los agentes con acceso privilegiado al esquema en flujos de trabajo complejos.
Sin embargo, existen lagunas en cuanto a la cuantificación del rendimiento final de los agentes de IA que son entrenados con estos datos. Aunque se describe la eficacia del proceso de generación, no se detallan benchmarks exhaustivos que midan el incremento exacto en la precisión de un agente de IA final al ser entrenado con datos de AutoSynthData frente a otros métodos de síntesis. No se especifica, por ejemplo, si un agente entrenado con estos datos sintéticos mantiene el mismo rendimiento al enfrentarse a una base de datos real no simulada.
Persiste la incertidumbre sobre cómo se comportaría el sistema en entornos de una complejidad extrema que superen los diez escenarios probados. Esto incluye sectores con regulaciones aún más estrictas o flujos de trabajo que requieran una coordinación multiagente muy sofisticada, donde varios agentes deban colaborar para completar una tarea única. No obstante, la arquitectura propuesta sienta las bases para un entrenamiento de IA empresarial que ya no depende de la disponibilidad de datos sensibles.
La transición hacia la síntesis mediante simulación transforma la privacidad de un obstáculo en una ventaja competitiva. Al no requerir datos reales, el riesgo de filtraciones de información confidencial durante la fase de entrenamiento se reduce a cero. Además, permite a los desarrolladores crear escenarios hipotéticos o estresores de sistema que no existen en los datos históricos pero que son críticos para evaluar la resiliencia de un agente de IA antes de su despliegue en producción.
El impacto para el ecosistema de desarrollo de LLM es significativo. La capacidad de generar datos de alta calidad para el tool-calling permite que modelos más pequeños y eficientes puedan ser ajustados (fine-tuning) para tareas corporativas específicas, reduciendo la dependencia de modelos masivos y costosos. Al disponer de datos sintéticos coherentes, el proceso de alineación del modelo con las reglas de negocio se vuelve un proceso técnico reproducible y no una tarea de ensayo y error basada en datos anonimizados fragmentados.
En resumen, AutoSynthData propone que la mejor forma de obtener datos empresariales no es intentando copiar la realidad, sino construyendo una realidad simulada donde las reglas de negocio sean la única fuente de verdad. Este enfoque de Synthesis Through Simulation resuelve la tensión entre la necesidad de datos masivos para la IA y la obligatoriedad de la privacidad de los datos corporativos, permitiendo que la evaluación de los agentes de IA sea finalmente transparente y escalable.




