TITULAR: UC Berkeley propone rediseñar los sistemas de datos para la era de la inteligencia gratuita
Aditya G. Parameswaran, profesor asociado de EECS y codirector del EPIC Data Lab en UC Berkeley, junto a su equipo de colaboradores, ha planteado una nueva perspectiva sobre el futuro de la infraestructura de datos. La premisa central es que el coste de la inteligencia artificial está disminuyendo a un ritmo acelerado, lo que sitúa al sector en el umbral de una era de inteligencia virtualmente gratuita para el trabajo de conocimiento cotidiano.
Para dimensionar este fenómeno, el análisis destaca que las capacidades de modelos similares a GPT-4 costaban aproximadamente 30 dólares por millón de tokens a principios de 2023. En la actualidad, ese mismo volumen de procesamiento se ejecuta por menos de un dólar, y algunos proveedores han logrado reducir el precio por debajo de los 0,10 dólares. Esta reducción, que oscila entre 9 y 900 veces según los benchmarks, afecta tanto a los modelos frontera como a las alternativas de código abierto, con una caída mediana cercana a las 50 veces por año.
El cuello de botella de la infraestructura de datos
Esta democratización del acceso al razonamiento avanzado implica que la inteligencia necesaria para la gran mayoría de las tareas profesionales ya está disponible y es cada vez más barata. Bajo este escenario, el cuello de botella ya no es la capacidad de razonamiento del modelo, sino la eficiencia de los sistemas de datos que soportan estas operaciones. El equipo de Berkeley argumenta que los sistemas actuales no están diseñados para interactuar con agentes autónomos, sino con humanos o herramientas de inteligencia de negocio tradicionales, que operan bajo patrones de consulta lineales y predecibles.
La especulación agéntica y la redundancia de consultas
El primer pilar de la propuesta se centra en los sistemas de datos para agentes. Los investigadores definen la especulación agéntica como un flujo de trabajo heterogéneo y de alto volumen donde un agente no realiza una sola consulta, sino que ejecuta una secuencia de introspección del esquema, exploración columnar y formulación progresiva de consultas. En tareas complejas, como el análisis de causas raíz sobre la caída de ventas en una zona específica o el análisis de cohortes para predecir la fuga de usuarios en el próximo trimestre, un solo requisito del usuario puede derivar en miles de consultas SQL individuales debido al espacio combinatorio de joins, agregaciones y filtros necesarios.
El problema reside en que los sistemas de datos actuales tratan cada consulta de forma aislada. El estudio revela que, en benchmarks de text-to-SQL donde múltiples agentes intentan resolver una tarea, entre el 80 y el 90 % de las subconsultas realizan un trabajo duplicado, ya que solo el 10 o 20 % de los subplanes son distintos. Aunque esta redundancia aumenta la tasa de éxito de la tarea al permitir múltiples intentos de razonamiento, representa un desperdicio masivo de recursos computacionales desde la perspectiva del sistema de datos, que procesa cada petición como si fuera la primera.
Optimización de la ejecución y sistemas proactivos
Para solucionar esto, Berkeley propone el rediseño de los sistemas para que puedan reutilizar resultados entre subplanes superpuestos, basándose en conceptos de optimización de consultas múltiples y escaneos compartidos. Otra vía es la implementación de la satisfacción, que consiste en devolver respuestas aproximadas que sean suficientes para que el agente avance en su razonamiento, utilizando técnicas de procesamiento de consultas aproximadas o AQP. Esto evitaría que el sistema gaste ciclos de CPU en precisión decimal cuando el agente solo necesita validar una tendencia general para decidir el siguiente paso de su flujo de trabajo.
El análisis sugiere abandonar el modelo de envío de consultas SQL individuales en favor de lotes de consultas con diferentes niveles de precisión requerida. En lugar de obligar al agente a enumerar cada paso del espacio de búsqueda, los sistemas de datos podrían integrar primitivas de nivel superior, similares a las macros de Jinja utilizadas en DBT, que permitan interacciones basadas en bucles. Esto trasladaría la carga de la iteración desde el razonamiento del agente hacia la ejecución optimizada del motor de base de datos.
Además, se plantea que el sistema de datos deje de ser un ejecutor pasivo para convertirse en un componente proactivo. Dado que el sistema posee un conocimiento profundo de las características de los datos que el agente no tiene a priori, podría orientar al agente hacia direcciones más eficientes o proporcionar estimaciones de latencia antes de ejecutar una consulta costosa. Esta interacción es posible porque los agentes pueden procesar cualquier forma de retroalimentación textual, eliminando la necesidad de que el sistema devuelva estrictamente un resultado de tabla SQL. El sistema podría incluso preparar vistas materializadas o virtuales y entregarlas al agente como parte del contexto, optimizando el coste computacional total.
Infraestructura para la gestión de estado y memoria de agentes
El segundo eje se refiere a los sistemas de datos de agentes, entendidos como la infraestructura necesaria para que miles de agentes gestionen estados en tareas de larga duración, coordinen acciones y gestionen fallos. Este sustrato es independiente de la pila de inferencia que proporciona la inteligencia bruta, la cual ya está abstraída a través de APIs de proveedores como OpenAI y Anthropic, o marcos de servicio para modelos de pesos abiertos.
Actualmente, la gestión de la memoria de los agentes se basa mayoritariamente en archivos de markdown no estructurados que se recuperan mediante búsqueda de texto o embeddings. Si bien este enfoque funciona para tareas sencillas, los investigadores advierten que no es escalable cuando los agentes asumen la mayor parte del trabajo de conocimiento. El uso de ventanas de contexto limitadas y la latencia asociada a la inserción de fragmentos de archivos hacen que este método sea ineficiente en bases de código o bases de datos masivas, donde serializar toda la información relevante en el contexto es inviable.
Memoria estructurada y aprendizaje correctivo
Para superar estas limitaciones, se propone el uso de memoria estructurada. A diferencia de los grafos de conocimiento, que carecen de búsqueda estructurada eficiente y sufren limitaciones similares a los archivos MD, la memoria estructurada organiza la información a través de diversos atributos o facetas. Por ejemplo, un agente que depura un test fallido podría recuperar únicamente los recuerdos etiquetados con el módulo, lenguaje, marco y modo de fallo específicos, en lugar de depender de una similitud semántica general que podría devolver fragmentos irrelevantes.
Un punto crítico identificado es la naturaleza de la información almacenada. Recuperar trazas brutas de agentes que cometieron errores puede inducir a que otros agentes repitan el mismo fallo. Por ello, el sistema debe priorizar la memoria correctiva, donde se almacenen instrucciones explícitas sobre cómo evitar errores previos en operaciones específicas. En el caso de agentes de datos, estas dimensiones incluirían las tablas afectadas, el tipo de operación y las instrucciones correctivas en lenguaje natural, permitiendo que el sistema actúe como un repositorio de lecciones aprendidas.
Este sistema de gestión de estado es fundamental para operar enjambres de agentes. La coordinación y el consenso entre múltiples entidades autónomas requieren una capa de persistencia que permita la recuperación selectiva y precisa de la experiencia previa, evitando la saturación del contexto del modelo y reduciendo la redundancia en la ejecución de tareas complejas. Sin este sustrato, el despliegue de miles de agentes coordinados resultaría en un caos de ejecuciones redundantes y errores cíclicos.
Síntesis autónoma de sistemas de datos y validación
El tercer componente es la creación de sistemas de datos por agentes. El equipo de Berkeley observa que los agentes están adquiriendo la capacidad de sintetizar sistemas de datos completos para cargas de trabajo específicas. Esto permitiría pasar de sistemas genéricos, diseñados para soportar cualquier tipo de consulta, a sistemas personalizados construidos desde cero para cada tarea nueva, optimizando el almacenamiento y el indexado según la necesidad exacta del problema.
La capacidad de generar la arquitectura de datos, definir los esquemas y optimizar el almacenamiento de forma automática abre la puerta a una eficiencia sin precedentes. Sin embargo, este avance introduce un desafío crítico de seguridad y fiabilidad: la verificación. Es complejo asegurar que un sistema de datos sintetizado por una IA se comporte exactamente como se espera y no introduzca sesgos o errores en la recuperación de la información, ya que el sistema generado es, por definición, una caja negra creada por otro modelo.
La investigación se orienta ahora a determinar qué mecanismos de validación son necesarios para confiar en estos sistemas generados autónomamente. La intersección de estas tres dimensiones forja un futuro donde la infraestructura de datos no es una entidad estática, sino un ecosistema fluido que se adapta, recuerda y se construye a sí mismo en respuesta a las necesidades de los agentes que lo operan.
Impacto en el desarrollo de software y el sector tecnológico
La transición hacia sistemas de datos optimizados para agentes cambia la prioridad del desarrollo de software. Hasta ahora, el enfoque estaba en optimizar la interfaz humano-máquina y la velocidad de respuesta de las consultas para un usuario final. Con la llegada de la inteligencia gratuita, el foco se desplaza hacia la optimización de la interacción máquina-máquina y la gestión de la redundancia en la especulación agéntica. Esto implica que el diseño de bases de datos ya no puede ignorar el patrón de acceso de los agentes, que es radicalmente distinto al humano.
Para los desarrolladores y empresas, esto significa que un sistema que es eficiente para un analista de datos humano puede ser extremadamente ineficiente para un enjambre de agentes que realiza miles de microconsultas para validar una hipótesis. La adopción de memorias estructuradas y la capacidad de proporcionar retroalimentación proactiva se convierten en ventajas competitivas para cualquier infraestructura de datos que pretenda soportar flujos de trabajo autónomos a escala.
En cuanto al estado actual del conocimiento, se ha confirmado que la tendencia de precios de la inferencia es irreversible y que la capacidad de razonamiento ya es suficiente para la mayoría de las tareas de oficina. Sin embargo, persiste una incertidumbre significativa sobre la velocidad de adopción de estos cambios arquitectónicos. La implementación de memorias estructuradas y la transición hacia sistemas proactivos dependen de que surjan marcos de trabajo que estandaricen estas capacidades y de que los proveedores de infraestructura de datos acepten modificar sus núcleos para soportar la especulación agéntica.
Comparado con el estado anterior del sector, donde la base de datos era un almacén pasivo de información que respondía a peticiones explícitas, el modelo propuesto por Berkeley convierte la capa de datos en un socio activo del proceso de razonamiento. Mientras que antes el objetivo era minimizar el tiempo de respuesta de una consulta SQL, el nuevo objetivo es minimizar el coste computacional total de una tarea de conocimiento, permitiendo que el sistema de datos gestione la redundancia y la memoria correctiva de forma autónoma.



