Funcionamiento de la comprensión de vídeo agéntica

Google ha implementado un sistema de procesamiento dinámico en sus modelos Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite que rompe con el esquema de análisis estático tradicional. Hasta ahora, los modelos de inteligencia artificial procesaban el vídeo mediante la ingesta de fotogramas a una tasa fija, generalmente un fotograma por segundo, lo que obligaba a los desarrolladores a elegir entre un coste elevado de tokens o la pérdida de detalles críticos en escenas rápidas.

La nueva arquitectura agéntica permite que el modelo asuma un rol activo y orientado a objetivos. En lugar de leer todo el flujo de datos de manera lineal, Gemini decide qué segmentos debe observar, a qué velocidad y a través de qué modalidad, ya sea analizando los fotogramas visuales, el audio o las transcripciones. El modelo utiliza un bucle agéntico que invoca herramientas internas para cargar únicamente las partes relevantes del archivo de vídeo, optimizando así el uso de los recursos computacionales.

Esta capacidad se asemeja a la visión agéntica, donde la ejecución de código se combina con la comprensión nativa de imágenes. Al aplicar este principio al vídeo, Google permite que el modelo realice búsquedas, escaneos e inspecciones dirigidas sobre los marcos visuales, lo que elimina la necesidad de que el desarrollador gestione manualmente el muestreo de los clips para encontrar momentos específicos.

Impacto en el consumo de tokens y costes operativos

La transición hacia un modelo de análisis dinámico ha generado mejoras cuantitativas en la eficiencia del procesamiento. Según los datos proporcionados por Google DeepMind, la implementación de la comprensión agéntica reduce el consumo de tokens hasta en un 88 % y disminuye los costes operativos hasta en un 66 % en comparación con el procesamiento estático.

Estas ganancias de eficiencia son especialmente notables en contenidos de larga duración, que abarcan desde guías instructivas de diez minutos hasta ponencias de noventa minutos o grabaciones de varias horas. En estos casos, el procesamiento estático solía saturar la ventana de contexto del modelo o requerir técnicas de reducción de calidad que comprometían la precisión de los resultados.

En términos de rendimiento, el modelo Gemini 3.7 Flash se posiciona en la frontera de Pareto entre precisión y coste. Esto significa que ofrece la mejor combinación posible de calidad de respuesta y eficiencia económica entre todos los modelos probados para la comprensión de vídeo. Además de la reducción de costes, Google reporta un incremento en la precisión de las respuestas de hasta un 7 %.

Capacidades técnicas y casos de uso específicos

La capacidad de ajustar la tasa de fotogramas en tiempo real permite a Gemini ejecutar tareas que eran técnicamente inviables o imprecisas con el muestreo fijo de un fotograma por segundo. Una de las funciones más destacadas es la recuperación de momentos en fracciones de segundo, lo que permite localizar cambios de estado instantáneos o cortes precisos en la edición de vídeo.

Otro avance significativo es la búsqueda de «aguja en un pajar» en vídeos extensos. El modelo puede responder a consultas complejas sobre contenidos de varias horas sin necesidad de consumir millones de tokens, ya que solo procesa la información estrictamente necesaria para validar la respuesta. Esto optimiza la gestión de la memoria del modelo y acelera el tiempo de respuesta.

En el ámbito de la seguridad y el control de calidad, la tecnología permite una detección de anomalías más rigurosa. Gemini puede remuestrear ventanas temporales específicas a una tasa de fotogramas más alta para inspeccionar movimientos rápidos o artefactos visuales sutiles que pasarían desapercibidos en un análisis estándar. Asimismo, el modelo ha mejorado su capacidad para contar objetos y acciones, rastreando movimientos físicos repetitivos y elementos distintos a lo largo del tiempo con mayor exactitud.

Implementación para desarrolladores y usuarios finales

La funcionalidad ya está disponible para la carga de vídeos y contenidos de YouTube a través de la API de Gemini en Google AI Studio y en la plataforma Gemini Enterprise Agent Platform. Para activar estas capacidades, los desarrolladores solo deben cambiar la configuración de procesamiento a «agentic» en la API, sin que esto suponga un cargo adicional sobre los precios estándar de tokens de Gemini.

Google ha confirmado que estas mejoras se extenderán próximamente a miles de millones de usuarios a través de la aplicación de Gemini, integrándose en los modelos Flash y Flash-Lite. Además, en los próximos meses, la comprensión agéntica potenciará la función Ask YouTube en la página de reproducción de vídeos, permitiendo que las respuestas generadas estén mejor fundamentadas en los elementos visuales del contenido.

Nuevo marco de medición del ROI para la automatización agéntica

Paralelamente al avance técnico, se ha identificado la necesidad de actualizar la forma en que las empresas miden el retorno de la inversión (ROI) en la automatización. El modelo tradicional, heredado de la Automatización Robótica de Procesos (RPA), se basaba en una fórmula simple: horas ahorradas multiplicadas por el coste laboral, menos el coste de construcción. Este enfoque es insuficiente para la IA agéntica porque asume que los procesos son estables y se basan en reglas rígidas.

El nuevo marco de trabajo propuesto para los líderes de los Centros de Excelencia de IA sugiere que el valor de los agentes no reside solo en la tarea ejecutada, sino en el entorno de la tarea. Mientras que la RPA ignoraba el coste de mantenimiento ante cambios en el proceso y no contabilizaba la gestión de excepciones, la automatización agéntica es capaz de razonar y adaptarse, lo que requiere métricas diferentes.

Este modelo de valor agéntico se divide en cuatro dimensiones principales. La primera es el ahorro de tiempo, que ahora se aplica a una base de trabajo mucho más amplia que la que podía manejar la RPA. La segunda es la gestión de excepciones; dado que corregir un error puede costar entre 1,5 y 4 veces más que la transacción original, la capacidad de un agente para resolver incidencias reduce drásticamente los costes operativos.

La tercera dimensión es la calidad de las decisiones. En sectores como el riesgo, el crédito o la fijación de precios, una única decisión optimizada mediante la asistencia de un agente puede generar un valor económico superior al ahorro anual de horas de trabajo. Finalmente, el modelo contempla la economía del mantenimiento, reconociendo que los agentes reducen la necesidad de rediseñar manualmente el flujo de trabajo cada vez que cambia una regla de negocio.

Transición de la RPA a la automatización agéntica

El cambio de paradigma implica que las organizaciones ya no deben limitarse a insertar un agente en un proceso existente, sino rediseñar el flujo de trabajo completo alrededor de las capacidades del agente. Se advierte que muchas empresas cometen el error de invertir la fórmula de transformación digital, priorizando la tecnología sobre el rediseño de procesos y la capacitación del personal.

Según análisis citados en el marco de trabajo, una transformación exitosa debería seguir un patrón de inversión donde, por cada dólar destinado a la tecnología agéntica, se inviertan tres dólares en el rediseño del proceso y cinco dólares en la adopción y creación de capacidades internas. La automatización agéntica, al integrar la capacidad de analizar vídeo y tomar decisiones autónomas, permite que la IA gestione el juicio y la coordinación entre sistemas, superando la rigidez de las herramientas basadas en reglas.

Esta evolución permite que las empresas prioricen flujos de trabajo donde la calidad de la decisión y el manejo de excepciones sean críticos, cuantificando el valor real más allá de la simple reducción de minutos de trabajo humano. La integración de la comprensión de vídeo en este ecosistema agéntico abre la puerta a automatizar procesos de inspección visual y análisis de medios que antes requerían supervisión humana constante.