El impacto del laboratorio FORGE en la seguridad de Windows y Linux
El laboratorio Frontier Offensive Research & Generative Exploitation (FORGE) de Microsoft Security ha implementado un modelo de ingeniería de seguridad autónoma que ha permitido la detección de 140 vulnerabilidades catalogadas como CVE (Common Vulnerabilities and Exposures) en el sistema operativo Windows. Este periodo de investigación, comprendido entre mayo y septiembre de 2026, culminó con la resolución de 52 de estos fallos únicamente en la actualización de seguridad de septiembre de ese mismo año.
La actividad de FORGE no se ha limitado al ecosistema propietario de Microsoft. El equipo ha enviado 155 informes validados internamente que afectan a 23 proyectos de código abierto, incluyendo el kernel de Linux. A través de Akrites, una iniciativa de la Linux Foundation dedicada a la remediación confidencial y la divulgación de vulnerabilidades en software crítico, FORGE ha logrado que uno de sus informes se convierta en el primer envío de Akrites que resulta en un parche integrado directamente en el kernel de Linux.
Este despliegue demuestra que el descubrimiento agéntico, basado en agentes de IA que operan con autonomía, puede generar un volumen significativo de hallazgos. Sin embargo, la experiencia de Microsoft revela que la capacidad de encontrar una vulnerabilidad difícil es solo el primer paso. El verdadero cuello de botella actual no es la inteligencia del modelo para detectar el fallo, sino la capacidad de la organización para validar, remediar y lanzar actualizaciones a la misma velocidad que la IA genera los informes.
De la capacidad de frontera a la operatividad a escala
Microsoft ha identificado un cambio fundamental en la investigación de vulnerabilidades: el paso de la capacidad de frontera a la escala. Mientras que la capacidad de frontera se centra en si un sistema puede resolver un problema que requiere un razonamiento profundo, la escala analiza si ese resultado puede repetirse en múltiples objetivos sin necesidad de reconstruir cada entorno de investigación o proceso de revisión desde cero.
Para gestionar este flujo, el laboratorio utiliza un sistema de escaneo agéntico multimodelo denominado MDASH. Este marco de trabajo permite organizar la búsqueda de errores, pero ha puesto de manifiesto que aumentar el número de auditores de IA no incrementa necesariamente la tasa de correcciones implementadas. Si los informes llegan más rápido de lo que el Microsoft Security Response Center (MSRC) puede resolverlos, se crea una cola de espera que puede reducir la eficiencia general del sistema.
Un problema crítico en este proceso es la generación de informes duplicados o mal sustentados, que consumen la atención de los ingenieros humanos y retrasan la resolución de fallos graves. Para mitigar esto, Microsoft ha implementado algoritmos deterministas basados en el Árbol de Sintaxis Abstracta (AST), una representación jerárquica de la estructura del código fuente. Esta herramienta ha logrado reducir en un 45 % los hallazgos duplicados en escaneos múltiples del mismo código, optimizando la carga de trabajo tanto para los generadores de pruebas de concepto como para el triaje humano.
Optimización de la evidencia reproducible
El objetivo de MDASH no es simplemente generar más informes, sino producir hallazgos reproducibles que contengan evidencia suficiente para que el siguiente eslabón de la cadena pueda actuar. Esto implica el uso de probadores automatizados específicos para cada proyecto, generadores de prueba de vulnerabilidad (PoV) y de prueba de concepto (PoC), así como constructores de arneses que permitan ejecutar el código en entornos controlados para confirmar que el fallo es real y alcanzable.
Economía del razonamiento y consumo de tokens
La investigación de FORGE plantea una transición desde la simple medición del consumo de tokens hacia una economía del razonamiento. Microsoft sostiene que minimizar el gasto de tokens no es el objetivo correcto, ya que un informe breve y ambiguo puede ser barato de generar, pero extremadamente costoso de investigar para un humano. Por el contrario, un análisis extenso que establezca una ruta de ejecución detallada puede reducir el coste total del sistema.
El sistema MDASH combina modelos de frontera con modelos destilados, auditores especializados y herramientas de análisis de código. La estrategia consiste en asignar las tareas según la complejidad: el trabajo rutinario se deriva a modelos más económicos, mientras que las cuestiones no resueltas o que requieren un razonamiento profundo se escalan a modelos más potentes. Esta política de asignación busca cerrar deficiencias de evidencia específicas, como identificar un llamador de función o una configuración de compilación, en lugar de repetir revisiones que no aportan datos nuevos.
Además, los resultados de estos escaneos se están utilizando como datos de entrenamiento. Cada ejecución de MDASH genera señales que incluyen veredictos de falsos positivos y verdaderos positivos, comentarios de revisores y resultados de parches. Este ciclo permite aplicar aprendizaje por refuerzo y ajuste fino (fine-tuning) en modelos de ciberseguridad especializados, para que la IA aprenda no solo a identificar la vulnerabilidad, sino a comprender qué explicaciones son útiles para que los humanos y los probadores actúen con eficacia.
El ciclo continuo de validación y remediación
Para Microsoft, la validación y la remediación no son pasos finales de limpieza, sino componentes integrales del bucle de descubrimiento. Cada candidato a vulnerabilidad debe atravesar un proceso de verificación automatizada, revisión humana, desarrollo de parches y pruebas de regresión. Cada una de estas etapas devuelve información al sistema para mejorarlo.
Un activador reproducible no solo fortalece el informe inicial, sino que sirve de guía para el parche y se convierte en una prueba de regresión para evitar que el error reaparezca en versiones futuras. De igual manera, una validación fallida aporta valor si registra la causa exacta del fallo, ya sea por una ruta de ejecución inalcanzable, una configuración de compilación incorrecta o una falta de control del atacante sobre la entrada de datos.
Este enfoque permite que cada investigación deje una capacidad reutilizable, ya sea en forma de un arnés de pruebas más sólido o una regla de enrutamiento que evite errores similares en el futuro. La atención humana, aunque sigue siendo esencial, se desplaza hacia los puntos donde el juicio crítico tiene mayor impacto, dejando las tareas de comprobación mecánica a los sistemas agénticos.
Implicaciones para la ingeniería de seguridad autónoma
La metodología aplicada por el laboratorio FORGE redefine la relación entre la IA y el ingeniero de seguridad. La capacidad de descubrir errores a gran escala desplaza la escasez desde la inteligencia del modelo hacia otros recursos más tangibles, como el tiempo del ingeniero, la disponibilidad de compilaciones funcionales o la capacidad de generar disparadores reproducibles.
El éxito en la integración de parches en el kernel de Linux a través de Akrites subraya la viabilidad de este modelo en entornos de código abierto, donde la transparencia y la validación rigurosa son fundamentales. La transición hacia sistemas que no solo encuentren fallos, sino que ayuden a cerrarlos mediante la generación de evidencia técnica, marca un cambio en el paradigma de la defensa cibernética, pasando de una postura reactiva a una proactiva y automatizada.
En conclusión, la experiencia de Microsoft entre mayo y septiembre de 2026 indica que la IA generativa ha superado la fase de demostración de capacidades individuales para entrar en una fase de despliegue industrial. El reto actual reside en la infraestructura de soporte: la capacidad de procesar, validar y desplegar correcciones a una velocidad proporcional a la capacidad de descubrimiento de los agentes autónomos.



