El UK AISI y EvalEval estandarizan la reproducibilidad de los benchmarks de IA

El Instituto de Seguridad de la IA del Reino Unido (UK AISI) ha comenzado a utilizar la infraestructura de la coalición EvalEval para publicar los resultados de sus evaluaciones de modelos de lenguaje de forma abierta. Esta colaboración, formalizada tras una serie de investigaciones iniciadas en un taller conjunto durante NeurIPS 2025, tiene como objetivo principal combatir la falta de consistencia en los benchmarks de inteligencia artificial, donde los resultados suelen variar drásticamente según quién ejecute la prueba o la configuración técnica empleada.

Implementación del esquema Every Eval Ever y Evaluation Cards

El núcleo de esta iniciativa es la implementación del esquema Every Eval Ever (EEE) y el uso de las llamadas Evaluation Cards. El esquema EEE es un marco de reporte compartido que busca estandarizar la documentación de las evaluaciones, mientras que las Evaluation Cards funcionan como registros interpretables que combinan los metadatos del benchmark, los datos de la ejecución de la prueba y los metadatos del modelo. Este sistema permite que cualquier investigador determine si dos puntuaciones aparentemente similares se obtuvieron bajo condiciones reales de funcionamiento o si existen diferencias significativas en el entorno de prueba.

La adopción de este sistema responde a un problema crítico en el sector: la opacidad de los informes de rendimiento. Actualmente, muchos resultados de benchmarks se publican en formatos heterogéneos y plataformas distintas, careciendo a menudo de la información técnica necesaria para que un tercero pueda replicar el experimento. Además, la ejecución repetida de ciertas evaluaciones puede resultar prohibitivamente costosa en términos de computación, lo que hace que la transparencia en el informe inicial sea la única vía para validar la capacidad real de un modelo.

Modelos de frontera y benchmarks evaluados

En el marco de esta colaboración, el UK AISI ha hecho públicos los métodos y hallazgos de cinco benchmarks específicos: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro y Terminal-Bench 2.0. Estos datos incluyen resultados verificados, el contexto de la prueba y la configuración técnica detallada. Las evaluaciones se han centrado en seis modelos de frontera: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 y GPT-5.4. Asimismo, se han incluido resultados de dos evaluaciones centradas en ciberseguridad, denominadas Cyber CTFs y The Last Ones, aunque estas utilizan un conjunto de modelos parcialmente diferente.

Estos datos acompañan la publicación del artículo técnico del UK AISI titulado "How Inference Compute Shapes Frontier LLM Evaluation". En dicho estudio, el instituto analiza cómo el rendimiento en los benchmarks depende directamente del cómputo utilizado durante la inferencia (el proceso de generación de respuesta del modelo) y del protocolo de evaluación aplicado. Un hallazgo relevante es que el rendimiento en Humanity's Last Exam fluctúa según estos factores; específicamente, se observó que cuando los modelos reciben retroalimentación de corrección por parte de un oráculo tras cada intento, continúan resolviendo tareas adicionales a medida que aumenta el uso de tokens.

Herramientas de rigor científico y validación técnica

El UK AISI ha integrado este nuevo enfoque de reproducibilidad con otras herramientas propias diseñadas para mejorar el rigor científico. Entre ellas se encuentra OptStop, orientada a hacer las evaluaciones más eficientes, y HiBayES, que aplica el modelado bayesiano jerárquico para aportar mayor rigor estadístico a las mediciones. Estas herramientas, sumadas a la estandarización de la elicitación de capacidades y el análisis de transcripciones, buscan cerrar las brechas existentes en la comunicación de resultados de IA.

La importancia de este avance reside en la distinción entre el marketing y la comparación técnica. Cuando un desarrollador afirma que un modelo supera a otro en un benchmark sin proporcionar una Evaluation Card, el resultado carece de valor comparativo real, ya que un cambio mínimo en el protocolo de elicitación o en el cómputo de inferencia puede alterar la puntuación. Al proporcionar transparencia a nivel de transcripción, el UK AISI transforma la evaluación de una simple captura de pantalla de una tabla de clasificación (leaderboard) en un contrato técnico verificable.

Impacto en desarrolladores, investigadores y gobernanza

Para los desarrolladores de modelos, esta infraestructura implica la necesidad de reportar resultados verificados bajo el estándar EEE. Para los creadores de benchmarks, el reto consiste en ejecutar y documentar sus datos siguiendo este mismo esquema. Por su parte, los investigadores de gobernanza y política pueden ahora utilizar las Evaluation Cards para examinar el estado global de los informes de evaluación y detectar dónde existen vacíos de información o inconsistencias deliberadas.

El sistema implementado no pretende eliminar los desacuerdos sobre el rendimiento de los modelos, sino trasladar la discusión hacia las variables correctas. Al hacer que la configuración sea explícita, se evita que las discrepancias se deban a errores de configuración o a la omisión de datos críticos como la semilla (seed), el acceso a herramientas, el presupuesto de intentos o la retroalimentación del oráculo. Si un campo de datos falta en el informe, la norma sugerida es no citar la diferencia de rendimiento en lugar de asumir que se utilizaron los valores predeterminados.

Misión de la coalición EvalEval y supervisión gubernamental

La coalición EvalEval, que impulsa este ecosistema, se define como una comunidad de investigación dedicada a crear una infraestructura de despliegue robusta. Su misión es resolver la falta de consenso sobre la utilidad y aplicabilidad de las evaluaciones actuales, ampliando la cobertura de los impactos que son relevantes tanto para la investigación científica como para el análisis de políticas públicas. Al centralizar los resultados en un repositorio compartido, se facilita la metainvestigación y se crean puntos de referencia verificados para interpretar el contexto de cualquier evaluación.

El UK AISI, como organismo dependiente del Departamento de Ciencia, Innovación y Tecnología del gobierno británico, utiliza estos avances para proporcionar a los gobiernos una comprensión científica de los riesgos que suponen los modelos de IA avanzados. La capacidad de auditar los benchmarks permite detectar si se están ocultando riesgos críticos o si se están inflando artificialmente las capacidades de un modelo mediante protocolos de prueba optimizados que no reflejan el uso real del sistema.