Arquitectura y despliegue de Mistral Large 4

Mistral ha lanzado la vista previa pública de Mistral Large 4, denominado internamente como «le Chonk», un modelo multimodal nativo que cuenta con un billón de parámetros, de los cuales 52.000 millones permanecen activos durante el procesamiento. Este desarrollo representa el modelo más extenso y capaz de la compañía hasta la fecha, habiendo sido entrenado desde cero utilizando 3.800 GPU NVIDIA Grace Blackwell instaladas en los centros de datos propios de Mistral situados en territorio europeo.

La compañía ha confirmado que los pesos del modelo se publicarán al finalizar el mes actual. Hasta ese momento, el sistema se encuentra en una fase de red-teaming, un proceso de pruebas de seguridad donde expertos en ciberseguridad, socios verificados y autoridades estatales evalúan el modelo en entornos reales. Para estas pruebas, se ha facilitado un acceso con moderación reducida y capacidades de ciberseguridad ampliadas para analizar el comportamiento del modelo antes de su lanzamiento total.

El despliegue de Mistral Large 4 se realizará en diversas regiones globales, destacando una implementación europea gestionada íntegramente por Mistral. Este enfoque busca evitar la dependencia de otros proveedores de servicios digitales y asegurar que el funcionamiento del modelo se rija estrictamente bajo la legislación europea, promoviendo así la soberanía de la inteligencia artificial en la región.

Capacidades avanzadas en ciberseguridad y razonamiento

Uno de los pilares de Mistral Large 4 es su especialización en ciberseguridad. Según el Artificial Analysis Cyber Index, una evaluación independiente sobre la detección y corrección de fallos en software real, el modelo se sitúa entre los cinco mejores a nivel global y lidera el segmento de modelos de pesos abiertos desarrollados fuera de China. En pruebas específicas de reproducción y parcheo de vulnerabilidades en software de código abierto, el modelo ha alcanzado una tasa de éxito del 82 %.

En el benchmark Cybench, compuesto por 40 ejercicios derivados de competiciones de seguridad, Mistral Large 4 ha resuelto el 93 % de los desafíos. Este resultado contrasta con el rendimiento de modelos cerrados como Claude Opus 5.5 o GPT-6 Astra, que han registrado puntuaciones cercanas a cero en las mismas pruebas debido a que sus filtros de seguridad internos bloquean la ejecución de estas tareas. Mistral argumenta que, para defender el software, es imperativo demostrar que una vulnerabilidad es real, una labor que los filtros de rechazo de los modelos cerrados suelen impedir.

Más allá de los benchmarks, las pruebas internas indican que el modelo es eficaz en el análisis de malware, la priorización de vulnerabilidades y la redacción de reglas de detección. Al ser un modelo de pesos abiertos que permite el autodespliegue en nubes privadas o instalaciones locales, las organizaciones pueden ejecutar operaciones de seguridad avanzadas siguiendo sus propias políticas sin riesgo de que el proveedor desactive funciones críticas durante la gestión de un incidente.

Rendimiento en flujos de trabajo de agentes y programación

En el ámbito de la ingeniería de software, Mistral Large 4 ha demostrado capacidades sólidas en la comprensión de repositorios y flujos de trabajo en terminales. Ha obtenido una puntuación del 61,7 % en DeepSWE v1.1, un 59,4 % en SWE-Atlas-QnA y un 28,3 % en Terminal-Bench 4. Su índice combinado de agentes de programación es del 49,8 %, superando a modelos como DeepSeek V4 Pro 0813 y Qwen3.8 Max.

Para validar la calidad del código, se realizó una evaluación ciega a través de Surge AI, donde anotadores profesionales calificaron las salidas del modelo en una escala del 1 al 5 sin conocer la identidad de la IA. En este estudio, la versión preliminar de Mistral Large 4 alcanzó una calificación de 3,74, situándose en segunda posición detrás de Claude Opus 5 y superando a Kimi K3, GLM-5.3 y GLM-5.2.

Respecto a los flujos de trabajo de agentes generales, el modelo puede recopilar información, utilizar herramientas externas y generar entregables finales. En AutomationBench, que analiza 657 flujos de trabajo empresariales en aplicaciones como Slack, Salesforce, Gmail y Google Sheets, el modelo obtuvo un 59,9 %, superando a MiMo-V2.6-Pro y DeepSeek V4 Pro. Asimismo, en la evaluación AA-Briefcase sobre trabajo de conocimiento de largo horizonte, alcanzó un Elo de 1.393.

Multimodalidad y aplicaciones en ciencia y matemáticas

Mistral Large 4 introduce una mejora sustancial en la comprensión de imágenes, permitiendo el razonamiento sobre gráficos, documentos complejos y fotografías naturales. Esta capacidad es especialmente relevante en sectores como la observación terrestre, la manufactura y la ingeniería. El modelo puede combinar el grounding visual —la capacidad de vincular elementos del texto con regiones específicas de una imagen— con funciones de agente para inspeccionar imágenes satelitales de gigapíxeles o verificar planos técnicos mecánicos.

En la comparativa Dense 200, centrada en el grounding visual, Mistral Large 4 ha superado a GPT-6-Astra con un 42 % frente a un 41 %. Esta precisión permite al modelo localizar objetos difíciles de encontrar en imágenes geoespaciales masivas o recuperar evidencias concretas dentro de archivos PDF extensos.

En el área científica, el modelo ha sido optimizado para tareas de matemáticas, física y química. Es capaz de generar simulaciones de Hartree-Fock, una tarea de química computacional compleja que requiere múltiples rutinas avanzadas, en un solo paso. En el benchmark SciCode-Verified, que mide la implementación de flujos científicos en código, se posiciona como el estado del arte entre los modelos de pesos abiertos.

En cuanto al razonamiento matemático, las evaluaciones humanas indican que el modelo posee una estructura más precisa que GLM-5.3 y puede mantener tareas de matemáticas aplicadas de larga duración, incluyendo trabajos relacionados con la física teórica de vanguardia.

Aplicaciones empresariales y compatibilidad multilingüe

El modelo ha sido diseñado para tareas profesionales cotidianas, destacando en la creación y edición de hojas de cálculo y documentos complejos. Evaluaciones realizadas por la entidad externa vals.ai indican que Mistral Large 4 supera a GPT-6-Astra en tareas representativas de los sectores financiero y legal. Específicamente, en el benchmark de agentes legales de HarveyAI, el modelo ha mostrado un rendimiento superior.

Para lograr este nivel de especialización, Mistral ha colaborado con empresas de sectores críticos como la logística, la farmacéutica, la ingeniería, la ciencia y el sector público. El entrenamiento de Mistral Large 4 ha utilizado el mismo entorno de personalización y aprendizaje por refuerzo (RL) que la compañía ofrece a sus clientes a través de Mistral Forge.

Otro aspecto relevante es la capacidad lingüística del modelo. Una parte considerable de los datos de entrenamiento ha sido multilingüe, abarcando más de 160 idiomas, incluyendo todas las lenguas oficiales de la Unión Europea. Esta diversidad lingüística refuerza la utilidad del modelo en mercados globales y administraciones públicas europeas.

Contexto de la industria: actualizaciones de Google y bioseguridad

El lanzamiento de Mistral Large 4 coincide con una serie de actualizaciones en el ecosistema de Google. La compañía ha presentado Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, orientados a mejorar la interactividad y la capacidad de razonamiento prolongado. Paralelamente, se han introducido las versiones Gemini 3.8 Flash y Gemini 3.8 Flash Cyber, diseñadas para ofrecer mayor velocidad de respuesta y capacidades optimizadas para la seguridad informática.

En el ámbito de la biotecnología, Google DeepMind ha presentado SynthID Bio, una prueba de concepto para el marcado de agua de proteínas generadas por inteligencia artificial. Esta herramienta permite insertar una firma imperceptible directamente en el código biológico, la cual es verificable tanto en el modelo digital como en la proteína física sintetizada. El objetivo es evitar que diseños sintéticos eludan los cribados tradicionales de síntesis de ADN o que estructuras mal etiquetadas contaminen las bases de datos públicas.

SynthID Bio opera ajustando sutilmente la elección de aminoácidos en las secuencias y las coordenadas atómicas en las estructuras 3D. Pruebas de laboratorio en proteínas como la proteína spike de SARS-CoV-2, VEGF-A y PD-L1 han demostrado que estas marcas de agua no comprometen la función biológica ni la afinidad de unión de las proteínas. Para el plegamiento de proteínas, la tecnología se integra ajustando una parte de la red de difusión de AlphaFold 3, permitiendo que el marcado de agua sea parte intrínseca de los pesos del modelo.