Mistral Large 4 combina 1 billón de parámetros con solo 49.000 millones activos

Mistral Large 4 combina 1 billón de parámetros con solo 49.000 millones activos

Mistral AI ha presentado Mistral Large 4, conocido internamente como Le Chonk, su modelo más grande hasta la fecha. Utiliza una arquitectura Mixture of Experts con alrededor de 1 billón de parámetros totales y 49.000 millones activos por token, combinando razonamiento, programación, tareas con agentes y procesamiento multimodal de texto e imágenes.

El modelo está disponible inicialmente mediante una versión preliminar a través de la API, mientras Mistral prepara la publicación de sus pesos para finales de octubre. La compañía quiere competir con los grandes modelos abiertos de China apostando por una activación dispersa de parámetros, capacidades especializadas para empresas y una infraestructura desarrollada en Europa.

Mistral Large 4 activa menos del 5% de sus parámetros por token

Aunque Mistral redondea el modelo a 1 billón de parámetros, su documentación técnica sitúa la cifra aproximadamente en 1,05 billones de parámetros totales, frente a 49.000 millones activos. Eso significa que durante cada token participa alrededor del 4,7% de la capacidad completa, una proporción característica de las arquitecturas MoE destinadas a contener el cálculo de inferencia.

La diferencia es importante porque tener un billón de parámetros no equivale a ejecutar todos ellos continuamente. El modelo distribuye cada token hacia determinados expertos especializados, reduciendo las operaciones necesarias frente a una arquitectura densa equivalente, aunque el conjunto completo de pesos continúa condicionando memoria, almacenamiento y complejidad de despliegue.

Mistral Large 4 incorpora además un codificador visual de 1.600 millones de parámetros y acepta conjuntamente texto e imágenes. La compañía destaca especialmente sus capacidades de localización visual, permitiendo identificar regiones u objetos concretos dentro de imágenes complejas, incluidas fotografías aéreas o satelitales.

Más de 160 idiomas refuerzan el enfoque europeo de Mistral

El modelo está preparado para trabajar con más de 160 idiomas, incluyendo todos los idiomas oficiales de la Unión Europea. No se trata únicamente de ampliar las capacidades de traducción: una base multilingüe de esta escala resulta relevante para documentación empresarial, legislación, administración y flujos de trabajo internacionales.

Mistral también está explotando esta orientación en sectores profesionales. La compañía destaca capacidades en finanzas, ciberseguridad, fabricación y tareas jurídicas, mientras diferentes evaluaciones muestran un rendimiento especialmente competitivo en pruebas relacionadas con trabajo legal y regulatorio.

Conviene no interpretar esto como que Mistral Large 4 sea simplemente “el mejor modelo en regulación”. Los resultados varían mucho según el benchmark, la configuración y las herramientas disponibles, por lo que una ventaja en una prueba jurídica concreta no implica superioridad general en razonamiento o tareas con agentes.

Mistral entrenó el modelo con 3.800 GPU NVIDIA Grace Blackwell en Europa

Mistral afirma que Mistral Large 4 fue entrenado desde cero con 3.800 GPU NVIDIA Grace Blackwell, utilizando infraestructura situada en Europa. El modelo se ha entrenado durante aproximadamente dos meses, combinando preentrenamiento con posteriores fases destinadas a mejorar razonamiento, programación y capacidades con agentes.

El dato convierte el proyecto en una demostración de capacidad europea para entrenar un modelo de frontera sobre infraestructura propia. No supone independencia tecnológica completa, ya que los aceleradores continúan procediendo de NVIDIA, pero permite a Mistral controlar directamente una parte mucho mayor de la infraestructura, el entrenamiento y el servicio del modelo.

La compañía también utiliza aprendizaje por refuerzo a gran escala para mejorar tareas prolongadas donde el modelo debe interactuar con herramientas o entornos externos. Este tipo de entrenamiento resulta especialmente relevante cuando una operación no se resuelve mediante una única respuesta, sino mediante decenas o cientos de pasos encadenados.

El contexto alcanza hasta 1 millón de tokens

Mistral especifica para Large 4 una ventana de contexto de hasta 1 millón de tokens, aunque algunas mediciones externas realizadas sobre implementaciones concretas han encontrado límites inferiores. Esa diferencia puede depender del endpoint utilizado, la configuración del servicio o restricciones aplicadas durante la fase preliminar.

Por ello conviene separar la capacidad máxima declarada del modelo de lo que permite cada implementación comercial. Una ventana enorme tampoco garantiza por sí sola que el modelo aproveche perfectamente toda esa información, ya que recuperación, precisión y razonamiento a larga distancia deben evaluarse independientemente.

La salida máxima puede alcanzar 262.144 tokens, una cifra suficiente para trabajos extremadamente extensos. En la práctica, generar respuestas de ese tamaño tendrá implicaciones importantes sobre latencia, consumo de tokens y coste, por lo que el límite técnico no equivale necesariamente a un uso habitual.

Los benchmarks lo colocan entre los modelos abiertos más competitivos

Mistral Large 4 alcanza aproximadamente 62% en DeepSWE v1.1, una prueba orientada a ingeniería de software de larga duración. El resultado es competitivo, pero existen configuraciones de GLM-5.3 y Kimi K3 cercanas al 69%, además de modelos cerrados que superan todavía esas cifras.

Esto demuestra por qué resulta peligroso comparar modelos utilizando únicamente un resultado seleccionado por cada fabricante. El presupuesto de tokens, el agente empleado, las herramientas disponibles o la configuración de razonamiento pueden modificar considerablemente el resultado final.

Artificial Analysis sitúa además a Mistral Large 4 con 38 puntos en su Intelligence Index, describiéndolo como uno de los modelos más capaces desarrollados fuera de Estados Unidos y China. También obtiene 50 puntos en su Cyber Index, aunque continúa por detrás de algunas alternativas en determinadas pruebas.

Su fortaleza parece estar, por tanto, en ofrecer un conjunto bastante equilibrado de capacidades, más que en dominar todos los rankings. El soporte multilingüe, la multimodalidad y el enfoque hacia cargas empresariales pueden tener tanta importancia comercial como liderar una prueba concreta.

Mistral Large 4 cuesta 1,36 dólares por millón de tokens de entrada

El precio estándar de la API se sitúa en 1,36 dólares por millón de tokens de entrada (1,21€) y 4,18 dólares por millón de tokens de salida (3,71€). Las entradas almacenadas en caché bajan hasta 0,14 dólares por millón (0,12€).

Artificial Analysis calcula además un coste aproximado de 1,13 dólares por tarea de su Intelligence Index (1,00€). No convierte a Mistral Large 4 en la opción más barata del mercado, por lo que su competitividad dependerá de cuánto rendimiento consiga extraer de los 49.000 millones de parámetros activos por token.

La publicación posterior de los pesos puede cambiar considerablemente esa ecuación. Las organizaciones que dispongan de infraestructura suficiente podrían alojar Mistral Large 4 por su cuenta, reduciendo dependencia de la API y manteniendo datos sensibles dentro de sistemas controlados internamente.

Por ahora, Mistral Large 4 continúa siendo una versión preliminar, por lo que sus resultados pueden variar antes del lanzamiento definitivo de los pesos. Si mantiene su rendimiento una vez desplegado independientemente, Mistral contará con uno de los modelos de pesos abiertos occidentales más ambiciosos frente al creciente peso de DeepSeek, Z.ai, Qwen y Kimi.

Vía: Wccftech

Sobre el autor