Mistral AI presenta Large 4, un modelo de un billón de parámetros centrado en programación y ciberseguridad

Imagen para ayudar a comprender el artículo
Un modelo masivo con activación selectiva
La empresa francesa Mistral AI presentó el 6 de octubre de 2026 Mistral Large 4, su nuevo modelo de inteligencia artificial, conocido internamente como “le Chonk”. El sistema utiliza una arquitectura de mezcla de expertos: cuenta con un billón de parámetros en total, pero activa 49.000 millones durante cada operación.
La compañía identifica la programación mediante agentes, la automatización del trabajo del conocimiento, la ciberseguridad y el razonamiento de localización visual como sus principales áreas de aplicación y evaluación.
Acceso inicial mediante una API de prueba
El modelo, identificado como mistral-large-4-0, está disponible inicialmente mediante una API en fase de previsualización en Mistral Studio. El precio anunciado es de 1,36 dólares por cada millón de tokens de entrada y 4,18 dólares por cada millón de tokens de salida.
Mistral AI no distribuyó los pesos del modelo en el momento del lanzamiento. La publicación está prevista para el 27 de octubre, después de unas tres semanas de pruebas de seguridad con socios considerados fiables y organismos gubernamentales. Hasta entonces, el acceso queda limitado a la previsualización pública y a puntos de conexión con medidas de protección.
Según la empresa, esta estrategia busca facilitar usos defensivos del modelo sin favorecer ataques maliciosos. Mistral Large 4 fue entrenado durante aproximadamente dos meses con 4.000 procesadores Nvidia Grace Blackwell, admite entradas multimodales y más de 160 idiomas, genera respuestas únicamente en texto y estará sujeto a una licencia personalizada de Mistral.
Resultados dispares en programación y automatización
En las pruebas divulgadas por la compañía, Mistral Large 4 obtuvo un 61,7% en DeepSWE v1.1, un 28,3% en Terminal Bench 4.0 y un 59,4% en SWE-Atlas-QnA. Su puntuación agregada en el Coding Agent Index fue del 49,8%, por encima de DeepSeek V4 Pro y Qwen3.8 Max según los datos de Mistral AI.
Sin embargo, una evaluación humana a ciegas de Surge AI le asignó 3,74 puntos sobre cinco, frente a los 4,22 de Claude Opus 5. Otra clasificación de DeepSWE situó al modelo francés en el 62%, ligeramente por encima de GLM-5.3, DeepSeek V4 Pro 0813 y Qwen 3.8 Max, pero por debajo del cerca del 74% alcanzado por GPT-6 Astra, Gemini 3.8 Flash y Claude Opus 5 con sus mejores configuraciones publicadas.
En otras mediciones difundidas por Mistral, el modelo logró un 59,9% en AutomationBench y 1.393 puntos Elo en AA-Briefcase, una prueba orientada al trabajo del conocimiento. En Harvey Legal Agent registró un 15%, mientras que en Finch Finance empató con DeepSeek V4 Pro 0813 en un 67%.
Ciberseguridad, ciencia y análisis visual
Mistral AI afirma que Large 4 se ubica entre los cinco primeros modelos del AA Cyber Index. También le atribuye un 93% en Cybench, un 93,3% de resistencia a ataques en B3 Security Benchmark y 1,691 puntos sobre dos en la evaluación de respuestas responsables de KORA.
En razonamiento visual, el modelo obtuvo un 42% en Dense 200, frente al 41% comunicado para GPT-6 Astra, y un 73% en DIOR-RSVG. La empresa también sostiene que se encuentra entre los mejores modelos de pesos abiertos en SciCode-Verified.
El director ejecutivo de Mistral AI, Arthur Mensch, declaró que el nuevo sistema supera a modelos chinos en determinados aspectos, incluida la ciberseguridad. No precisó, sin embargo, cuáles eran los modelos comparados ni la metodología utilizada.
Las evaluaciones independientes moderan las expectativas
Los resultados externos ofrecen una imagen menos contundente. En el Vals Index de Vals AI, Mistral Large 4 alcanzó un 48,05% ± 1,11 y ocupó el puesto 32 entre 44 modelos. Logró mejores posiciones en Harvey Legal Agent, donde quedó sexto entre 75 sistemas con un 15,83% ± 2,96. En Finance Agent v2 fue vigesimosegundo; en Tax Agent Bench, vigesimoquinto; en EMB, cuadragésimo tercero; y en Vibe Code Bench v1.1, vigesimoquinto.
Artificial Analysis le concedió 38,4 puntos y el octavo lugar entre los modelos de pesos abiertos. Quedó por debajo de Xiaomi MiMo-V2.6-Pro, Z.ai GLM-5.3 y Moonshot AI Kimi K3, pero por encima de DeepSeek V4 Pro, GLM-5.2 y el modelo surcoreano Motif 3. Los sistemas cerrados Claude Opus 5.5, GPT-6 Astra y Gemini 4 Argon registraron puntuaciones superiores. Artificial Analysis calculó además un costo de 1,13 dólares, equivalente a un euro, por tarea.
Un lanzamiento todavía en desarrollo
Mistral AI señaló que el entrenamiento por refuerzo de esta versión continúa y que el modelo todavía no muestra señales de saturación, por lo que espera nuevas mejoras. Pierre Stock, vicepresidente de ciencia de la empresa, aseguró que el entrenamiento utilizó bastante menos capacidad de cómputo que los competidores cerrados y entre dos y tres veces menos que los rivales chinos.
La compañía aún no ha publicado todos los resultados ni las puntuaciones exactas de algunos competidores. Esa falta de datos, sumada al acceso restringido y a la ausencia temporal de los pesos, limita por ahora la verificación completa de sus afirmaciones.
El lanzamiento llega después de que Mistral AI captara 3.000 millones de euros en una ronda de inversión celebrada en septiembre, que valoró la empresa en 21.000 millones de euros.
Comentarios
Publicar un comentario