Publicada

Se acabaron los memes sobre el ‘gato gordo’, la mascota de Mistral, o quizás no, pero el tono de la broma será diferente. La empresa francesa desarrolladora de IA ha dado un golpe sobre la mesa con su nuevo modelo Mistral Large 4, bautizado como Le Chonk, juego de palabras que hace referencia a ese animal pesado.

El nuevo modelo de un billón de parámetros se ha presentado como “el mejor modelo de pesos abiertos de EEUU o Europa en benchmarks agregados”. El gráfico que acompaña el anuncio de la marca muestra el salto conseguido por el gato naranja, justo por detrás de DeepSeek V4.1 Flash y adelantando al resto de modelos europeos.

Sigue por detrás de los principales modelos estadounidenses, con los que Mistral no pretende competir en este momento. También detrás de modelos chinos como el mencionado DeepSeek, Kimi K3 y el MiMo V2 de Xiaomi.

Los resultados mostrados por Mistral reflejan que ML4 obtuvo un 62 % en DeepSWE v1.1, una prueba de rendimiento de ingeniería de software a largo plazo. A la hora de publicar este artículo, ML4 ya aparece en las evaluaciones públicas de Artificial Analysis, pero no en la clasificación de DeepSWE

Aún faltan que otros usuarios prueben el modelo final, y en esta carrera frenética no es prudente cantar victoria a la velocidad que se sacan nuevos modelos cada semana, pero el salto supone un paso importante para la independencia de Europa frente a China y EEUU.

Europa sigue en la carrera

Para los que viven ajenos a esta nueva subcultura de los modelos de Inteligencia Artificial. En junio, un modelo ficticio de Mistral llamado "Le Chaton Fat" (El gato gordo en francés) se hizo viral en X y Reddit, con gráficos de referencia falsos y especificaciones cada vez más absurdas que anunciaban un supuesto modelo enorme que superaría a sus competidores estadounidenses y chinos.

Esta broma saltó justo cuando todo el mundo se preguntaba por los modelos europeos que pudieran liberar a la Unión Europea de la dependencia de China y Estados Unidos. Cuando el gobierno de Estados Unidos cortó por completo el acceso a los principales modelos de IA de Anthropic y OpenAI durante unas semanas por motivos de seguridad, cortándole el grifo a instituciones y empresas del viejo continente.

La broma hablaba de 1.000 maullidos por segundos, como 1.000 tokens por segundo en referencia a la capacidad de la IA. El director ejecutivo de Mistral, Arthur Mensch, finalmente se unió a la broma, escribiendo en X: "En realidad es le gros chaton".

Con este nuevo anuncio, la empresa está aprovechando esa burla. La duda está ahora en si este impulso se mantendrá cuando los usuarios tengan acceso al modelo y cómo Europa hará uso de esta ventana que se está abriendo.

Le Chonk

El modelo, abreviado como ML4, tiene 49.000 millones de parámetros activos y fue entrenado desde cero durante aproximadamente dos meses en 4.000 GPU Nvidia Grace Blackwell en los centros de datos europeos de Mistral.

Aunque contiene un billón de parámetros en total, solo 49.000 millones están activos durante la inferencia. Este diseño sigue una tendencia más amplia entre los modelos abiertos de gran tamaño como DeepSeek o los de Xiaomi, que consiste en aumentar la capacidad total del modelo activando solo una fracción de la red a la vez.

El modelo se habría entrenado en más de 160 idiomas, incluidos todos los idiomas oficiales de la Unión Europea. Y la compañía planea ponerlo a disposición a través de la API de Mistral y publicar los pesos del modelo el 27 de octubre, después de un período de prueba de aproximadamente tres semanas con desarrolladores, líderes en ciberseguridad y autoridades gubernamentales.

Este lanzamiento gradual es fundamental para la estrategia de Mistral. ML4 no es un modelo genérico más: la compañía lo presenta como una base que las empresas y los gobiernos podrán implementar y personalizar, incluso en infraestructuras soberanas y con opciones de cero retención de datos. Mistral afirma que el período de vista previa también les dará tiempo para continuar con el aprendizaje por refuerzo y ajustar el punto de control final antes de que los pesos se implementen.

Mistral afirma haber entrenado su modelo desde cero. Con esto se desmarcan de una de las polémicas recurrentes entre EEUU y China. El gobierno de Trump y las empresas de ese país han acusado a los laboratorios chinos de abusar de la destilación de sus modelos.

La destilación del conocimiento entre modelos de lenguaje natural es una técnica de machine learning en la que el objetivo es transferir los aprendizajes de un gran modelo ya entrenado (modelo docente) a un modelo nuevo más pequeño (modelo estudiante).

Esta técnica nació en 2006 y es recurrente en investigación, pero según se ha incrementado la competencia entre empresas y potencias internacionales se ha planteado su prohibición por considerarlo un robo de propiedad intelectual si se usa con modelos cerrados de otras empresas. Por ejemplo, viola los términos de uso establecidos por Anthropic para sus usuarios.

A la cabeza de Europa

Con menos capital y menos recursos informáticos que OpenAI y Anthropic, Mistral generalmente se ha quedado rezagada en cuanto a rendimiento de modelos, ingresos y frecuencia de lanzamientos. Su última gran salida se remontaba a diciembre, mientras que empresas como OpenAI o Anthropic hacen varios anuncios cada mes.

La compañía se fundó en 2023 por Arthur Mensch, antiguo investigador de DeepMind, y Guillaume Lample y Timothée Lacroix, antiguos investigadores de Meta. Su primer modelo Mistral 7B llegó en septiembre de 2023, seguido ese mismo año por el escaso Mixtral 8x7B.

Rápidamente se convirtió en uno de los principales rivales europeos en este mercado consolidando su estrategia a favor de liberar los pesos pesados.

Mistral afirma que actualmente presta servicios a más de 125 empresas globales, entre ellas Airbus, ASML y HSBC. En el mes de septiembre, anunció una ronda de financiación Serie D de 3.000 millones de euros con una valoración posterior a la inversión superior a los 21.000 millones de euros, una ronda que la compañía describió como la mayor captación de capital jamás realizada por una empresa tecnológica europea.

La empresa francesa compensa la publicación en abierto de los modelos con una amplia plataforma que incluye productos para desarrolladores y empresas, servicios de personalización, infraestructura de inferencia, es decir, no solo acceso a un modelo, también control sobre la infraestructura, la implementación y la ingeniería relacionadas con él.