Le Chonk : le gros chaton de Mistral défie la Chine, six points derrière

Le Chonk : le gros chaton de Mistral défie la Chine, six points derrière

Mistral sort un modèle d'un trillion de paramètres, baptisé d'après un canular qui a trompé Internet en juin. L'argument est solide : un modèle ouvert ne s'éteint pas d'un clic depuis une salle de réunion à San Francisco. Sauf que les poids n'arrivent qu'à la fin du mois, la licence est inconnue, et les benchmarks indépendants le placent six points derrière les Chinois qu'il prétend défier.

Le 6 octobre 2026, Mistral AI a mis en ligne une preview publique de Mistral Large 4, surnommé « Le Chonk ». Pour les allergiques au mème : « chonk » désigne un chat très, très gros. Un dodu. Un patapouf. C'est l'image que la boîte parisienne veut coller à son modèle : une bête.

Mais l'histoire du nom est plus tordue que ça. Et elle dit presque tout du moment.

Un chaton qui n'existait pas

En juin 2026, Internet s'est emballé pour « Le Chaton Fat », un faux modèle géant de Mistral. Tableaux de benchmarks inventés, chiffres de paramètres délirants, le tout viral sur X et Reddit. Ça a trompé des chercheurs. Des journalistes. Pendant quelques heures, un modèle qui n'a jamais existé a squatté la tête de l'actualité IA. Business Insider a consacré un article à expliquer le canular, c'est dire.

Arthur Mensch, le patron de Mistral, a répondu à l'époque, quatre mots : « actually le gros chaton ». Six mois plus tard, la blague est devenue le nom officiel du vrai modèle frontière. Guillaume Lample, le chief scientist (ex-Meta), a confirmé que Mistral avait trouvé le mème amusant et que Large 4 pouvait se lire comme une première version de l'idée, avec des modèles plus gros à venir.

C'est rare, une boîte d'IA qui assume qu'un canular a baptisé son produit. C'est aussi le signe d'une entreprise qui n'a pas les mêmes réflexes que les autres. Ni les mêmes moyens. Mais ça, on y revient.

Un trillion de paramètres, quarante-neuf milliards qui bossent

Les chiffres donnent le tournis. Mistral Large 4 est un modèle « mixture of experts » : un trillion de paramètres au total, mais seulement 49 milliards qui s'activent par requête. C'est le principe du MoE. On garde un énorme cerveau, on n'allume que la partie utile. Résultat : la puissance d'un mastodonte, la facture d'un poids moyen. L'encodeur vision pèse 1,6 milliard de paramètres à lui seul, et le modèle couvre plus de 160 langues, toutes les langues officielles de l'Union européenne comprises.

L'entraînement s'est fait sur environ 4 000 GPU NVIDIA Grace Blackwell, pendant deux mois, dans les datacenters européens de Mistral. Une prouesse logistique qui coûte cher. Elle explique en partie la levée dont on parle plus bas.

Encore faut-il s'entendre sur les chiffres. Mistral annonce « un trillion de paramètres, 49 milliards actifs ». Sa fiche technique affiche 1,05 trillion et 52 milliards, valeur modifiée le jour du lancement sans note explicative. Le contexte ? Un million de tokens, clame le blog. Artificial Analysis retient plutôt 524 288. Et les prix : 1,36 dollar le million de tokens en entrée sur la page d'annonce, 0,68 dollar sur la fiche docs. Moitié prix, sans explication.

Ce n'est pas du pinaillage. Quand une boîte lance un modèle frontière, l'écart entre ce qu'elle dit et ce qu'elle écrit trahit la précipitation. Le Chonk est sorti en preview. Il transpire la preview.

Une boîte qui vient de loin

Mistral n'a pas toujours joué dans cette cour. La boîte s'est fait un nom avec des petits modèles efficaces et ouverts, avant de monter en gamme. Le prédécesseur, Mistral Large 3, était sorti le 2 décembre 2025 sous licence Apache 2.0, avec 675 milliards de paramètres totaux et 41 milliards actifs. C'est cette fiche technique que plusieurs médias ont reprise par erreur pour décrire Large 4, créant une fausse polémique sur un prétendu « écart de paramètres ». Un cas d'école de reprise en cascade : une erreur recopiée d'article en article.

Le vrai changement de dimension, c'est l'argent. Le 8 septembre 2026, Mistral a bouclé une série D de 3 milliards d'euros, la plus grosse levée d'actions jamais réalisée par une entreprise technologique européenne, à une valorisation de plus de 21 milliards d'euros. Samsung Electronics mène le tour. Arthur Mensch, ex-DeepMind, vise plus d'un milliard de dollars de revenu récurrent annuel. Airbus, ASML et HSBC sont clients. Bref, le Chonk n'est pas un coup de poker de startup. C'est une boîte qui a les reins, et qui le fait savoir.

L'argument qui tue : un modèle fermé peut te laisser tomber

Le vrai pitch de Mistral ne tient pas dans les paramètres. Il tient dans une phrase : un modèle fermé peut refuser de t'aider au pire moment.

Démonstration. En cybersécurité, Mistral a testé son modèle sur un exercice précis : reproduire puis corriger une vulnérabilité réelle. Large 4 le fait, à 82 % de réussite sur CyberGym-E2E et 93 % sur Cybench. Les modèles fermés ? D'après Mistral, Claude Opus 5.5 et GPT-6 Astra refusent carrément la tâche, par politique de sécurité, avec des scores proches de zéro.

Traduisons. Tu es en plein incident, tu veux comprendre une faille, ton modèle te répond « je ne peux pas t'aider avec ça ». Un modèle que tu héberges toi-même, lui, ne s'éteint pas sur ordre d'un fournisseur. C'est l'argument souveraineté, et il est bon. Il tombe qui plus est dans un contexte de restrictions américaines sur les modèles d'OpenAI et d'Anthropic. Le timing n'est pas un hasard.

Mistral pousse le raisonnement jusqu'au bout : Large 4 a été red-teamé avec des partenaires cyber et des autorités étatiques, avec une modération réduite et des capacités cyber étendues, tout en revendiquant un taux de refus sur les prompts malveillants supérieur à tous les modèles ouverts testés. Traduction : il obéit quand il faut défendre, il refuse quand on lui demande de nuire. C'est la ligne de crête. Et personne ne peut encore vérifier qu'elle tient dans la durée.

Le hic : les poids, la licence, et six points de retard

Sauf que. Il y a toujours un « sauf que ».

D'abord, les poids. Mistral promet de les publier « fin octobre », le 27 selon la presse. D'ici là, la preview tourne sur l'infrastructure de Mistral. Le modèle est trop gros pour un PC portable, trop gros même pour pas mal d'universités. « Open weights », dans ces conditions, c'est une promesse. Pas encore un fait.

Ensuite, la licence. La fiche dit juste « Open ». Large 3 était Apache 2.0. Large 4 ? Mystère. Tant que les termes ne sont pas publiés, personne ne peut supposer un usage commercial gratuit. « Ouvert », pour l'instant, ça veut dire « on verra ».

Enfin, les benchmarks. Et là, il faut être franc. Le tableau suivant compare le Chonk à ses rivaux, sur l'Intelligence Index v4.3.2 d'Artificial Analysis :

Modèle

Labo

Paramètres

Index AA

MiMo-V2.6-Pro

Xiaomi (CN)

non publié

46

GLM-5.3

Z.ai (CN)

non publié

45

Kimi K3

Moonshot (CN)

2,8 T / ~104 B actifs

44

Mistral Large 4

Mistral (FR)

1,05 T / 49-52 B actifs

38

DeepSeek V4 Pro

DeepSeek (CN)

1,6 T

36

Nemotron 3 Ultra

NVIDIA (US)

non précisé

23

Mistral est bien le meilleur modèle à poids ouverts hors de Chine. C'est exactement la moitié du slogan. L'autre moitié, « rivaliser avec les meilleurs au monde », c'est six à huit points d'écart. Pas rien.

Le prix n'arrange rien. 4,18 dollars le million de tokens en sortie, contre 1,98 pour DeepSeek V4 Pro. Un commentateur sur le fil Hacker News a eu la formule : la remise de 50 % affichée sur la fiche docs, c'est surtout pour rester dans le match face à DeepSeek. Le fil du lancement a pris 1 580 points et 960 commentaires en 24 heures. L'enthousiasme est réel. Le scepticisme aussi.

Les évaluations humaines racontent la même histoire, en plus nuancé. Sur une évaluation à l'aveugle menée par Surge AI, le Chonk récolte 3,74 sur 5, deuxième de cinq modèles, derrière Claude Opus 5 à 4,22. Sur le Vals Index, il plafonne à 48,05 %, trente-deuxième sur 44 modèles, mais neuvième des modèles ouverts, avec un point fort en droit : premier des modèles ouverts sur le benchmark Harvey's Legal Agent. Autrement dit, il n'est pas nul. Il est simplement loin d'être le champion que le communiqué laisse entendre.

Et puis il y a le bavardage. Sur l'évaluation d'Artificial Analysis, le Chonk a produit 200 millions de tokens pour boucler l'index, contre une médiane de 81 millions. Le coût par tâche grimpe à 1,13 dollar malgré un tarif affiché modeste. Un modèle verbeux, ça se paie à la sortie.

Enfin, les soupçons. Sur Hacker News, des commentateurs accusent Mistral de cherry-picking sur un graphique comparatif. D'autres évoquent une distillation depuis des modèles ouverts chinois. Mistral dément, par la voix de son VP science Pierre Stock : « We are fully separate from other models, and we don't take inspiration from them. » Le soupçon n'est pas prouvé. Il n'est pas dissipé non plus. Dans une course où tout le monde regarde tout le monde, ce genre de murmure fait partie du bruit de fond.

Verdict : le bon combat, le mauvais adversaire

Il faut juger le Chonk pour ce qu'il est, pas pour ce que son marketing promet. C'est le meilleur modèle ouvert jamais sorti en Europe. C'est un argument de cybersécurité et de souveraineté que ni OpenAI ni Anthropic ne peuvent copier sans renoncer à leur modèle d'affaires. C'est une boîte française qui a levé 3 milliards d'euros, qui affiche plus de 125 clients, et qui vise le milliard de dollars de revenu récurrent. Les reins sont là.

Mais le chantier est loin d'être fini. Les poids ne sont pas là. La licence est inconnue. Et sur les benchmarks, le modèle accuse six points de retard sur une Chine que Mistral présente pourtant comme la menace à contrer. Le jour où les poids sortiront, si la licence suit, l'histoire changera peut-être. En attendant, le Chonk est un très gros chaton. Pas encore un tigre.

Sources

K

Auteur

Krugz

Développeur fullstack

Développeur fullstack qui tente, tant bien que mal, de suivre l'actualité de l'IA au milieu d'une marée d'informations imbuvables et des milliers d'outils et de modèles qui sortent chaque jour.