
MiMo-V2.6
Le meilleur modèle ouvert, intenable chez soi.
points forts
- + Premier de l'index Artificial Analysis (46 points sur 114 modèles)
- + Poids réellement ouverts sous licence MIT, vérifiés sur Hugging Face
- + Natif omnimodal : texte, image, audio et vidéo en entrée
- + Transparence inédite : entraînement diffusé en direct, code RL publié
- + Coût par tâche imbattable (0,13 $ sur l'index AA)
points faibles
- − Poids d'environ 566 Go : auto-hébergement hors de portée du grand public
- − Plus lent que la moyenne (54,2 tok/s, 41e sur 114)
- − Verbeux (18e sur 114), ce qui gonfle la facture de sortie
- − Xiaomi cité dans le rapport Anthropic sur la distillation illicite
review complète
MiMo-V2.6 — Le meilleur modèle ouvert du monde tient dans 566 Go que personne n'a
État des lieux
Le 22 septembre 2026, Xiaomi publie la famille MiMo-V2.6 et l'annonce en une ligne : MiMo-V2.6-Pro prend la tête de l'index d'intelligence d'Artificial Analysis avec 46 points, devant Kimi K3 et Qwen3.8 Max, ce qui en fait le meilleur modèle à poids ouverts du marché. Le tout pour 0,13 dollar de coût par tâche d'évaluation, contre des tarifs d'API plusieurs fois supérieurs chez les modèles frontières fermés. Les poids sont réellement sous licence MIT, téléchargeables sur Hugging Face, vérifiés le jour même. Xiaomi accompagne la sortie d'un manifeste de transparence inhabituel : rapport technique complet, environnements d'entraînement, code d'apprentissage par renforcement, et diffusion en direct d'une session d'entraînement qui a coûté 2,62 millions de dollars pour Pro et 850 000 dollars pour Flash en moins de six jours.
La carte des menus
La grille, inchangée par rapport à la série V2.5, se lit en dollars par million de tokens. MiMo-V2.6-Flash : 0,14 dollar en entrée, 0,28 dollar en sortie, 0,0028 dollar quand le cache est touché. MiMo-V2.6-Pro : 0,435 dollar en entrée, 0,87 dollar en sortie, 0,0036 dollar en cache. MiMo-V2.6-Pro-UltraSpeed, la variante jusqu'à vingt fois plus rapide en sortie : 4,35 dollars en entrée, 8,70 dollars en sortie. Côté accès, Flash est offert une semaine dans OpenCode, Pro est accessible via le plan Token de Xiaomi à partir de 6 dollars par mois et le plan OpenCode Go à 10 dollars par mois, en plus d'OpenRouter et de l'API compatible OpenAI et Anthropic. Reste la voie gratuite et durable : les poids, téléchargeables sous licence MIT, à condition d'avoir le matériel. Pro, c'est environ 566 Go de fichiers de poids.
Ce que la bête sait vraiment faire
Deux modèles sont livrés, plus une variante de vitesse. Pro est le haut de gamme, Flash le rapport qualité-prix, UltraSpeed la version accélérée facturée environ vingt fois plus cher. Tous trois sont nativement omnimodaux : ils avalent texte, image, audio et vidéo et rendent du texte, ce qui les distingue d'une bonne partie des modèles à poids ouverts chinois. L'architecture de Pro est simple, de l'aveu même de Sebastian Raschka : attention GQA classique avec fenêtre glissante, 1 020 milliards de paramètres au total pour 42 milliards actifs par requête, 384 experts routés dont 8 actifs par token. La vraie nouveauté, c'est la recette : un entraînement par renforcement à grande échelle sur des tâches vérifiables, 30 étapes, environ 750 000 trajectoires, des gains de 25 pour cent pour Flash et 12 pour cent pour Pro en relatif sur les tâches d'entraînement. Les usages revendiqués vont au-delà du code : scènes 3D jouables, modélisation Blender, simulation robotique, interfaces web et montage vidéo. Autant de démonstrations éditeur, non reproduites par des tiers à ce jour.
Les couleuvres à avaler
La première couleuvre est matérielle. Un modèle de 1 020 milliards de paramètres, avec un dépôt d'environ 566 Go, ne s'auto-héberge pas sur une machine de développeur. Le fil Hacker News en donne l'illustration la plus drôle : un commentateur avec 128 Go de mémoire unifiée explique que passer à 256 Go représente une mensualité de crédit immobilier. L'autonomie promise par la licence MIT existe sur le papier, pas dans un bureau français normal. Deuxième limite, la vitesse : Artificial Analysis classe Pro 41e sur 114 avec 54,2 tokens par seconde, sous la médiane de 67. Troisième, la verbosité : 18e sur 114, « quelque peu verbeux », et un modèle bavard paie la sortie, qui est le poste le plus cher de la grille. Quatrième, les chiffres qui ne concordent pas : le billet annonce un score DeepSWE de 72,57 quand la fiche Hugging Face affiche 71,9, et la métadonnée safetensors du dépôt Flash totalise 159 milliards de paramètres contre 309 milliards annoncés — un artefact probable de quantification, mais qu'il faut signaler plutôt que lisser.
Reste le sujet qui donne à cette fiche son intérêt éditorial. Dans un rapport des 10 et 11 septembre 2026, Anthropic a déclaré avoir interrompu des attaques de distillation illicite à l'échelle industrielle menées par sept laboratoires chinois, et cite nommément Xiaomi : plus de 400 000 échanges entre leurs modèles et des utilisateurs, injectés dans Claude, puis utilisés comme données d'entraînement. Deux précisions s'imposent. L'accusation précède le lancement d'une dizaine de jours : ce n'est pas une réaction à V2.6. Et la distillation est une méthode légitime en soi ; ce qui est reproché, c'est l'extraction à l'échelle industrielle sans autorisation, via des comptes factices et des clés d'API détournées. La nuance « plagiat » de certains titres appartient aux rédacteurs, pas aux sources.
Verdict
MiMo-V2.6 est une vraie performance d'ingénierie : des poids ouverts, une licence MIT vérifiable, le sommet de l'index ouvert, et une transparence d'entraînement qu'aucun lab occidental n'imite. Mais c'est une performance qu'on admire plus qu'on ne l'utilise : le modèle est trop gros pour l'auto-hébergement, plus lent que la moyenne, bavard, et le produit que Xiaomi vend réellement, c'est son API à 0,435 dollar le million de tokens — le schéma « code ouvert, business fermé » déjà rencontré avec ZCode. L'ombre de la distillation pèse sur la légitimité sans invalider le résultat technique. Pour qui accepte de payer l'API et de comparer en coût par tâche, c'est l'un des meilleurs rapports qualité-prix du moment ; pour qui rêvait d'un modèle libre dans son garage, c'est un mirage de 566 Go. ★★★★☆
cas d'usage
- 1. API pay-as-you-go pour agents de codage longue durée
- 2. Tâches omnimodales (image, audio, vidéo en entrée)
- 3. Génération de scènes 3D et modélisation Blender (démo éditeur)
- 4. Simulation robotique en boucle fermée sur flux vidéo
- 5. Auto-hébergement pour laboratoires disposant du matériel adéquat
astuces
- → Comparez en coût par tâche, pas en prix au token : la verbosité gonfle la sortie
- → Prenez Flash pour le rapport qualité-prix, Pro pour la qualité maximale
- → Vérifiez la fiche Hugging Face pour les tailles réelles de poids avant de télécharger




