
Naive-N0.5-Flash
309 milliards de paramètres, zéro attention pleine.
points forts
- + Poids et code d'inférence sous licence MIT, téléchargeables sans restriction
- + Architecture sans attention pleine : 39 couches à fenêtre glissante, 9 couches éparses
- + Tarif d'entrée le plus bas du segment (0,10 $/M en entrée, cache à 0,01 $)
- + Contexte natif d'un million de tokens
- + Runtime NaiveRT documenté avec une piste d'audit (151 essais, 63 adoptés)
points faibles
- − Aucune évaluation indépendante : tous les benchmarks sont auto-déclarés
- − API annoncée mais pas ouverte, runtime NaiveRT repoussé au 12 octobre
- − Graphique de lancement qui mélange les harnais (6,4 points d'écart, en réalité 2,0)
- − Auto-hébergement réservé aux loueurs de H200 (315 Go de FP8)
review complète
Naive-N0.5-Flash — Le modèle ouvert dont le graphique triche un peu, et qui coûte 8 cents la tâche
État des lieux
NaiveAI, laboratoire de Pékin fondé en février 2026 par Dai Jifeng — professeur associé au département d'ingénierie électronique de Tsinghua — a ouvert le 27 septembre 2026 les poids de son premier modèle, Naive-N0.5-Flash : 309 milliards de paramètres en architecture MoE, 15,5 milliards actifs par token, un contexte natif d'un million de tokens, et une licence MIT sur les poids comme sur le code d'inférence. L'argument de vente est double : un pari architectural sans aucune couche d'attention pleine, et un slogan plus insolent — « Building Frontier AI with AI », l'IA qui construit l'IA.
Mais le fait le plus important du dossier est celui que le communiqué met le moins en avant : ce n'est pas un modèle neuf, c'est un dérivé. Le README le dit noir sur blanc, Naive-N0.5-Flash « builds on the open-weight MiMo-V2.5 base model », la base ouverte de Xiaomi. NaiveAI n'a pas pré-entraîné 309 milliards de paramètres depuis zéro : il a repris une base existante, remplacé ses couches d'attention globale par de l'attention éparse DeepSeek, et poursuivi l'entraînement sur 3,25 billions de tokens. C'est un très gros post-entraînement, pas une fondation.
La carte des menus
Le modèle est gratuit à télécharger : 617,8 Go en précision complète, 315,1 Go en FP8, et un modèle de draft de 1,3 Go, tous sous MIT. C'est le palier gratuit réel, durable et définitif : l'auto-hébergement.
À côté, l'éditeur annonce une API payante à l'usage : 0,10 dollar par million de tokens d'entrée, 0,40 dollar en sortie, 0,01 dollar en lecture de cache. C'est le tarif d'entrée le plus bas du segment des poids ouverts — DeepSeek V4.1 Flash affiche 0,15 en entrée hors pointe, GLM-5.3-Flash 0,15 aussi. Sur une tâche d'agent type, le calcul publié par Creative AI News donne 0,081 dollar pour Naive, contre 0,089 pour DeepSeek hors pointe et 0,156 pour GLM.
Sauf que cette API n'est pas encore ouverte : api.naive.ai répond 401 sans clé, aucune inscription en self-service n'est confirmée, et le modèle n'est pas listé sur OpenRouter. La gratuité des poids est réelle ; le service, lui, est encore une promesse.
Ce que la bête sait vraiment faire
L'architecture est le vrai morceau. Sur 48 couches, aucune n'utilise d'attention pleine : 39 couches à fenêtre glissante de 128 tokens, dont le coût de décodage ne grandit pas avec le contexte, et 9 couches d'attention éparse DeepSeek qui ne calculent l'attention que sur les 2 048 tokens les mieux notés par un indexeur léger. NaiveAI revendique une modification : remplacer l'attention MLA par du group-query attention à quatre groupes, ce qui réduit de 44 % le temps de sélection de l'index. Nuance à garder en tête : le cache KV complet est conservé, donc le gain porte sur le calcul, pas sur l'empreinte mémoire.
Le laboratoire a aussi construit son propre moteur d'inférence, NaiveRT, avec un chiffre vedette : 2 122 tokens/s en pic single-stream sur 8 GPU. Le détail le plus intéressant est la méthode — 151 essais d'optimisation documentés en six jours, dont 63 adoptés et 71 échoués, ce qui est la seule partie du lancement où la revendication « construit par l'IA » est adossée à une piste d'audit.
Les couleuvres à avaler
La première couleuvre est le graphique de lancement. Il annonce un écart de 6,4 points avec DeepSeek V4.1 Flash sur DeepSWE v1.1 — mais les deux scores ne viennent pas du même harnais. En comparaison appariée, dans le même échafaudage Claude Code, l'écart tombe à 2,0 points. Sur Terminal-Bench 2.1, pareil : 86,7 contre 88,0, et non 90,6. Le harnais déplace un modèle plus que l'écart entre ces deux-là.
La deuxième : tous les benchmarks sont auto-déclarés, sans aucune reproduction indépendante. Le modèle n'est premier que sur un seul benchmark — NL2Repo-Bench, sur son propre graphique — et dernier ex aequo sur ProgramBench (17,5 contre 37,0 pour Opus 5).
La troisième : le matériel. « Poids ouverts sous MIT » ne veut pas dire « utilisable chez soi ». Les 315 Go de FP8 exigent des GPU compatibles FP8 : 4x H200 au minimum, 4x H100 ne suffisent pas, et l'auto-hébergement se réserve à ceux qui louent des H200 à l'heure.
Et le reste : NaiveRT n'est pas public avant le 12 octobre, donc les 2 122 tokens/s sont invérifiables ; zéro fil Hacker News, zéro discussion Hugging Face, zéro téléchargement enregistré au premier jour ; un financement de 400 millions de dollars rapporté par The Information mais jamais confirmé ; et un litige de propriété intellectuelle avec MiroMind, où Dai était conseiller technique jusqu'en janvier, toujours non résolu.
Verdict
★★★☆☆
Pour un laboratoire de cinq mois, la copie est impressionnante : des poids réels, une licence permissive, une architecture qui ose se passer d'attention pleine, et le tarif d'entrée le plus bas du segment. Mais l'API est fermée, le runtime absent, les benchmarks non reproduits et le matériel hors de portée de l'amateur. Le verdict devra être revu après le 12 octobre, à la sortie de NaiveRT — et surtout quand quelqu'un d'autre que l'éditeur aura fait tourner le modèle.
cas d'usage
- 1. Faire tourner des agents de codage sur des tâches courtes à moindre coût
- 2. R&D IA : génération de jeux de données et de modèles du monde assistée
- 3. Auto-héberger un modèle MoE 309 Md sur des GPU H200
- 4. Traiter de très longs contextes (1 M de tokens) sans attention pleine
- 5. Comparer l'attention éparse DeepSeek face aux modèles généralistes
astuces
- → Comparer les scores dans le même harnais (Claude Code) : l'écart avec DeepSeek tombe à 2 points
- → Prévoir 4x H200 au minimum pour servir les poids avec du contexte : 4x H100 ne suffisent pas
- → Le point de bascule tarifaire avec DeepSeek est un taux de cache d'environ 88 % : au-delà, DeepSeek redevient moins cher




