iancr
← outils
Kimi K3

Kimi K3

Le premier open-weight de la cour des grands, avec une facture de palace.

visiter l'outil →payantAPI : $3/M input (cache miss), $0.30/M input (cache hit), $15/M output. App Kimi : abonnement dès ¥199/mois (~$27). Pas d'API gratuite.

points forts

  • + Excellence en coding agentique : #1 sur DeepSWE, Next.js Evals, BrowseComp et Arena Elo Code au lancement (juillet 2026)
  • + Contexte d'un million de tokens avec cache automatique — input à $0.30/M une fois le système chargé
  • + Multimodal natif : texte, images, PDF — pas de béquilles ni de wrappers externes
  • + Architecture MoE massive : 2,8 trillions de paramètres, 896 experts dont 16 activés par token — puissance sans explosion des coûts d'inférence
  • + Open-weight imminent : poids promis pour le 27 juillet 2026, premier modèle 3T-class ouvrable

points faibles

  • 5× plus cher que K2.7 Code — Moonshot abandonne le positionnement 'discount chinois'
  • Lent : 103 secondes de Time to First Token médian, 33 TPS en sortie — inutilisable en interactif serré
  • Poids non disponibles à ce jour (25 juillet 2026) — benchmarks invérifiables, tout repose sur la parole du vendeur
  • Mode raisonnement permanent impossible à désactiver — gaspillage de tokens et d'argent sur les tâches simples
  • Web search intégré officiellement 'en maintenance, non recommandé' — une feature annoncée mais indisponible
  • Déploiement local irréaliste : 64+ accélérateurs recommandés, réservé aux datacenters

review complète

Kimi K3 Le Chinois qui facture comme un Américain

Moonshot AI a sorti Kimi K3 le 16 juillet 2026. 2,8 trillions de paramètres, 1 million de tokens de contexte, multimodal, open weights « bientôt ». Et pour la première fois, un labo chinois ne joue plus la carte du discount : $3 en entrée, $15 en sortie le million de tokens. Une déclaration de guerre au prix fort.


État des lieux

Kimi K3 n'est pas un modèle de plus dans la gamelle open-source. C'est le premier modèle open-weight à franchir la barre des 2 800 milliards de paramètres une architecture Mixture of Experts qui n'active que 16 experts sur 896 par token. Traduction : la bête est massive mais ne brûle pas le datacenter à chaque requête. Enfin, pas complètement.

Moonshot AI, startup pékinoise fondée par Yang Zhilin (ex-Google Brain, ex-CMU), a construit sa réputation sur la lignée K2 : des modèles open-weight compétitifs à prix cassé. K2.6 et K2.7 Code étaient les couteaux suisses du dev indie corrects en coding, imbattables en rapport qualité/prix. Avec K3, Moonshot change de braquet : ils visent le tier frontier, celui où campent GPT-5.6 Sol et Claude Fable 5, et ils alignent les tarifs en conséquence.

Le timing n'est pas anodin. K3 débarque une semaine après GPT-5.6, un jour après Inkling (Thinking Machines), dans le mois le plus dense de l'histoire des sorties de LLMs. Moonshot ne suit plus le peloton : il sprinte en tête.


La carte des menus

Parlons cash. Voici les tarifs officiels de l'API Kimi K3, vérifiés sur platform.kimi.ai le 25 juillet 2026 :

Poste

Prix au million de tokens

Input (cache miss)

$3.00

Input (cache hit)

$0.30

Output

$15.00

Pour référence, K2.7 Code tournait autour de $0.60/$2.40. K3 coûte 5× plus cher que son prédécesseur direct. On est dans la grille tarifaire de Claude Sonnet, pas dans celle d'un « petit chinois pas cher ».

Gratuité ? Pas d'API gratuite. L'app Kimi (kimi.com) propose un accès limité sans CB, avec des quotas journaliers opaques. OpenRouter expose le modèle à $3/$15 également pas de miracle.

Promo de lancement : Moonshot offre un « Top-Up Rebate » sur les recharges API. Conditions non précisées publiquement.

Abonnement app : l'entrée de gamme commence à ¥199/mois (~$27), comparable à ChatGPT Plus.

Le contexte de 1 048 576 tokens est automatiquement caché si vous répétez les mêmes prompts système ou documents, l'input tombe à $0.30/M. C'est la seule bonne nouvelle sur la facture.


Ce que la bête sait vraiment faire

K3 est un agentic-first model. Moonshot ne le cache pas : ce n'est pas un chatbot à tout faire, c'est un modèle conçu pour travailler en plusieurs étapes coder dans des codebases massifs, utiliser des outils, naviguer sur le web, interpréter des captures d'écran.

Les benchmarks le confirment :

  • #1 sur DeepSWE 1.0 (67.5%) : résolution de bugs réels dans des repos open-source.
  • #1 sur Next.js Evals (92%) : génération de code frontend.
  • #1 sur BrowseComp (91.2%) : navigation web agentique.
  • #1 sur Arena Elo Code (1679) : préférence communautaire en coding.
  • #2 sur Terminal-Bench 2.1 (88.3%) : utilisation du terminal.
  • #2 sur MCP Atlas (84.2%) : utilisation d'outils multi-étapes.
  • GPQA Diamond : 93.5% le meilleur score open-weight au lancement.
  • Humanity's Last Exam : 56% avec outils comparable à GPT-5.6.

En clair : K3 est un monstre de coding agentique, probablement le meilleur modèle open-weight sur cette catégorie. Il voit les images et les PDF nativement, supporte le Tool Calling, le JSON mode, le prompt caching, et le paramètre reasoning_effort (low/high/max livré bloqué sur max au lancement).

Côté architecture, Moonshot introduit le Kimi Delta Attention (KDA), une variante d'attention linéaire hybride, et les Attention Residuals (AttnRes) pour stabiliser l'apprentissage à cette échelle. Le papier technique n'est pas encore publié, donc on juge sur parole mais les scores sont là.


Les couleuvres à avaler

  1. Les poids ne sont pas encore publics. Promise pour le 27 juillet 2026. On est le 25 juillet. Impossible de vérifier indépendamment les benchmarks. Tout ce qu'on a, c'est la parole de Moonshot.
  1. Le tarif pique. À $15/M output, une session de coding agentique qui crache 50 000 tokens vous coûte $0.75. Multipliez par 100 requêtes par jour et vous sentez le mois à $2 250. Ce n'est plus un jouet gratuit.
  1. C'est lent. Time to First Token médian : 103 secondes. Output TPS : 33.1. Si Claude Fable 5 est un TGV, K3 est un Intercités qui s'arrête à Vierzon.
  1. Pas de mode non-reasoning. Le modèle raisonne toujours, même pour « écris bonjour en français ». Le reasoning_effort est réglable mais pas désactivable. Facture salée pour les tâches simples.
  1. Le web search est cassé. Moonshot le dit lui-même dans sa doc : « currently being updated, we do not recommend using this functionality. »
  1. Déploiement local ? Oubliez. Moonshot recommande 64+ accélérateurs. Même avec les poids ouverts, personne ne fait tourner ça dans son garage.
  1. Moonshot reconnaît le gap. K3 reste derrière Claude Fable 5 et GPT-5.6 Sol en performance globale, de leur propre aveu. C'est un challenger crédible, pas un champion toutes catégories.

Verdict

★★★★☆ — Le premier vrai open-weight de la cour des grands, avec une facture de palace.

Kimi K3 est le modèle qu'on espérait depuis le début de la vague open-source : un poids lourd qui rivalise avec les modèles privateurs sur leur terrain. Le problème, c'est que Moonshot a décidé de rivaliser aussi sur les prix.

Si vous faites du coding agentique intensif, que vous avez besoin d'un contexte d'un million de tokens, et que vous comparez à GPT-5.6 Sol ($15/$60) ou Claude Fable 5 ($15/$75), K3 est une affaire. Si vous faisiez du volume sur K2.7 Code à $0.60/M, restez-y.

K3 n'est pas un « tueur de GPT » ni un « Claude moins cher ». C'est un outil spécialisé, excellent en agentic coding, multimodal par construction, open-weight (sur le papier), et facturé au prix que vaut cette qualité. C'est aussi la preuve que la Chine ne se contente plus de copier : elle innove, et elle le fait savoir.

Attendez le 27 juillet pour les poids. Attendez que la communauté reproduise les benchs. Et si vous sautez le pas, activez le cache à $3 l'input non caché, la douloureuse arrive vite.


Revue rédigée le 25 juillet 2026. Tarifs vérifiés sur platform.kimi.ai, benchmarks via AI Release Tracker, WhatLLM, BuildFastWithAI, Artificial Analysis et CloudPrice.

cas d'usage

  • 1. Débogage et refactoring de codebases massives — le #1 DeepSWE n'est pas un hasard
  • 2. Revue de code agentique multi-étapes avec outils (terminal, navigateur, MCP)
  • 3. Recherche documentaire longue : analyser des centaines de pages de specs, contrats ou papiers académiques en une session
  • 4. Génération de code frontend complexe (Next.js, React) avec compréhension visuelle des maquettes
  • 5. Automatisation de workflows professionnels multi-outils (JobBench, MCP Atlas)

astuces

  • Activez systématiquement le cache d'entrée — à $3/M sans cache contre $0.30/M avec, la différence est un loyer parisien
  • Pour le coding pur en volume, gardez K2.7 Code ($0.60/$2.40) et réservez K3 aux tâches complexes multimodales
  • Le paramètre 'reasoning_effort' accepte 'low', 'high' et 'max' — passez en 'low' pour les tâches simples, le max est le défaut livré
  • Attendez la sortie des poids le 27 juillet avant de vous engager lourdement — les benchmarks indépendants changeront peut-être la donne