2800 milliards de neurones artificiels, et pas un de moins
Moonshot AI a frappé fort. Très fort. Le 16 juillet 2026, la boîte chinoise — fondée par Yang Zhilin, ex-Meta AI et Google Brain, un gamin de 32 ans qui tutoie déjà les sommets de la Silicon Valley — a lâché Kimi K3. Un monstre de 2800 milliards de paramètres. Pour ceux qui comptent en millions comme le commun des mortels, ça fait 2,8 trillions. C'est plus que GPT-4 (1,7T). C'est plus que Gemini Ultra. C'est le plus gros modèle open-weight jamais balancé sur la place publique.
Et « open-weight », ça veut dire quoi exactement ? Les poids seront disponibles le 27 juillet — dix jours après l'annonce, le temps que les serveurs refroidissent. Pas open-source au sens strict (pas de données d'entraînement, pas de code de pré-entraînement), mais les poids bruts, eux, seront libres de téléchargement, de modification, de fine-tuning, et même d'utilisation commerciale. Une claque dans la gueule du camp « closed-source » made in USA.
Un contexte de guerre froide qu'il faut rappeler
Remettons les pendules à l'heure. On est en 2026. Les États-Unis ont passé quatre ans à étrangler l'accès de la Chine aux GPU NVIDIA via des contrôles d'export de plus en plus restrictifs. La logique washingtonienne : « pas de puces, pas d'IA ». Le résultat ? La Chine a répondu en investissant massivement dans les semi-conducteurs domestiques (Huawei Ascend, Biren) et en optimisant l'entraînement distribué sur des clusters de GPU moins puissants mais plus nombreux.
Kimi K3 est le fils de cette contrainte. Entraîné sur 24 000 GPU — probablement un mix d'A800 (la version castrée du H100 autorisée à l'export) et de puces domestiques — il prouve que la stratégie du blocus a un effet pervers : elle force l'innovation. Le modèle utilise du Mixture of Experts (MoE), une architecture qui n'active qu'une fraction des paramètres à chaque inférence. Résultat : 2,8T de paramètres, mais une empreinte computationnelle maîtrisée. Malin.
Ce que la bête sait vraiment faire
Multimodal natif. Kimi K3 avale du texte, des images, du code, de l'audio, de la vidéo. Pas en mode « on a ajouté un module vision par-dessus un LLM texte » — le modèle est entraîné de bout en bout sur des modalités mixtes. Fenêtre de contexte d'un million de tokens. Pour visualiser : c'est l'équivalent de 750 000 mots, soit la trilogie complète du Seigneur des Anneaux en une seule invite. De quoi faire tenir une base de code entière, ou 20 heures de transcription vidéo.
Et surtout : capacités agentic intégrées. Kimi K3 peut utiliser des outils, naviguer sur le web, exécuter du code dans un bac à sable, et planifier des tâches multi-étapes. Moonshot a entraîné le modèle sur des trajectoires d'agents — des séquences « action → observation → réflexion → action suivante » — plutôt que de boulonner un framework externe par-dessus. Le raisonnement agentic est natif, pas greffé.
Sur les benchmarks, le tableau est éloquent : Kimi K3 rivalise avec Claude 4 sur MATH et GSM8K, dépasse GPT-4o sur MMLU-Pro, et égale les meilleurs modèles closed-source sur les tâches de coding (HumanEval+, SWE-bench). Le tout avec des poids ouverts. Et un prix d'API pas encore annoncé, mais que Moonshot promet « compétitif » — ce qui, en langage startup chinoise, veut probablement dire « 5 à 10 fois moins cher qu'OpenAI ».
La carte des menus
Moonshot n'a pas encore publié sa grille tarifaire API. Mais le modèle est disponible dès maintenant sur kimichat.ai — le chatbot grand public de Moonshot, équivalent chinois de ChatGPT avec 40 millions d'utilisateurs actifs mensuels. Les poids complets arrivent le 27 juillet sur Hugging Face et ModelScope. Gratuits. Modifiables. Commerciaux. Sans contrepartie.
Pour les développeurs qui veulent héberger le modèle eux-mêmes, prévoyez du muscle : 2,8T de paramètres, même en MoE avec activation partielle, ça nécessite un cluster de GPU sérieux. Les quantifications (GGUF, GPTQ, AWQ) arriveront rapidement via la communauté — comptez quelques jours après la sortie des poids pour les premières versions 4-bit.
Les couleuvres à avaler
Premièrement, le « open-weight » n'est pas « open-source ». Moonshot ne publie ni le code d'entraînement, ni les données, ni la recette de préparation des données. Vous avez le gâteau, pas la recette. Pour la recherche en sécurité et l'auditabilité, c'est un angle mort significatif.
Deuxièmement, 2,8T de paramètres, c'est lourd. Très lourd. Même en MoE avec 8 experts dont seuls 2 sont actifs par token, l'inférence nécessite un cluster de GPU conséquent. Le fine-tuning complet est hors de portée de 99% des développeurs indépendants. Les adaptations LoRA et QLoRA seront le standard, mais elles limitent la flexibilité.
Troisièmement, Moonshot est une entreprise chinoise, soumise aux lois chinoises. Le modèle est aligné sur les standards de contenu de la RPC — ce qui veut dire que certains sujets (Tiananmen, Taïwan, Xinjiang, Falun Gong) sont probablement censurés dans les réponses. Pour un usage en Occident, c'est une limitation qu'il faut connaître et anticiper. La communauté open-source peut théoriquement désaligner le modèle via fine-tuning, mais la couche de censure est souvent profonde et résiliente.
Quatrièmement, la fenêtre de 1M tokens est technique, pas pratique. Au-delà de 128K tokens, tous les modèles actuels — y compris Gemini et Claude — montrent une dégradation de l'attention sur le milieu et la fin du contexte. Kimi K3 ne fera probablement pas exception. La revendication « 1M tokens » est vraie architecturalement, mais votre kilométrage peut varier.
Verdict
Kimi K3 est un électrochoc. Dans la course mondiale à l'IA, la Chine n'est plus en train de rattraper — elle impose son rythme. Le timing est remarquable : à quelques semaines de l'annonce attendue de GPT-5 par OpenAI, Moonshot pose un jalon qui force tout le monde à regarder vers l'Est.
Pour les développeurs, c'est Noël en juillet. Un modèle de classe mondiale, gratuit, modifiable, avec des capacités agentic natives. Pour les géants américains, c'est un avertissement : les contrôles d'export sur les GPU n'ont pas tué l'IA chinoise. Ils l'ont rendue plus créative, plus efficace, plus déterminée.
Rendez-vous le 27 juillet sur Hugging Face. Prévoyez de la bande passante.

