Le 6 août 2026, SitePoint publie « l'analyse TCO de référence » du débat local vs API. Problème : ses prix datent de juin 2025, elle se termine par une pub, et la RTX 5090 a doublé de prix en France entre-temps. On reprend la calculatrice, avec les vrais chiffres de septembre.
Un calcul d'un an, vendu comme 2026
Ça a commencé comme un fil Hacker News. Un lien isolé, quatre points, zéro commentaire. L'article pointé : « Local LLMs vs Cloud APIs: 2026 Total Cost of Ownership Analysis », publié chez SitePoint le 6 août 2026. Le titre promet l'analyse de coût de l'année. Le corps raconte autre chose.
Fouillez la note de méthode. Elle est en bas, en petits caractères : « All hardware prices reflect MSRP or estimated street prices as of June 2025 [...] API rates come from published rate cards [...] as of the same date ». Juin 2025. L'article a donc un an de retard sur sa propre date de publication. Et il le dit lui-même.
Les modèles cités trahissent. GPT-4.1, Claude 4 Sonnet, Gemini 2.5 Pro. En septembre 2026, on en est à GPT-6 Astra et Claude Opus 5. Citer GPT-4.1 dans un comparatif « 2026 », c'est faire un guide des smartphones avec l'iPhone 13 en couverture.
Et puis il y a la fin. L'article se conclut sur un appel à utiliser slashspend-audit, le CLI d'un gestionnaire de factures OpenRouter nommé SlashSpend. Le bandeau publicitaire ouvre la page. L'analyse neutre vend un outil d'optimisation de facture. Coïncidence, sans doute.
Un dernier détail, trouvé par la brigade : thekb.eu indexe une fiche du même article sous la référence « ...2026-03-05 ». Le 5 mars 2026. Pour un article affiché publié le 6 août 2026. Autrement dit, ce contenu est evergreen, redaté au fil du calendrier éditorial. Le chiffre ne change pas. La date, si.
La carte qui a doublé
Voilà le vrai scandale. Pas l'API. Le matériel.
Le tableau de la source part d'une RTX 5090 à 1 999 dollars, le prix conseillé. En France, ce prix n'a jamais existé. En septembre 2025, la carte se trouvait autour de 2 600 euros. Un an plus tard, Clubic relève une ASUS TUF Gaming OC à 5 500 euros chez Cdiscount. Le double.
Et ce n'est pas une lubie de vendeur. La contagion touche toute la gamme : la RTX 5060 passe de 304 à 400 euros (+32 %), la RTX 5070 de 619 à 800 euros (+29 %). TrendForce, cité par Clubic, décrit des stocks de DRAM au plus bas, avec des capacités de production réorientées vers les serveurs IA. NVIDIA lui-même a repricé son DGX Spark de 3 999 à 4 699 dollars le 27 février 2026, officiellement pour cause de tension sur la mémoire.
Résultat : toute la colonne « matériel » du TCO est à jeter. Un build bi-GPU passe d'environ 6 900 dollars dans l'article à l'équivalent de 13 000-14 000 euros hors taxes chez nous. Le point de bascule calculé avec un GPU à 1 999 dollars est une fiction française.
L'électricité à 20 centimes
Deuxième variable oubliée : le kilowattheure. La source calcule l'électricité à 0,12 dollar le kWh. En France, le tarif réglementé est à 0,2001 euro TTC, après une hausse de 2,5 % au 1er août. Le double, encore.
Prenez l'exemple de l'article : une RTX 5090 à 450 W, 8 heures par jour, un an. À 0,12 $/kWh, ça donne 189 dollars. À 0,2001 €/kWh, on passe à environ 315 euros. L'article le reconnaît d'ailleurs, dans un passage que tout le monde a sauté : « en Europe, à 0,25-0,30 $/kWh, ces chiffres doublent à peu près ». C'est la seule clé de conversion vers l'Europe du papier. Elle est datée. Et elle contredit le titre.
Trois API, pas une
Le pire n'est même pas le matériel. C'est que la colonne « API » de l'article est fausse dans les deux sens.
Elle sous-estime la frontière. Le papier modélise GPT-4.1 à 2 dollars l'entrée, 8 dollars la sortie. La réalité de septembre 2026 : GPT-6 Astra est à 10 dollars l'entrée, 50 dollars la sortie. Claude Fable 5.1, 10/50 aussi. Facteur 2 à 3 d'écart.
Elle surévalue l'entrée de gamme. Le papier ne connaît pas la stratification qui s'est installée en 2026. Aujourd'hui, il y a trois marchés, pas un. La frontière propriétaire (2 à 50 dollars). Le milieu de gamme : GPT-5.6 Lunar à 0,20 dollar l'entrée, Gemini 3.8 Flash à 0,75. Et les modèles ouverts hébergés : Qwen 3.8 Flash à 0,15 dollar l'entrée, DeepSeek V4.1 Flash à 0,15 en heures creuses. Chiffres relevés en direct via OpenRouter, qui indexe 445 modèles.
DeepSeek pousse même une tarification à deux vitesses, heures pleines et heures creuses. Comme l'électricité, tiens. Le clin d'œil est involontaire, sans doute.
Comparer « le local » à « l'API » n'a plus de sens. Il faut comparer le local à trois strates. Et sur la strate du bas, le rapport de force change tout.
Le seuil de bascule, recalculé
Reprenons l'arithmétique, mais avec les entrées de septembre.
L'article chiffre le palier médian (5 millions de tokens par jour) à 10,07 dollars par million de tokens en local, sur 12 mois. Face à ça, l'API open-weights est à 1,97 dollar le million. Déjà, le local perd. Maintenant, gonflez le matériel : un GPU à 5 500 euros au lieu de 1 999 dollars, un build bi-GPU à 13 000-14 000 euros, l'électricité à 0,2001 €/kWh. Le surcoût matériel ajoute environ 6 000 euros sur la première année, à ce volume.
La conclusion tombe d'elle-même : pour un usage non souverain, la bascule ne se situe plus à 5 millions de tokens par jour. Elle se situe bien au-delà. Et la variable décisive n'est pas le volume de tokens. C'est le prix d'acquisition du matériel. Qui a doublé en un an.
L'article, lui, affirme que « les points de bascule 2026 sont 40 % plus bas qu'en 2024 ». Avec un matériel qu'il date de juin 2025. Les deux affirmations ne peuvent pas être vraies en même temps. Soit le matériel a doublé, soit la bascule baisse. Pas les deux.
La troisième voie dont personne ne parle
Il y a un angle mort dans tout ce débat, et il est énorme.
On nous présente un choix binaire : local ou API. Mais la vraie concurrence du local en 2026, ce n'est pas GPT-6 Astra. C'est l'hébergement de modèles ouverts. Qwen 3.8 Flash à 0,15 dollar le million de tokens en entrée. DeepSeek à 0,15 en heures creuses. Contre 10,07 dollars en local au palier médian.
Ça écrase le local en coût. Et ça garde une partie du contrôle : les poids sont ouverts, on peut basculer d'hébergeur, auditer le modèle. Ce qui manque, c'est la résidence des données. Et c'est là que le débat redevient français.
Parce qu'en France, on ne vend pas du local pour le coût. On le vend pour la souveraineté. Les guides de datacampus.fr et les offres Mistral on-premise le disent : le marché vend d'abord la résidence, la traçabilité, le RGPD. Ensuite seulement le prix. Un ordre de grandeur circule chez audelalia.fr : un serveur GPU mutualisé autour de 1 200 euros par mois pour environ 100 000 conversations. À prendre avec des pincettes, mais ça situe le débat.
On a déjà expliqué ici comment faire tourner un LLM sur son PC sans abonnement. La question n'est pas de savoir si c'est possible. C'est de savoir si c'est rentable. Et la réponse, en septembre 2026, dépend moins de vos tokens que de votre facture d'électricité et du prix de la carte.
Verdict
Franchement, l'article SitePoint n'est pas un mensonge. C'est pire : c'est un calcul honnête, avec des données mortes, recyclé à l'infini pour vendre un outil de facturation. Le lecteur pressé récupère le tableau « 12-month TCO » et l'intègre dans son business plan. Il ne lira jamais la note de bas de page qui avoue juin 2025.
La vérité de septembre 2026 tient en trois lignes. Le matériel a doublé en France. L'électricité a augmenté. L'API s'est stratifiée, et la strate du bas coûte trois fois rien. Conséquence : le local ne se justifie plus par le coût, sauf à volume énorme ou à exigence de souveraineté. Et quand on vous ressort un comparatif « local vs API », la première question n'est pas « quel modèle ? ». C'est « quelle date ? ».
Le chiffre que vous avez lu ce matin est peut-être exact. Il est juste périmé d'un an.
Sources
- SitePoint — Local LLMs vs Cloud APIs: 2026 Total Cost of Ownership Analysis
- Hacker News — fil « Local LLMs vs. Cloud API cost analysis »
- Clubic — La flambée des prix PC : RTX 5090 à 5 500 €, DDR5 à 500 €
- OpenAI — grille de prix (GPT-6 Astra, GPT-5.6 Lunar)
- DeepSeek — tarification V4.1 Flash, heures pleines et creuses
- OpenRouter — relevé des prix (Anthropic, Gemini, Qwen, DeepSeek)
- LesFurets — prix de l'électricité en France, septembre 2026
- NVIDIA — DGX Spark
- thekb.eu — fiche agrégateur datant l'article SitePoint du 5 mars 2026
- datacampus.fr — IA locale, serveurs souverains
- audelalia.fr — ChatGPT vs Claude vs Mistral en entreprise
✦ Idée d'illustration : un bureau de développeur français, vue de trois quarts, avec une carte graphique imposante (type RTX 5090, dissipateur massif en aluminium noir) posée au centre, une étiquette de prix « 5 500 € » accrochée au coin. À côté, une vieille étiquette « 2 600 € » barrée d'un trait rouge. En arrière-plan, un compteur électrique mural affichant « 0,2001 €/kWh » en digital vert, et un nuage lumineux (l'API) qui flotte au-dessus, léger, presque moqueur. Style néobrutaliste, palette sombre (noir, gris, vert électrique), gros aplats, ombres dures, typographie sans serif agressive. Ambiance critique, façon éditorial tech français.







