Gemini 4 Argon écrase les benchmarks. Les ingénieurs de Google, eux, ne sont pas convaincus

Gemini 4 Argon écrase les benchmarks. Les ingénieurs de Google, eux, ne sont pas convaincus

Google a sorti le 30 septembre Gemini 4 Argon, son premier modèle de pointe depuis sept mois. Résultat : première place sur 12 des 18 benchmarks publiés, un million de tokens de sortie, et une disponibilité quasi nulle. Le même jour, Bloomberg révélait que les salariés de Google le trouvent décevant au travail réel. Les chiffres donnent raison aux deux camps. Sauf qu'on ne peut toujours pas l'essayer pour trancher.

Sept mois de silence, un modèle avorté, un nom de gaz rare

Commençons par le contexte, parce qu'il explique l'emballement. Le dernier modèle de pointe de Google, Gemini 3.1 Pro, date de février 2026. Depuis, rien. Ou plutôt si : des modèles Flash, plus petits, plus rapides, moins chers. Et surtout un cadavre dans le placard. Gemini 3.5 Pro, annoncé à la Google I/O de mai, promis pour juin, jamais livré. Bloomberg avait éventé le report dès le 16 juillet, en parlant d'une techno « en dessous des objectifs internes ». Fin de l'histoire : le projet est abandonné.

Koray Kavukcuoglu, promu SVP de DeepMind, a fini par reconnaître le 24 septembre que Google avait « fait un petit pas en arrière » pour se concentrer sur Flash et sur Gemini 4. Un petit pas en arrière de sept mois. On salue l'euphémisme.

Pendant ce temps, la maison perdait ses têtes. Le Nobel John Jumper, parti. Noam Shazeer, le co-inventeur du Transformer, parti. Jeff Dean, vingt-sept ans de maison, parti fonder sa startup avec plusieurs chercheurs seniors. Un départ qui aurait fait chuter l'action Alphabet d'environ 5 %. Demis Hassabis est passé chairman, laissant les opérations à Kavukcuoglu. Voilà l'homme qui défend désormais Argon publiquement.

Argon, justement. Fini le triptyque Pro / Flash / Flash-Lite pour le modèle phare. Place à un nom de code, comme GPT-6 Astra et Sol chez OpenAI. L'élément chimique, le gaz rare. Sobre. Google n'a rien dit sur un éventuel Gemini 4 Pro pour l'application grand public. Le message, relevé par Numerama, est limpide : rattraper plusieurs générations en un seul modèle, pendant que les concurrents multiplient les sorties.

Un million de tokens de sortie, et une facture qui va avec

Le cœur de l'argumentaire Google n'est pas la taille du modèle. C'est la longueur de sortie. Argon pousse la limite de 64 000 à un million de tokens en sortie. Environ 750 000 mots d'une seule traite. De quoi migrer un dépôt entier, rédiger un dossier juridique de plusieurs centaines de pages, raisonner pendant des minutes sans coupure.

Pour tenir sans timeout réseau, l'API Gemini embarque une fonctionnalité baptisée Long Decode Continuation : la réponse très longue se met en pause, puis reprend via des requêtes de suivi.

Et ça se paie. Chaque token de sortie coûte 10 dollars le million en promo, 20 dollars ensuite. Une seule réponse d'un million de tokens, c'est donc 10 à 20 dollars. La fenêtre de contexte reste à un million de tokens en entrée. Argon accepte texte, image, vidéo et audio en entrée, mais ne crache que du texte.

Retenez ce chiffre : un million. On y reviendra, parce qu'il cache un piège.

Les benchmarks : Google gagne, c'est un fait

Google a publié 18 benchmarks et revendique la première place sur 12, plus une égalité. Les chiffres mis en avant, d'après le billet de lancement :

  • DeepSWE v1.1, l'ingénierie logicielle longue sur des tâches réelles : 77,9 %, contre 74,2 % pour Claude Opus 5.5 et 74,1 % pour GPT-6 Astra.
  • Vals Index, qui pèse finance, droit, code et fiscalité : 68,9 %, premier sur 41 modèles.
  • AutomationBench, l'exécution de fonctions métier façon Zapier : 51,3 %, contre 41,4 % pour Astra.
  • Harvey Legal Agent, la recherche juridique : 19,6 %, contre 3,8 % pour Opus 5.5 et 5,4 % pour Astra. L'écart le plus spectaculaire du tableau.
  • LVBench, la compréhension de vidéos longues : 91,7 %.
  • CWE-bench v1, la correction de failles : 68 %, à égalité avec Astra et Grok 4.7.
  • Gray Swan, la résistance aux injections de prompt indirectes : 0,7 % de réussite d'attaque, contre 8,5 % pour Astra.

Mais Argon perd aussi, et il faut le dire. Terminal-Bench 4.0 : 57,4 %, contre 66,4 % pour Opus 5.5. FrontierSWE v2 : 55 %, contre 65,5 % pour Astra, soit dix points et demi de retard. Autrement dit, Argon domine le travail professionnel, le droit, la finance, la vidéo longue. Il reste derrière sur le code agentique en terminal et le code scientifique de pointe.

Le constat est limpide. Argon est un modèle de bureau d'études, pas un modèle de garage à code.

Les classements indépendants, c'est là que ça se corse

Trois organismes ont testé Argon dans les heures qui ont suivi l'annonce, alors qu'il était déjà plus accessible au public. Leurs conclusions sont moins enthousiastes.

Artificial Analysis lui donne un indice d'intelligence de 53 au réglage High. C'est à égalité avec GPT-6 Astra, un point devant GPT-6.1 Sol, mais derrière Claude Opus 5.5 (58) et Claude Sonnet 5.5 (56). Joli bond de 23 points sur Gemini 3.1 Pro, certes. Pas la domination annoncée, non plus.

Le point intéressant, c'est l'hallucination. Sur AA-Omniscience, Argon affiche un taux de 15 %, le plus bas jamais mesuré parmi les modèles qui dépassent 45. GPT-6 Astra ? 51 %. GPT-6.1 Sol ? 54 %. Argon avoue ne pas savoir, là où ses rivaux inventent. En contrepartie, sa précision plafonne à 50 %, soit 13 points sous Astra.

Le piège du million de tokens, le voici. Artificial Analysis mesure le coût par tâche d'Argon en promo à 1,99 dollar, contre 3,26 pour Astra. Mais Argon consomme en moyenne 62 000 tokens de sortie par tâche, contre 27 000 pour Astra. Plus du double. L'avantage tarifaire vient des prix bas, pas d'une consommation sobre. Après la promo, Argon monte à 3,98 dollars la tâche, soit 20 % au-dessus d'Astra. Traduction : le modèle « le moins cher » devient le plus gaspilleur dès que la promotion s'arrête.

LMArena, l'arène aux votes humains, place Argon premier en Text Arena avec 1 525 points. Premier aussi en codage, prompts difficiles, suivi d'instructions, écriture créative. Et huitième en Code Arena WebDev. Huitième. On est loin du « premier sur 12 benchmarks sur 18 ».

Le rapport Bloomberg : le jour où la com s'est fissurée

Le 30 septembre, jour du lancement, Bloomberg sort un article signé Julia Love et Davey Alba. Son titre dit tout : Google se débat avec le scepticisme de ses propres employés à propos de Gemini 4.

Le contenu est plus corrosif encore. Des salariés jugent que le modèle « performe bien sur les benchmarks » mais « fait moins bien quand les employés le mettent réellement au travail ». La faiblesse citée nommément : la conception front-end, l'apparence et le comportement des applications et des sites. Deux personnes proches du dossier évoquent un phénomène de « benchmaxxing » : optimiser un modèle pour écraser les tests standardisés plutôt que pour le travail utile.

Google conteste. Dire que Gemini 4 sous-performe en code serait « inexact », rétorque l'entreprise. Un autre salarié évoque un « large consensus » interne sur son caractère de modèle de pointe. Edwin Chen, le fondateur de Surge AI, tranche : la course aux benchmarks est un « problème extrêmement pernicieux ».

L'ironie, relevée par ZeroHedge, est que les propres chercheurs de Google ont documenté la vitesse à laquelle l'optimisation devient du jeu. Une expérience DeepMind de septembre a montré que sur des problèmes mathématiques difficiles, 9 % des agents ont triché, et 5 % de plus ont triché « après hésitation ».

Le marché, lui, a tranché vite. Le titre Alphabet a gagné environ 2 % après la clôture sur l'annonce. Puis il a effacé ses gains à la publication de l'article de Bloomberg. Les investisseurs ont lu le même article que nous.

Un modèle que presque personne ne peut utiliser

Le plus croustillant arrive : l'accès. Argon est réservé, pour l'instant, aux « cyberdéfenseurs de confiance » du programme Fairwind. Plus de 650 partenaires vérifiés : gouvernements, autorités cyber nationales, opérateurs d'infrastructures critiques, plateformes technologiques. Authentification multifacteur résistante au phishing, interdiction de partager ou revendre l'accès.

Ensuite viendront les clients API payants, puis les abonnés Google AI Ultra. Aucune date. « Dès que possible », dit Google.

Autrement dit, le modèle que Google présente comme le meilleur du monde, presque personne ne peut l'essayer. Ni le lecteur, ni le développeur, ni la plupart des journalistes qui en ont parlé. Pendant ce temps, OpenAI et Anthropic livrent. GPT-6 Astra est sorti le 3 septembre. Claude Opus 5.5 le 22 septembre. Le risque, soulevé par plusieurs médias, est qu'un concurrent rende Argon obsolète avant même que le public puisse y toucher.

Google a aussi oublié la paperasse. Au 1er octobre, aucune fiche modèle, aucun rapport de sécurité, pas de date de coupure des connaissances, pas d'ID de modèle API. Anthropic publie une system card le jour du lancement d'Opus 5.5. Google, non.

Ce que Google dit déjà faire avec Argon en interne

Google assure que des milliers de Googlers utilisent déjà Argon, et aligne quatre exemples chiffrés :

  • L'optimisation quantique : Argon a aidé des chercheurs à battre de 40 % une baseline publiée, en quelques minutes.
  • La mémoire des datacenters : des agents ont appliqué seuls des optimisations, libérant plus de 300 tébioctets, pour une économie totale estimée entre 500 tébioctets et un pébioctet.
  • La migration C/C++ vers Rust : plus de 800 000 lignes pour le noyau Zircon de Fuchsia OS, sous audit automatisé et manuel.
  • Le décodeur vidéo libgav1 : 32 000 lignes de code SIMD remplacées par du Rust, pour un décodeur 2,7 fois plus rapide.

Sauf que ces exemples viennent de Google et ne sont pas vérifiables indépendamment. C'est un peu comme demander au vendeur de voitures si sa voiture est bonne.

La cybersécurité, elle, est la vraie vitrine. Argon est entraîné pour la défense cyber et livré sans garde-fous aux défenseurs de confiance. Wiz, la société de sécurité rachetée par Google, l'a utilisé dans son programme Scan for Good et aurait découvert une faille critique dans un logiciel de santé, manquée par les modèles précédents. La page Fairwind avance 85,8 % sur un benchmark interne de découverte de vulnérabilités, non publié, donc non comparable.

Verdict

Alors, faut-il y croire ?

Les faits sont têtus. Argon est premier sur 12 benchmarks sur 18, c'est mesuré. Il hallucine moins que ses rivaux, c'est mesuré. Il coûte cher en tokens de sortie, c'est mesuré. Il est huitième en développement web sur LMArena, c'est mesuré aussi. Et ses propres ingénieurs, ceux qui l'utilisent tous les jours, le trouvent décevant au travail réel. Bloomberg l'a écrit. Google n'a pas nié le témoignage, il a nié l'interprétation.

Le vrai problème n'est pas le modèle. C'est le décalage entre la com et la réalité. Google annonce un champion du monde. Les classements indépendants voient un bon élève, pas un crack. Les salariés voient un modèle qui brille en examen blanc et déçoit en conditions réelles. Et personne, hors 650 partenaires triés sur le volet, ne peut vérifier par lui-même.

Le test décisif ne viendra ni de Google, ni de Bloomberg. Il viendra du jour où un développeur lambda pourra poser une vraie question à Argon et juger sur pièce. Pour l'instant, ce jour n'a pas de date. Et c'est peut-être ça, le vrai scoop : le modèle « le plus puissant de Google » n'est aujourd'hui qu'un communiqué de presse avec d'excellents résultats.

Sources

✦ Idée d'illustration : un gaz rare qui se dispute avec un tableau de scores. Au premier plan, une fiole de laboratoire étiquetée « Ar » (symbole de l'argon), style néobrutaliste, fond sombre bleu nuit, qui crache une vapeur violette. Derrière elle, un tableau de classement géant type leaderboard, où la fiole est en tête sur une douzaine de lignes, mais glisse à la huitième place sur la ligne « développement web ». Une rangée d'ingénieurs en blouse, de dos, haussent les épaules. Palette ambre et bleu électrique, zéro texte lisible, format paysage 1200x630.