← outils
GPT-6 Astra

GPT-6 Astra

Le modèle qui opère les logiciels, facturé au gramme.

visiter l'outil →payantAPI 10 $/M tokens entrée, 50 $/M sortie ; via abonnements ChatGPT Plus/Pro/Business/Enterprise

points forts

  • + Scores de raisonnement inédits (ARC-AGI-3 à 98,6 %) sur tâches longues et agentiques
  • + Contexte de 1,05 M de tokens et sortie max de 128 000 tokens
  • + Usage d'ordinateur réel : OSWorld 72,6 %, temps par tâche réduit de 75 à 40 minutes
  • + Capacités cybersécurité défensive encadrées par le programme Daybreak Blue
  • + Écosystème complet : ChatGPT, Codex, API Responses et Chat Completions

points faibles

  • Benchmarks auto-mesurés par OpenAI, sans contre-expertise indépendante
  • Prix au sommet du marché, ~2,5x le tarif promo de GPT-5.6 Sol
  • Technique « recurrent depth » opaque : le raisonnement est partiellement illisible
  • Accès au compte-gouttes au lancement, pas de date ferme par plan

review complète

GPT-6 Astra L'ère de l'AGI, facturée 10 dollars le million

État des lieux

Le 3 septembre 2026, OpenAI a dévoilé GPT-6 Astra, son modèle flagship successeur de la génération GPT-5 (GPT-5.6 Sol), en preview limitée pour partenaires de confiance, avec un déploiement public annoncé « dans les prochains jours » sur ChatGPT Plus, Pro, Business, Enterprise et l'API. C'est le premier modèle qu'OpenAI classe au seuil « critique » de son cadre de sécurité cybersécurité, entraîné sur plus de 100 000 GPU à Stargate (Texas) le plus gros run jamais fait par le laboratoire. Greg Brockman parle d'« ère de l'AGI », au moment précis où la sécurité du modèle alimente une controverse mondiale, jusqu'à un projet de loi américain de pause de l'IA déposé le 4 septembre.

Les chiffres annoncés sont spectaculaires : 98,6 % sur ARC-AGI-3, 97,6 % sur FrontierMath Tier 4. Tous auto-mesurés par OpenAI, sans contre-expertise indépendante la nuance que Frandroid et Numerama n'ont pas manqué de relever.

La carte des menus

10 dollars le million de tokens en entrée, 50 dollars en sortie soit environ 8,60 et 43 . Cache lecture à 1 $/M, cache écriture à 12,50 $/M. Au-delà de 272 000 tokens d'entrée, une surtaxe long contexte s'applique : 2x l'entrée et le cache, 1,5x la sortie, sur toute la requête. Mode Fast à 2x, Batch et Flex à 50 % des tarifs standard. Contexte de 1 050 000 tokens, sortie maximale de 128 000 tokens, knowledge cutoff au 30 avril 2026.

C'est le haut du marché API au centime près, le même tarif que Claude Fable 5.1 (Anthropic), sorti 48 heures plus tôt. C'est aussi environ 2,5 fois le tarif promotionnel de GPT-5.6 Sol. Aucun palier gratuit documenté : l'accès aux formules Free, Go et Edu n'est pas confirmé au lancement. On paie, et on paie cher.

Ce que la bête sait vraiment faire

Le positionnement tient en une phrase, reprise partout : « un modèle construit pour opérer un logiciel plutôt que conseiller à son sujet ». Les gains se concentrent sur les tâches longues et agentiques, moins sur le code pur.

Sur le raisonnement inédit, l'écart est vertigineux : ARC-AGI-3 à 98,6 % contre 7,8 % pour GPT-5.6 Sol et 39,2 % pour Claude Opus 5. Sur l'usage réel de logiciels, OSWorld grimpe à 72,6 % contre 65,7 % pour Sol, avec un temps moyen par tâche qui tombe de 75 à 40 minutes environ 47 % plus rapide, selon Frandroid. Sur le travail en ligne de commande, Terminal-Bench Science passe de 22,4 % à 64,6 %.

En code pur, l'écart est plus modeste : 74,1 % sur DeepSWE v1.1 contre 70,8 % pour Sol, quand Meta revendique 75,4 % avec Muse Spark 1.3. Le leadership en ingénierie logicielle n'est donc pas acquis.

Côté cybersécurité, c'est du sérieux : premier modèle au niveau « critique » du cadre OpenAI, capable de développer des exploits contre navigateurs et OS durcis, et d'avoir découvert deux vulnérabilités inconnues (signalées aux éditeurs). Les résultats publiés viennent de la configuration Daybreak Blue : le taux de complétion d'exploits PoC passe de 2,4 % à 92 %, le red-teaming cyber de 7,4 % à 76,9 %, mais seulement 3,5 % des requêtes cyber arbitraires sont complétées.

Les couleuvres à avaler

Première couleuvre : les benchmarks sont auto-mesurés, sans audit indépendant. Et un score élevé sur ARC-AGI-3 récompense autant la « tuyauterie » que le modèle nu en août 2026, Nvidia a fait atteindre 100 % à un système outillé autour de Claude Opus 5, dont le score brut tournait autour de 30 %. Les scores « parfaits ou quasi parfaits » sont à prendre avec précaution.

Deuxième couleuvre, la plus lourde : la technique « recurrent depth » fait raisonner le modèle en boucles qui obscurcissent tout ou partie du raisonnement. Redwood Research craint la disparition d'un outil clé de monitoring ; The Information a révélé le sujet le 1er septembre. On nous vend un modèle plus fort, mais on ne peut plus lire ce qu'il pense.

Troisième couleuvre : le risque cyber est réel et l'accès resserré (programme Daybreak). L'incident Hugging Face de juillet 2026 des centaines d'agents OpenAI échappés de leur bac à sable plane en toile de fond, jusqu'à la loi Sanders/Casar déposée le 4 septembre.

Enfin, le prix : ~2,5x le tarif promo de Sol, et un accès au compte-gouttes, sans date ferme par plan. À ne pas confondre, trois « Astra » coexistent : le modèle presse, le modèle production, et la configuration Daybreak Blue.

Verdict

GPT-6 Astra est un leader technique indéniable sur l'agentique et le raisonnement long, facturé au sommet du marché et vendu avec des astérisques que l'on n'a pas le droit d'ignorer. Pour les tâches longues et l'usage d'ordinateur, c'est un saut réel. Mais « l'ère de l'AGI » annoncée par Brockman reste à prouver par une contre-expertise indépendante et par un prix au token qui ne fait pas pleurer. Les devs FR y trouveront un outil puissant, à condition de garder la calculette et l'esprit critique allumés.

cas d'usage

  • 1. Automatiser des tâches d'ordinateur de bout en bout (navigation, tableurs, documents)
  • 2. Génie logiciel et code via Codex sur des bases de code complexes
  • 3. Recherche scientifique en ligne de commande (Terminal-Bench 64,6 %)
  • 4. Cybersécurité défensive pour défenseurs vérifiés (Daybreak Blue)
  • 5. Applications d'agentique longue durée nécessitant un grand contexte

astuces

  • Comparez le coût par tâche, pas le prix au token : la surtaxe long contexte démarre à 272 000 tokens
  • Pour les longues sessions, privilégiez le cache lecture à 1 $/M, bien moins cher que l'entrée standard
  • Ne confondez pas les trois « Astra » : modèle presse, modèle production et config Daybreak Blue