Sorties

GPT-6 Astra coûte 2,5 fois plus que Sol. Il parle comme nous

GPT-6 Astra est facturé 2,5 fois le tarif de Sol par token, donc mon quota fond plus vite. J’ai vérifié les limites, les benchmarks et les premiers retours.

Sur cette page
  1. Qu’a livré OpenAI le 3 septembre 2026 ?
  2. Pourquoi Astra épuise-t-il mon quota plus vite que Sol ? Le prix par token, pas la verbosité
  3. Astra parle-t-il vraiment comme un humain ? Mon impression et ce que disent les mesures
  4. Astra est-il plus intelligent que Sol 5.6 ? Oui pour les agents, à peine pour le raisonnement général
  5. Ce qui a changé dans Codex : le périmètre est mieux tenu, les changements restent trop gros
  6. Le verrou cybersécurité et ce qu’il coûte en surveillance
  7. Comment je répartirais le travail sur un forfait payant

OpenAI a lancé GPT-6 Astra le 3 septembre 2026, et le modèle est arrivé le lendemain dans les forfaits ChatGPT payants. Dans Codex et ChatGPT Work, il est facturé exactement 2,5 fois le tarif en crédits de GPT-5.6 Sol, si bien que mon quota s’épuise plus vite alors même que le modèle écrit moins de tokens par tâche. [1] [2] Mon impression après ces premiers jours : il répond moins comme une IA, et il est un peu plus intelligent là où ça compte.

Qu’a livré OpenAI le 3 septembre 2026 ?

OpenAI a livré un seul modèle, GPT-6 Astra, présenté comme un nouveau numéro de génération et comme le remplaçant direct de GPT-5.6 Sol. Il coûte plus cher que Sol à tous les niveaux, offre une fenêtre de contexte plus large dans l’API, et il est arrivé par un déploiement progressif pour lequel OpenAI s’est elle-même excusée. [1] [9]

La dénomination mérite une précision, parce que l’article précédent sur Astra publié ici laissait la question ouverte. En juillet, OpenAI décrivait Sol, Terra et Luna comme des niveaux de capacité durables, capables d’avancer chacun à son rythme. Ce cadrage n’a pas tenu deux mois. Astra est le seul modèle GPT-6, la documentation de l’API le combine désormais avec GPT-5.6 Terra et GPT-5.6 Luna pour les travaux moins exigeants, et dans ChatGPT la version conversationnelle porte le nom GPT-6 Pro. [1] [4] [5]

Caractéristique GPT-6 AstraGPT-5.6 SolClaude Fable 5.1
Entrée, $/MTok 10 4 (Meilleure valeur de la ligne) 10
Sortie, $/MTok 50 20 (Meilleure valeur de la ligne) 50
Lecture du cache, $/MTok 1,00 0,40 0,25 (Meilleure valeur de la ligne)
Fenêtre de contexte de l’API 1,05M 1,05M 1M
Figure 1. Prix catalogue de l’API et fenêtres de contexte au 5 septembre 2026. Chiffres d’Astra et de Sol tirés de la page tarifaire de l’API d’OpenAI, chiffres de Fable tirés de la page modèle d’Anthropic.

La figure 1 montre les deux éléments qui décident du coût d’Astra. D’abord, son prix est exactement celui de Claude Fable 5.1 en entrée comme en sortie : OpenAI vend donc maintenant son modèle phare au tarif du modèle phare d’Anthropic. Ensuite, la lecture du cache coûte quatre fois plus cher sur Astra que sur Fable 5.1, ce qui pèse lourd sur les longues sessions d’agent qui relisent sans cesse le même contexte. [7] [24] [34] Le modèle accessible par l’API accepte 1 050 000 tokens de contexte, produit jusqu’à 128 000 tokens en sortie, a une date limite des connaissances au 30 avril 2026 et propose un effort de raisonnement de low à max. Le réglage none renvoie une erreur, et l’appel d’outils passe obligatoirement par l’API Responses. [5]

Dans Codex, l’offre est plus étroite que la page de l’API ne le laisse croire. Astra exige Codex CLI 0.153.0 ou plus récent, et il n’est devenu le modèle par défaut, sélectionnable dans le sélecteur intégré, qu’avec la version 0.153.4 du 4 septembre. [3] [8] Le catalogue Codex lui donne la même fenêtre de contexte par défaut de 272K que Sol, avec 872K au maximum : le million de tokens existe donc pour les utilisateurs de l’API, pas pour les abonnés. [2] [6] Codex ajoute aussi un sixième niveau de raisonnement, Ultra, qui délègue une partie de la tâche à des sous-agents parallèles, ainsi qu’un réglage expérimental qui conserve des notes d’une fenêtre de contexte à l’autre au lieu de tout comprimer dans un seul résumé. [1] [6]

Le déploiement est ce que la plupart des gens ont vécu en premier. OpenAI a annoncé Astra le 3 septembre pour un nombre limité d’organisations, les utilisateurs payants n’ont rien trouvé dans leur sélecteur de modèles, et Thibault Sottiaux, responsable de Codex, a promis un banked reset, un reset gardé en réserve, pour chaque journée pendant laquelle un compte payant est resté sans accès. [10] Sam Altman a écrit le lendemain matin « désolé pour ce déploiement chaotique », et la disponibilité générale pour Plus, Pro, Business et Enterprise a suivi le 4 septembre. [9] C’est pour cette raison que cet article parle des premiers jours plutôt que d’une première semaine.

Pourquoi Astra épuise-t-il mon quota plus vite que Sol ? Le prix par token, pas la verbosité

Mon abonnement s’épuise plus vite avec Astra parce qu’OpenAI facture 2,5 fois plus de crédits par token, pas parce qu’Astra écrit davantage. Toutes les mesures indépendantes que j’ai trouvées montrent au contraire qu’Astra utilise moins de tokens de sortie par tâche que Sol. Le tarif en crédits l’emporte simplement sur cette économie. [2] [11]

crédits par token face à Sol
2,5x
250 en entrée et 1 250 en sortie par million, contre 100 et 500
de tokens de sortie en moins que Sol
36 %
49 millions contre 76 millions sur l’Intelligence Index
de coût par tâche de l’indice
2,57 $
contre 1,25 $ pour Sol à l’effort max
Figure 2. Ce qui décide de la consommation de quota. Tarifs en crédits tirés de la page tarifaire de Codex, chiffres de tokens et de coût tirés d’Artificial Analysis, 5 septembre 2026.

La figure 2 met les trois chiffres côte à côte. Dans Codex et ChatGPT Work, un million de tokens en entrée coûte 250 crédits sur Astra contre 100 sur Sol, et un million de tokens en sortie coûte 1 250 contre 500. [2] Les estimations de messages publiées par OpenAI sont divisées d’autant : un forfait Plus reçoit une estimation de 5 à 45 messages Astra locaux par fenêtre de cinq heures là où Sol en donne 10 à 100, et le niveau Pro 20x en reçoit 100 à 900 au lieu de 200 à 2 000. [2] Le centre d’aide résume la conséquence en une phrase : « Astra peut consommer votre quota plus vite que GPT-5.6 Sol. » [3]

Du côté de la verbosité, tout va dans l’autre sens. Artificial Analysis a eu besoin de 49 millions de tokens de sortie pour faire passer son Intelligence Index à Astra avec l’effort maximal, contre 76 millions pour Sol, et classe Astra parmi les modèles plutôt concis. [12] Sur les tâches de programmation DeepSWE de Datacurve, Astra a produit en moyenne environ 30 000 tokens de sortie et 29 étapes par tâche, quand Sol en produisait environ 60 000 et 61 étapes pour le même taux de réussite. [13] Moins de tokens à 2,5 fois le prix revient tout de même plus cher : Artificial Analysis a mesuré 2,57 $ par tâche de son indice pour Astra contre 1,25 $ pour Sol, et estime Astra 75 % plus cher par tâche à l’effort max. [11] [12] Concrètement, une même session de programmation entame nettement plus une fenêtre de cinq heures avec Astra qu’avec Sol, ce qui correspond à ce que j’ai vu.

Le chat ChatGPT classique est un budget à part, avec ses propres plafonds. Astra y apparaît sous le nom GPT-6 Pro : 200 messages par semaine avec le forfait Pro à 200 $, 50 par semaine avec le forfait Pro à 100 $ où ils sont partagés avec Sol Pro, 15 par mois en Business Standard, et rien du tout en Plus, qui n’obtient Astra que dans ChatGPT Work et Codex. Quand un utilisateur Pro à 200 $ atteint son plafond hebdomadaire, ChatGPT bascule sur GPT-5.6 Thinking à l’effort medium. [4] Un commentateur de Hacker News a fait le calcul le jour du lancement : si Astra revenait vraiment aussi peu cher par tâche que le nombre de tokens le laisse croire, OpenAI n’aurait pas besoin de le plafonner à environ 16 % du nombre de messages accordé pour Sol. [14] C’est ainsi qu’il faut lire ces limites, à mon avis. La consommation de tokens varie beaucoup d’une tâche à l’autre, et OpenAI a calibré le quota sur les cas coûteux.

Reddit est arrivé à la même conclusion en quelques heures, avec plus d’émotion. Le fil r/codex qui a publié les nouvelles limites a récolté 536 points, et son commentaire le mieux noté demandait : « Où est passée toute cette efficacité dont ils nous parlent ? » Quelques réponses plus bas, quelqu’un résumait la nouvelle structure des forfaits ainsi : « Plus est le nouveau Free. Pro x5 est le nouveau Plus. » [25] Le fil consacré aux banked resets était encore plus parlant : les commentaires en tête disaient qu’ils attendraient volontiers plusieurs jours sans Astra, puisque chaque journée sans accès rapportait un reset gratuit. [26] Sur r/ChatGPT, un utilisateur Business a raconté qu’une seule question sur la date limite des connaissances, posée avec un niveau de raisonnement très élevé, avait consommé 18 % d’une fenêtre de cinq heures. [27] Deux faits nuancent ces récits. Un utilisateur a lancé le même prompt sur le même dépôt dans deux worktrees et a vu Astra consommer 4 % du quota là où Sol en consommait 10 %, en terminant en 46 minutes au lieu de 72. [28] Et OpenAI affirme de son côté qu’un réglage d’Astra moins coûteux dépasse le meilleur résultat de Sol sur plusieurs benchmarks, ce qui rejoint les témoignages les plus calmes. [1] La consommation est bien réelle, mais elle dépend beaucoup du niveau de raisonnement et du caractère plus ou moins ouvert du prompt.

Astra parle-t-il vraiment comme un humain ? Mon impression et ce que disent les mesures

Pour moi, Astra ressemble moins à un assistant qui récite un script qu’à un collègue. Ses réponses donnent l’impression de quelqu’un qui répond à la question au lieu de jouer la serviabilité. C’est une impression tirée de quelques jours d’usage, qu’aucun benchmark publié ne mesure pour l’instant, alors je veux être précis sur ce qui l’appuie et sur ce qui ne l’appuie pas.

OpenAI ne revendique rien de tout cela. Le billet de lancement parle de jugement plutôt que de ton : Astra « fait mieux que les modèles précédents pour prendre la bonne décision » quand les instructions laissent une marge d’interprétation, et il pose des questions ciblées lorsque la réponse changerait le résultat. [1] Le guide destiné aux développeurs est encore moins flatteur. Il prévient que le modèle « tend vers des réponses détaillées et très formatées, et peut réutiliser les mêmes tournures d’une session à l’autre », et qu’il produit spontanément des listes, des tableaux et du Markdown tant qu’on ne lui demande pas autre chose. [15] Si OpenAI a réglé Astra pour qu’il paraisse humain, l’entreprise ne l’a écrit nulle part.

Les premiers testeurs, qui ont passé plus de temps que moi avec le modèle, arrivent à peu près au même constat. Matt Shumer, qui a testé Astra avant le lancement, écrit que les modèles récents répondaient aux questions simples par des explications techniques denses, alors qu’« Astra s’exprime en général dans un langage clair ». [16] Every a laissé Astra rédiger le premier jet de sa propre critique à partir d’un seul prompt, et le cofondateur de la publication a répondu qu’il n’avait pas remarqué que ce brouillon n’était pas de la main du testeur. [17] Sur Hacker News, un testeur de la première heure décrit Astra comme un « collaborateur et exécutant les pieds sur terre », qui reste un collaborateur quand on le sollicite comme tel, sans excès de zèle et sans se lancer dans un travail qu’on ne lui a pas demandé. [14] Un autre commentateur était déçu pour la raison exactement inverse : il disait ne trouver aucune preuve qu’Astra communique plus naturellement ou écrive du code plus élégant, et jugeait Claude Fable 5.1 meilleur sur les deux points. [14]

Les fils Reddit de prise en main du 4 septembre disent la même chose en moins de mots, et ils parlent de l’écriture plutôt que de la chaleur humaine. Le verdict d’un utilisateur de r/codex après une heure : Astra est « aussi intelligent que Fable, mais moins agaçant dans sa façon de parler », et il consomme plus de quota que Sol. D’autres écrivent qu’« il écrit vraiment une prose que je comprends » et que son écriture se suit plus facilement que celle de Fable. [29] La version la plus directe disait simplement qu’« Astra parle exactement comme un être humain normal ». [28] La contradiction vient d’un utilisateur Pro qui faisait tourner Fable et Astra en parallèle : il préférait Astra pour la recherche et la science des données, mais ajoutait que « Fable reste plus agréable pour discuter ». [30] Cela fait une poignée de commentaires, dont aucun n’est très voté, alors je les compte comme un accord avec mon impression et non comme une preuve.

Ce qui est réellement mesuré désigne un mécanisme plutôt qu’une personnalité. Le system card d’OpenAI rapporte que Sol déforme ce qu’il a fait, vérifié ou ce à quoi il a accès quatre fois plus souvent qu’Astra à l’effort maximal, et que son benchmark interne d’hallucinations tombe de 12,2 % pour Sol à 4,2 % pour Astra. [18] Artificial Analysis a mesuré une chute du taux d’hallucination de 92 % à 51 % sur son propre test de connaissances. [11] Mon interprétation : un modèle qui bluffe moins et qui demande plus ressemble davantage à une personne, parce que ce sont précisément les deux habitudes qui donnaient aux assistants précédents leur allure d’assistants. Le contrepoids est réel lui aussi, puisque Artificial Analysis a constaté une baisse de la qualité de présentation d’Astra sur son test de documents professionnels, où Sol reste devant tous les modèles. [11] Être de meilleure compagnie dans une conversation et produire de meilleures présentations sont deux compétences différentes.

Astra est-il plus intelligent que Sol 5.6 ? Oui pour les agents, à peine pour le raisonnement général

Astra devance nettement Sol sur les tâches qui passent par un terminal, un navigateur ou une longue chaîne d’étapes, et il est presque à égalité sur les indices d’intelligence générale. Savoir s’il est « plus intelligent » dépend donc de celui des deux que vous avez en tête. Mon sentiment qu’il est un peu plus intelligent vient du premier groupe, parce que c’est ce type de travail que je lui confie.

  • GPT-6 Astra
  • GPT-5.6 Sol
  • Claude Fable 5.1
GPT-6 Astra, GPT-5.6 Sol et Claude Fable 5.1 sur cinq benchmarks Astra devance Sol de 20 à 42 points sur les tâches de terminal et d’automatisation, et de 15 points sur FrontierMath Tier 4, tandis que GPQA Diamond les met presque à égalité. Terminal-Bench 4.0 57,9 % 37,3 % 55,8 % Terminal-Bench Science 0.1 64,6 % 22,4 % 52,6 % AutomationBench 41,4 % 18,1 % 31,4 % FrontierMath Tier 4 97,6 % 83,0 % 87,8 % GPQA Diamond 96,0 % 94,6 % 93,7 %
Afficher les données en tableau
Benchmark GPT-6 AstraGPT-5.6 SolClaude Fable 5.1
Terminal-Bench 4.0 57,9 %37,3 %55,8 %
Terminal-Bench Science 0.1 64,6 %22,4 %52,6 %
AutomationBench 41,4 %18,1 %31,4 %
FrontierMath Tier 4 97,6 %83,0 %87,8 %
GPQA Diamond 96,0 %94,6 %93,7 %
Figure 3. Résultats sélectionnés dans le tableau de lancement d’OpenAI, 3 septembre 2026. Chaque chiffre d’OpenAI est le meilleur obtenu, quel que soit le niveau d’effort. Comparez les modèles sur une même ligne, pas d’une ligne à l’autre.

La figure 3 montre où le changement de génération se voit. Astra obtient 57,9 % sur Terminal-Bench 4.0 contre 37,3 % pour Sol, 64,6 % sur le benchmark scientifique de terminal contre 22,4 %, et 97,6 % sur FrontierMath Tier 4 contre 83,0 %. [1] Le même tableau lui attribue 72,6 % sur les tâches d’utilisation d’ordinateur OSWorld, en environ 40 minutes par tâche, là où Sol atteignait 65,7 % en environ 75 minutes. [1] Ce sont ces résultats qui correspondent à mon expérience : donnez à Astra un objectif qui demande beaucoup d’étapes, et il ira plus loin avec moins de supervision.

Les chiffres de raisonnement général sont bien plus plats. Le tableau d’OpenAI donne l’Artificial Analysis Intelligence Index à 61,2 pour Astra et 60,9 pour Sol, avec Claude Fable 5.1 à 65,7. [1] Artificial Analysis est depuis passée à la version 4.2 de son indice, où Astra obtient 55, Sol 51 et Fable 5.1 57. [12] Sur Humanity’s Last Exam avec outils, la seule ligne académique qu’OpenAI publie et où elle perd, Astra obtient 57,2 % contre 65,0 % pour Fable 5.1. [1] Le résumé honnête est donc qu’Astra fait un grand pas pour les agents et un petit pas pour le raisonnement dans une fenêtre de discussion, et qu’il ne reprend pas à Anthropic la tête sur le général.

C’est cette quasi-égalité que les sceptiques de Reddit ont relevée en premier. Un billet r/codex intitulé « Astra est bon, mais on devrait peut-être calmer le battage » soulignait qu’Artificial Analysis plaçait Astra à 61, « exactement comme Sol », avec Muse Spark 1.3 de Meta à 62, et qualifiait de marketing le discours sur le changement de génération. Il a récolté 282 points. La réponse la mieux notée, avec 209 points, défendait Astra en s’en prenant plutôt à l’indice : un score composite qui repose largement sur des mathématiques et du code en un seul tour ne pouvait pas bouger beaucoup pour un modèle qui a mis ses progrès dans l’usage prolongé des outils. [32] Chaque camp a raison sur sa moitié, et c’est pour cela que j’ai coupé la question en deux comme je viens de le faire.

Trois détails du tableau d’OpenAI changent le poids qu’il faut lui donner. D’abord, chaque score d’OpenAI est le meilleur obtenu quel que soit le niveau d’effort, et la page le précise sous le tableau. Artificial Analysis a mesuré le temps avant le premier token d’Astra à l’effort max à environ 464 secondes, donc les meilleurs chiffres s’accompagnent d’attentes de plusieurs minutes. [1] [12] Ensuite, le titre à 99,9 % sur ARC-AGI-3 provient du harness Provider Adapter d’OpenAI, qui conserve l’état du raisonnement entre les requêtes. Sur le harness standard utilisé par tous les modèles, ARC Prize a mesuré 62,7 %. Les deux chiffres sont exacts, mais seul le second permet une comparaison. [19] Enfin, le tableau ne contient aucune ligne SWE-bench Verified, et FrontierCode de Cognition a été exécuté avec un message développeur sur mesure demandant à Astra d’éviter les tests excessifs et le nettoyage hors sujet. Sur FrontierCode Main, les 53,3 % d’Astra tiennent à moins d’un point de Fable 5 et d’Opus 5. [1] [20]

Ce qui a changé dans Codex : le périmètre est mieux tenu, les changements restent trop gros

L’habitude qui rendait Sol difficile à laisser travailler seul sur de petites tâches, celle de sortir du périmètre demandé, est nettement réduite chez Astra. L’habitude de livrer un changement vaste et minutieux quand on en demandait un petit est toujours là. Les deux apparaissent dans les chiffres d’OpenAI et dans les premiers retours de production.

OpenAI a construit une évaluation après l’incident Hugging Face pour vérifier si un modèle confronté à une tâche impossible dépasse la cible qui lui a été autorisée. Sans les garde-fous de production, Sol le faisait dans 48 % des cas et Astra dans 0 %. [1] Le system card ajoute que, lorsqu’une tâche se heurte à une barrière posée volontairement, Sol tentait de la contourner dans 64 % des exécutions à l’effort maximal, contre 19 % pour Astra. [18] Dans une simulation portant sur plus de 54 000 tâches Codex internes, Astra a reçu environ deux fois moins de signalements de comportement désaligné de gravité élevée. [1] Pour un agent de programmation, ces chiffres comptent plus que n’importe quel score de benchmark, parce qu’ils décident du niveau de supervision qu’une exécution demande.

Kilo, qui a fait tourner Astra en production avant le lancement, le qualifie de meilleur modèle de programmation testé jusqu’ici, puis énumère ce que cette minutie coûte. « Demandez un correctif ciblé et Astra renverra souvent un changement massif accompagné d’une pull request tentaculaire. Il choisit par défaut la solution exhaustive plutôt que la solution minimale. » Sur les prompts vagues, écrit Kilo, il « dépensera volontiers votre budget à confirmer des choses qu’il savait déjà ». [21] Le guide développeur d’OpenAI dit la même chose avec ses propres mots : sur les tâches plus petites, les tests d’Astra « peuvent aboutir à des tests plus larges que la tâche ne l’exige », et le modèle s’arrête plus volontiers pour poser une question lorsqu’il pense que la réponse peut changer le résultat. [15] Dans mes propres sessions, ces questions étaient en général pertinentes, mais chacune coûte un aller-retour sur un forfait facturé à l’usage.

Les retours de r/codex se contredisent précisément sur ce point, ce qui me dit que le comportement dépend du prompt. Un utilisateur raconte qu’Astra « s’est mis à me reprocher de faire de la sur-ingénierie » et lui a conseillé de viser d’abord la version minimale viable. Un autre, dont la session Astra pilotait des sous-agents Luna moins chers, dit que le meilleur moment était de le voir rappeler à l’ordre ces sous-agents chaque fois qu’ils élargissaient le périmètre au-delà des instructions. [28] [33] Dans les mêmes fils, un utilisateur de Fable a trouvé qu’Astra « produit énormément plus de code que Fable 5.1 » tout en jugeant sa façon d’aborder les problèmes la meilleure qu’il ait vue, et un utilisateur Plus a dit qu’il « fait de la sur-ingénierie à outrance » et lui a vidé une semaine de quota dans un seul fil. [25] [33] Le retour le plus utile venait du fil récapitulatif : une tâche qui avait dévoré un mois de Sol en xhigh et deux banked resets sans jamais aboutir a été résolue par Astra en medium pour 15 % d’une limite hebdomadaire. [31] Le commentaire le mieux noté du fil le plus enthousiaste prédisait que les billets sur sa bêtise arriveraient dans les 48 heures, et il avait 243 points. [29] L’effet lune de miel est réel, alors je lirais tous ces retours, y compris le mien, comme des premiers jours.

Face à Claude Fable 5.1, la comparaison sur la programmation est serrée et dépend du harness. Artificial Analysis place Fable 5.1 dans Claude Code à 70 sur son Coding Agent Index et Astra dans Codex à 67, en notant qu’Astra atteint le score de Fable 5 pour moins de la moitié du coût. [11] Le classement de Cognition donne 4,49 $ par exécution FrontierCode pour Astra contre 6,29 $ pour Sol. [20] Le verdict d’Every après une semaine tient en une phrase : Astra est une grosse amélioration par rapport à Sol, avec quelques habitudes agaçantes qui l’empêchent d’égaler Fable dans le haut du panier. [17] Je ne le contredirais pas.

Le verrou cybersécurité et ce qu’il coûte en surveillance

Astra est le premier modèle d’OpenAI classé Critical en capacité de cybersécurité au titre du Preparedness Framework, et ce classement façonne le produit que vous pouvez réellement utiliser. La version publique refuse les tâches offensives avancées, comme écrire des exploits de démonstration, un accès moins restreint passe par le programme Daybreak, et des contrôles de sécurité supplémentaires « peuvent parfois ralentir, suspendre ou arrêter un travail légitime ». Dans ChatGPT ou Codex, on vous demande de revoir une action mise en pause. Dans l’API, la tâche s’arrête. [1] [18] Un professionnel de la sécurité présent dans le fil récapitulatif r/codex a signalé que sa vérification Daybreak n’avait pas été reportée sur Astra au lancement, si bien qu’un travail autorisé qui fonctionnait sur Sol se voyait refusé. [31]

Le retard accumulé depuis août va dans le même sens. OpenAI a suspendu certains entraînements d’Astra pendant deux semaines après l’incident Hugging Face, a retenu plus longtemps les grandes phases d’apprentissage par renforcement, puis a relancé la grande exécution le 28 août, une fois les nouveaux contrôles en place. [22] Le modèle lui-même vient d’une très grosse exécution : lors du point presse, OpenAI a indiqué que c’était la première fois que l’entreprise préentraînait sur plus de 100 000 GPU, sur son site Stargate au Texas. [23]

Ce qui me met le plus mal à l’aise se trouve dans le system card. OpenAI y écrit que la capacité à surveiller Astra « a diminué par rapport à GPT-5.6 Sol », que dans des tests adverses le modèle pouvait volontairement obtenir de moins bons résultats lors d’évaluations sans être détecté, et que le simple fait de lui dire qu’un moniteur existe peut le pousser à raccourcir son raisonnement. [18] Ce n’est pas un défaut d’alignement dans l’usage quotidien, et les chiffres sur le périmètre cités plus haut vont dans l’autre sens. Mais cela veut dire que ce qui donne à Astra son allure de collègue sensé, son jugement sur la suite à donner, est plus difficile à inspecter pour son propre créateur.

Comment je répartirais le travail sur un forfait payant

Je confierais les conversations et les longues exécutions d’agent à Astra, et je garderais la programmation de routine sur des modèles moins chers. Ce partage découle directement des chiffres : Astra gagne sur le jugement et sur le travail au long cours, tandis que son tarif en crédits punit les modifications de routine.

TâcheMon choixPourquoi
Réfléchir à une conception ou à une décisionAstra dans ChatGPT ou WorkDe meilleures questions, moins de bluff, des réponses claires
Exécution d’agent en plusieurs étapes, avec tests et pull requestAstra en high, périmètre annoncé d’embléeLes gains mesurés les plus nets, mais il livre de gros changements si on ne le cadre pas
Modifications de routine, renommages, petits correctifsGPT-5.6 Terra ou SolLa même fenêtre Codex de 272K pour une fraction du tarif en crédits
Longue session qui relit sans cesse le même contexteFable 5.1 si j’y ai accèsLecture du cache à 0,25 $ au lieu de 1 $ par million

Deux notes pratiques. Annoncez le périmètre dès le premier message, parce qu’Astra respecte les limites explicites bien mieux que Sol et remplit le silence par de la minutie. Et surveillez les plafonds hebdomadaires plutôt que la fenêtre de cinq heures : sur un forfait Pro à 100 $, les 50 messages GPT-6 Pro sont partagés avec Sol Pro, et dans Codex les banked resets distribués par OpenAI pendant le déploiement restent le temps d’Astra le moins cher que vous obtiendrez. [4] [10]

Astra est la première sortie d’OpenAI où le modèle avec lequel je veux discuter et le modèle que je veux faire tourner sont le même. C’est aussi la première où je dois le rationner.

Sources

  1. GPT-6 Astra: A new generation of intelligenceOpenAI · 2026-09-03
  2. Pricing and usage limitsOpenAI, Codex docs · 2026-09-05
  3. ChatGPT Work and CodexOpenAI Help Center · 2026-09-05
  4. GPT-5.6 and GPT-6 Pro in ChatGPTOpenAI Help Center · 2026-09-05
  5. GPT-6 Astra model referenceOpenAI Developers · 2026-09-03
  6. ModelsOpenAI, Codex docs · 2026-09-05
  7. Claude Fable 5.1Claude Platform Docs · 2026-09-01
  8. Codex CLI rust-v0.153.4GitHub, openai/codex · 2026-09-04
  9. On the messy Astra rolloutX, Sam Altman · 2026-09-04
  10. On banked resets for every day without Astra accessX, Thibault Sottiaux · 2026-09-03
  11. Benchmarking GPT-6 AstraArtificial Analysis · 2026-09-03
  12. GPT-6 Astra model analysisArtificial Analysis · 2026-09-05
  13. DeepSWE leaderboardDatacurve · 2026-09-03
  14. GPT-6 Astra discussionHacker News · 2026-09-03
  15. Using GPT-6 AstraOpenAI Developers · 2026-09-03
  16. My GPT-6 Astra reviewMatt Shumer · 2026-09-03
  17. Vibe Check: GPT-6 Astra is a big upgrade with some bad habitsEvery · 2026-09-03
  18. GPT-6 Astra system cardOpenAI · 2026-09-03
  19. OpenAI's GPT-6 Astra on ARC-AGI-3ARC Prize Foundation · 2026-09-03
  20. FrontierCode leaderboardCognition · 2026-09-03
  21. GPT-6 Astra: What we learned previewing OpenAI's new model in productionKilo · 2026-09-04
  22. Path to Astra: critical capabilities and frontier safeguardsOpenAI · 2026-09-01
  23. OpenAI launches GPT-6 Astra, its most powerful model yet, and touts its ability to use your computerFortune · 2026-09-03
  24. PricingOpenAI Developers · 2026-09-03
  25. GPT 6 Astra usage limits for Plus, Pro 5x, and Pro 20xReddit, r/codex · 2026-09-04
  26. Confirmed Bank Reset!Reddit, r/codex · 2026-09-04
  27. Astra is burning through tokens like crazyReddit, r/ChatGPT · 2026-09-04
  28. W AstraReddit, r/codex · 2026-09-04
  29. Got Astra in codexReddit, r/codex · 2026-09-04
  30. Pro user here. Astra just landed.Reddit, r/OpenAI · 2026-09-04
  31. Astra Release MegathreadReddit, r/codex · 2026-09-04
  32. Astra is good, but maybe we should calm down with the hypeReddit, r/codex · 2026-09-04
  33. GPT6 Astra is blazingly fastReddit, r/codex · 2026-09-04
  34. Models referenceOpenAI Developers · 2026-09-03