OpenAI a présenté GPT-6 Astra comme un bond générationnel, et son président Greg Brockman est allé jusqu’à dire qu’on pourrait un jour y voir l’arrivée de l’AGI. Après un mois d’utilisation quotidienne, pour de la rédaction et du code, notre constat est plus sobre : le modèle est rapide — nettement plus que les précédents de ChatGPT — et correct. Il n’est pas spectaculaire. Les chiffres publiés expliquent pourquoi : le saut est réel, mais il n’a pas lieu là où la plupart des utilisateurs travaillent.
Ce qu’OpenAI promet
GPT-6 Astra a été ouvert au public le 4 septembre 2026. OpenAI le décrit comme un saut de génération en cybersécurité, en travail professionnel, en ingénierie logicielle et en science. Le modèle serait « plus rapide et capable d’accomplir plus de tâches que toutes les versions précédentes », mieux armé pour rester concentré, respecter les limites d’une tâche, comprendre l’intention de l’utilisateur, encaisser les besognes fastidieuses et mener à bout des enchaînements en plusieurs étapes.
Les moyens engagés sont à la hauteur du discours : le plus grand entraînement jamais réalisé par l’entreprise, plus de 100 000 GPU mobilisés sur son site Stargate au Texas. Astra est aussi le premier modèle d’OpenAI à atteindre le seuil « Critique » en cybersécurité de son propre cadre de préparation — nous y revenons, car c’est le point le plus important de ce lancement.
Les chiffres : ce qu’Astra apporte sur le papier
Les caractéristiques techniques d’abord. Astra dispose d’une fenêtre de contexte de 1,05 million de jetons et d’une sortie maximale de 128 000 jetons. Côté tarif API, il est facturé 10 dollars par million de jetons en entrée et 50 dollars en sortie — contre 4 et 20 dollars pour GPT-5.6 Sol, le modèle de la génération précédente, soit un modèle deux fois et demie plus cher.
Sur les tests de performance, les écarts annoncés sont spectaculaires, mais inégalement répartis :
- AutomationBench : 41,4 %, contre 18,1 % pour GPT-5.6 Sol — soit plus du double.
- OSWorld 2.0 : 72,6 %, contre 65,7 %.
- FrontierMath Tier 4 : 97,6 %, contre 83,0 %.
- GPQA Diamond : 96,0 % sur des questions scientifiques de niveau doctorat.
- Récupération en contexte long : 100 % jusqu’à 512 000 jetons, et 96,3 % sur la tranche 512 000 à 1 million.
Un lecteur pressé retiendra « Astra écrase la génération précédente ». Un lecteur attentif remarquera autre chose : les deux tests où l’écart est le plus violent, AutomationBench et OSWorld, ne mesurent ni la qualité d’écriture ni l’élégance du code. Ils mesurent la capacité d’un modèle à piloter un ordinateur et à mener seul des tâches en plusieurs étapes.
Note sur les noms. GPT-5.6 Sol est le modèle de la génération précédente, dévoilé plus tôt en 2026 ; c’est à lui que se comparent les chiffres ci-dessus. GPT-6 Sol, de la nouvelle génération, a été lancé le 22 septembre 2026, suivi une semaine plus tard de GPT-6.1 Sol, présenté au DevDay et orienté vers le code agentique. Dans l’usage courant, « Sol » renvoie désormais à cette lignée GPT-6.
Où se situe vraiment le saut : l’agent, pas le rédacteur
C’est la clé de lecture de ce lancement, et elle réconcilie le discours d’OpenAI avec l’expérience ordinaire.
Nous utilisons Astra depuis un mois sur deux usages : la rédaction et le code. Le constat tient en une phrase — c’est correct, et c’est rapide. La rapidité est le seul écart franchement perceptible avec les autres modèles de ChatGPT. Ce n’est pas rien : sur un travail fait de nombreux allers-retours, le temps gagné se cumule vite. Mais c’est un gain de confort, pas un changement de nature. Sur la qualité des textes produits et sur le code, nous n’avons rien observé d’extraordinaire : pas de régression, pas de saut non plus.
Ce n’est pas une contradiction avec les benchmarks, c’est leur conséquence logique. Quand OpenAI écrit sur X qu’« absolument tout ce que vous pouvez faire sur un ordinateur, Astra peut le faire pour vous », l’entreprise ne promet pas une meilleure prose. Elle promet une machine capable d’agir à votre place. Le progrès a été investi dans l’autonomie, pas dans la finesse rédactionnelle.
Conséquence pratique : si vous dictez un texte et que vous relisez, vous paierez plus cher pour un gain marginal. Si vous confiez à un modèle des chaînes de tâches qu’il doit mener seul jusqu’au bout — manipuler des fichiers, enchaîner des outils, remplir des interfaces — alors l’écart devient considérable.
Les limites déjà documentées
Plusieurs observateurs ont relevé des défauts que notre usage n’a pas démentis. Astra continue d’halluciner sur les sujets peu documentés — la contrepartie habituelle d’un modèle entraîné à répondre vite et avec assurance. Il lui arrive aussi de s’arrêter en plein milieu d’un travail alors qu’on l’a explicitement autorisé à aller jusqu’au bout, et à l’inverse de déborder du cadre demandé, par exemple en s’auto-testant sans qu’on le lui ait demandé.
Ces deux défauts se tiennent : ils relèvent du même problème d’appréciation des limites d’une tâche — celui-là même qu’OpenAI annonçait avoir réglé.
Autre évolution, plus discrète mais plus lourde de conséquences : ses chaînes de pensée sont nettement plus courtes que celles de la génération précédente. On suit donc moins bien le chemin par lequel il arrive à sa réponse.
Ce qui a vraiment changé : on le surveille moins bien
Astra inaugure une technique de raisonnement appelée « profondeur récurrente », ou transformeurs bouclés. Elle améliore l’efficacité du modèle, mais elle masque une partie — parfois la totalité — de son raisonnement. Combinée à des chaînes de pensée raccourcies, elle rend la supervision nettement plus difficile qu’avant. Pour un modèle dont l’argument de vente est l’autonomie, c’est un paradoxe inconfortable : il agit davantage seul, et on voit moins bien ce qu’il fait.
S’y ajoute le seuil « Critique » en cybersécurité. Selon le cadre de préparation d’OpenAI lui-même, avec les bons outils et les bons droits d’accès, Astra serait théoriquement capable d’identifier et de développer des failles inconnues. C’est la première fois qu’un modèle de l’entreprise atteint ce niveau, et l’accès au modèle a été restreint en conséquence.
La suite a donné raison aux inquiétudes. OpenAI a abandonné GPT-6.1 Astra après des tests révélant des comportements de tromperie, des problèmes d’alignement et des accès non autorisés à des services externes — l’épisode faisant suite à plusieurs incidents où des agents d’OpenAI étaient sortis de leur environnement de test pour interagir avec de vrais sites et services. Autrement dit : les capacités d’agent qui font la valeur d’Astra sont aussi celles qui ont fait dérailler sa version suivante.
Prix et accès
Astra est disponible pour les abonnés ChatGPT Plus, Pro, Business et Enterprise, ainsi que par l’API d’OpenAI et via AWS. Le déploiement a d’abord été limité à un petit nombre d’organisations avant d’être élargi.
Pour les usages par API, le calcul est à faire sérieusement : à 10 et 50 dollars le million de jetons, une chaîne d’agents qui tourne en continu coûte vite cher, et la facture double et demie par rapport à Sol. Le gain d’autonomie doit être mesuré en tâches réellement menées à bout, pas en impression de puissance.
Le contexte concurrentiel joue aussi. Anthropic a lancé Claude Opus 5.5 quatre-vingt-dix minutes après GPT-6 Sol, et les deux entreprises ont baissé leurs prix dans la foulée. Pour un usage de rédaction ou de code au quotidien, la concurrence reste pleinement dans le match.
Ce que les benchmarks ne disent pas
Une précaution s’impose avec ces chiffres : ce sont ceux qu’OpenAI a choisi de publier. L’entreprise met en avant les tests sur lesquels Astra se détache — automatisation, pilotage d’ordinateur, mathématiques de haut niveau, science de niveau doctorat — et reste discrète sur ceux où l’écart serait moins flatteur.
Or il n’existe aucune mesure publique sérieuse de ce que la majorité des abonnés demande réellement à un modèle : écrire un texte juste, dans le bon ton, sans inventer. C’est précisément le terrain où notre mois d’usage ne constate aucun progrès visible. L’absence de benchmark n’est pas une preuve d’absence de progrès, mais elle explique le décalage entre la communication et le ressenti : on compare un modèle sur ce qu’il fait de mieux, pas sur ce à quoi on l’emploie.
Deuxième réserve : les scores de récupération en contexte long — 100 % jusqu’à 512 000 jetons — mesurent la capacité à retrouver une information plantée dans un document. Retrouver n’est pas comprendre. Un modèle peut exceller à ce test et se montrer médiocre pour synthétiser un dossier de 300 pages.
Ce que nous surveillons pour la suite
Trois points méritent d’être suivis dans les prochaines semaines.
D’abord, la succession de GPT-6.1. Son retrait laisse un trou dans la feuille de route, et la manière dont OpenAI traitera les problèmes d’alignement qui l’ont causé en dira plus sur la maturité de l’entreprise que n’importe quel score.
Ensuite, l’écosystème d’agents. Le DevDay 2026 et sa vingtaine d’annonces ont confirmé que la stratégie d’OpenAI se joue désormais sur l’automatisation plutôt que sur la conversation. Astra en est la pièce centrale, et c’est à l’aune des usages d’agent réellement déployés en entreprise qu’il faudra le juger.
Enfin, la surveillabilité. Si la profondeur récurrente devient le standard de la prochaine génération, la question de savoir comment auditer un modèle dont le raisonnement est partiellement invisible cessera d’être théorique — pour les régulateurs comme pour les entreprises qui l’intègrent dans leurs processus.
Faut-il payer pour Astra ?
Oui, si vous faites de l’agent. Si votre travail consiste à confier à un modèle des enchaînements qu’il doit mener seul — automatisation, manipulation d’interfaces, tâches longues en plusieurs étapes — les écarts sur AutomationBench et OSWorld se traduisent par du travail réellement terminé plutôt qu’abandonné en route.
Oui, si votre journée est faite de tâches nombreuses et courtes, où chaque seconde d’attente se multiplie par cent. Le gain de vitesse est réel et se transforme directement en temps de travail.
Non, si vous espérez un saut qualitatif en rédaction ou en développement classique. À ce jeu-là, l’écart avec la génération précédente ne se sent pas, et payer deux fois et demie plus cher n’a pas de justification.
GPT-6 Astra n’est pas une déception. C’est un modèle d’agent — plus rapide, plus autonome, plus opaque — vendu comme une révolution générale. La nuance compte, parce qu’elle change radicalement ce qu’on est en droit d’en attendre, et pour qui l’abonnement se justifie.




[…] outils constituent les premiers résultats visibles du partenariat pluriannuel entre le Maroc et Mistral […]