GPT-6.1 Sol au DevDay : presque Astra, au prix de Sol

GPT-6.1 Sol au DevDay : presque Astra, au prix de Sol

Une semaine après le lancement de GPT‑6 Sol, OpenAI lui donne déjà un successeur. Présenté ce 29 septembre 2026 au DevDay, GPT‑6.1 Sol vise les travaux où un agent doit coder, parcourir des applications ou exploiter des documents professionnels pendant plusieurs étapes. La promesse est forte : s’approcher des résultats de GPT‑6 Astra pour un tarif standard cinq fois inférieur par token d’entrée et de sortie.

Le détail le plus révélateur est peut-être ailleurs. GPT‑6.1 Sol garde le prix de base de GPT‑6 Sol, soit 2 dollars par million de tokens en entrée et 10 dollars en sortie, mais divise par deux le coût des entrées déjà mises en cache. OpenAI cherche ainsi à améliorer le coût d’un travail terminé, pas seulement à afficher un nouveau classement de modèles.

Une version 6.1 qui change la hiérarchie des usages

GPT‑6 Sol, lancé le 22 septembre, occupait déjà la place intermédiaire entre Astra, le modèle phare, et Luna, conçu pour les tâches à grand volume. Avec la version 6.1, OpenAI annonce un rapprochement d’Astra sur plusieurs évaluations de programmation agentique, d’usage d’ordinateur et de travail documentaire. Il ne s’agit pas d’un simple changement de nom : les résultats publiés décrivent des écarts mesurables avec Sol.

Sur DeepSWE 1.1, un test de tâches longues dans de vrais dépôts logiciels, OpenAI affirme que GPT‑6.1 Sol rejoint Astra à environ un cinquième du coût par tâche. Son meilleur résultat dépasse celui de GPT‑6 Sol de 6,4 points, avec un réglage de raisonnement moins élevé. Sur l’ensemble hors ligne d’OSWorld 2.0, consacré aux actions dans des applications, l’avance sur Sol atteint 7 points au niveau maximal ; le nouveau modèle reste à 2,1 points d’Astra dans la comparaison publiée.

Les PDF professionnels deviennent un test central

OpenAI insiste aussi sur GDP.pdf, qui demande de répondre à partir de dossiers PDF complexes : tableaux, graphiques, schémas et petites lignes. Le fabricant indique que GPT‑6.1 Sol y surpasse Claude Opus 5.5 avec ses mécanismes de repli, pour moins de la moitié du coût par tâche dans les configurations testées. Sur AutomationBench, une évaluation de processus professionnels utilisant de nombreux outils, il annonce 4,8 points de plus que GPT‑6 Sol au même niveau d’effort.

Ces chiffres comptent pour les entreprises parce qu’un agent ne produit pas seulement une réponse : il doit retrouver la bonne information, choisir un outil, vérifier le résultat et parfois reprendre après une erreur. Un modèle qui réussit davantage en moins de tentatives peut coûter moins cher même si son tarif par token ne baisse pas. À l’inverse, un bon score moyen ne garantit pas la réussite sur les documents ou les logiciels propres à une organisation.

Le cache baisse, mais la facture dépend du travail réel

La fiche officielle de l’API fixe les tarifs standards de GPT‑6.1 Sol à 2 $ par million de tokens d’entrée, 10 $ en sortie et 0,10 $ pour les tokens d’entrée lus en cache. Le cache coûtait 0,20 $ avec GPT‑6 Sol. Il évite de refacturer au prix fort des instructions ou un contexte déjà traités lorsque des demandes successives réutilisent la même base.

Prenons un exemple fictif, uniquement pour lire cette grille tarifaire : cent requêtes qui réutilisent chacune 200 000 tokens en cache, ajoutent 10 000 tokens neufs et produisent 5 000 tokens de sortie. Aux tarifs standards, cela représenterait 9 $ avec GPT‑6.1 Sol, contre 11 $ avec GPT‑6 Sol. La partie mise en cache est deux fois moins chère ; la facture totale de cet exemple baisse d’environ 18 %, car l’entrée nouvelle et la sortie conservent le même prix.

Ce calcul ne comprend ni les appels d’outils, ni les différences de nombre de tokens réellement consommés, ni les tentatives supplémentaires. La fiche API précise aussi qu’au-delà de 272 000 tokens d’entrée, les tarifs d’entrée et de cache doublent et celui de sortie augmente de moitié pour toute la requête. La fenêtre de contexte annoncée de 1,05 million de tokens ne signifie donc pas que les très longs dossiers restent au tarif de base.

Disponible aujourd’hui, avec des frontières à connaître

OpenAI indique que GPT‑6.1 Sol est accessible dès le 29 septembre dans ChatGPT Work et Codex pour les abonnements Plus, Pro, Business, Enterprise et Edu, ainsi que dans l’API sous l’identifiant gpt-6.1-sol. L’annonce précise qu’il n’est pas encore disponible dans Chat, une distinction utile pour les lecteurs qui utilisent le chatbot classique. Une option Ultrafast est annoncée pour les jours suivants ; sa vitesse promise ne doit pas être confondue avec celle du modèle standard disponible aujourd’hui.

Pour les développeurs, la fiche API indique cinq niveaux d’effort de raisonnement, de low à max, et une fenêtre de contexte de 1,05 million de tokens. Les appels d’outils passent par la Responses API ; Chat Completions prend en charge le modèle sans appel d’outils. Une migration depuis GPT‑6 Sol doit donc être testée sur les tâches et les réglages réellement employés, plutôt que présumée transparente.

Des gains annoncés, encore à confronter aux usages

OpenAI rapporte une baisse de la part des réponses contenant une erreur factuelle, de 11,4 % à 7,7 % face à GPT‑6 Sol au niveau d’effort faible. Le jeu de test regroupe toutefois des conversations où des utilisateurs avaient déjà signalé une erreur : ces demandes difficiles ne représentent pas la fréquence ordinaire des erreurs. De même, les comparaisons de modèles peuvent changer selon les outils, les consignes et les niveaux d’effort retenus. OpenAI précise que ses évaluations ont été conduites dans son environnement de recherche ou via l’API, avec des résultats qui peuvent différer de ceux obtenus en production.

L’addendum de sécurité publié le même jour indique que GPT‑6.1 Sol reçoit le même ensemble de protections qu’Astra. OpenAI le classe au seuil « Critical » en capacités de cybersécurité et « High » pour les capacités biologiques et chimiques selon son propre cadre d’évaluation. Ces catégories décrivent des capacités qui appellent des garde-fous ; elles ne prouvent ni qu’un incident s’est produit, ni qu’un agent sera toujours sans erreur. Les tests de sécurité rapportés montrent des progrès sur plusieurs points, mais la carte rappelle aussi que les conditions d’évaluation diffèrent de l’usage quotidien.

Pour les équipes qui paient déjà GPT‑6 Sol, la question utile est désormais simple : sur leurs tâches à elles, combien de dossiers corrects, de correctifs acceptés ou de processus terminés obtiennent-elles par euro dépensé ? GPT‑6.1 Sol est une amélioration crédible sur le papier, surtout lorsque le contexte est souvent réutilisé. Astra conserve sa place pour les problèmes les plus difficiles, notamment dans les tests scientifiques cités par OpenAI. Le choix devra se décider sur un échantillon de travail réel, avec qualité, temps et coût mesurés ensemble.

Références

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Ce site utilise Akismet pour réduire les indésirables. Découvrez comment les données de vos commentaires sont traitées.