Ils sont arrivés le même jour, le 22 septembre 2026, et visent tous deux les développeurs et les équipes qui confient du travail complexe à des agents logiciels. GPT‑6 Sol, chez OpenAI, affiche un prix API deux fois inférieur à celui de Claude Opus 5.5, chez Anthropic, pour les tokens d’entrée et de sortie. Mais dans les tests indépendants réalisés à leur niveau d’effort maximal, Opus prend l’avantage sur plusieurs tâches de code et de travail professionnel. Le choix n’est donc pas un simple duel de prix affichés : il dépend de ce qu’un modèle termine correctement, du temps qu’il y passe et du nombre de tokens qu’il consomme.
Ce comparatif complète nos articles consacrés au lancement de GPT‑6 Sol et à l’arrivée de Claude Opus 5.5. Cette fois, les deux modèles sont placés face aux mêmes évaluations d’un tiers, avec leurs tarifs publics vérifiés auprès d’OpenAI et d’Anthropic.
À tarif égal de tokens, Sol part avec un net avantage
Les fiches officielles d’OpenAI et d’Anthropic donnent des repères simples pour l’API standard. Les prix ci-dessous sont en dollars par million de tokens ; un token est une petite unité de texte facturée lors de la lecture d’une demande ou de la production d’une réponse.
| Caractéristique | GPT‑6 Sol | Claude Opus 5.5 |
|---|---|---|
| Entrée API standard, jusqu’au seuil de contexte applicable | 2 $ | 4 $ |
| Sortie API standard | 10 $ | 20 $ |
| Lecture d’un préfixe en cache | 0,20 $ | 0,20 $ |
| Fenêtre de contexte annoncée | 1,05 million de tokens | 1 million de tokens |
| Sortie maximale annoncée | 128 000 tokens | 128 000 tokens |
Sur une demande fictive comportant 100 000 tokens d’entrée et 20 000 tokens de sortie, sans cache ni coût d’outil, la facture serait de 0,40 $ avec Sol contre 0,80 $ avec Opus 5.5. Ce calcul illustre le tarif unitaire ; il ne prédit pas combien de tokens chaque modèle utilisera réellement pour résoudre le même problème. Le prix des lectures de cache, lui, est identique, ce qui peut réduire l’écart dans les agents qui relisent souvent les mêmes instructions.
Une limite mérite d’être inscrite en marge du tableau : pour une requête dépassant 272 000 tokens d’entrée, OpenAI double les tarifs d’entrée et de cache de Sol et multiplie son tarif de sortie par 1,5 pour toute la requête. La fenêtre d’environ un million de tokens ne signifie donc pas qu’un très long dossier reste au prix de base. Les autres modes de traitement et plateformes ont aussi leurs propres conditions tarifaires.
Sur les tâches difficiles, Opus 5.5 marque davantage de points
Pour comparer la qualité sans juxtaposer deux présentations commerciales, nous avons retenu le comparatif d’Artificial Analysis. Le laboratoire indépendant teste ici Opus 5.5 en raisonnement adaptatif au niveau maximal et GPT‑6 Sol au niveau max. Son Intelligence Index version 4.3.2 combine dix évaluations, couvrant notamment les agents, le code, le raisonnement scientifique et des tâches générales. Ce score composite n’est ni un pourcentage de réussite universel ni une note pour la rédaction en français.
| Évaluation d’Artificial Analysis | Claude Opus 5.5, effort maximal | GPT‑6 Sol, effort maximal |
|---|---|---|
| Intelligence Index v4.3.2 | 58 | 48 |
| Terminal-Bench 4.0, tâches en ligne de commande | 60 % | 44 % |
| AutomationBench-AA, processus dans des applications | 70 % | 62 % |
| SciCode, problèmes de programmation scientifique | 67 % | 58 % |
| GDP.pdf, raisonnement sur documents | 26 % | 25 % |
Le signal le plus fort pour un développeur est l’écart de 16 points sur Terminal-Bench 4.0 dans ce protocole. Opus devance aussi Sol de 8 points sur les processus automatisés. En revanche, leur quasi-égalité sur GDP.pdf rappelle qu’une avance globale ne se retrouve pas dans chaque catégorie. Les chiffres publiés par Anthropic pour Terminal-Bench sont différents : ils proviennent d’un autre réglage et d’un autre environnement d’essai. Les mélanger avec ceux de ce tableau donnerait une comparaison trompeuse.
La méthodologie d’Artificial Analysis harmonise les consignes et les critères d’évaluation entre modèles, mais précise que l’indice reste principalement textuel et anglophone. La performance d’un agent dépend aussi de ses outils et de son environnement d’exécution. Anthropic indique par ailleurs que certaines requêtes sensibles peuvent être redirigées vers d’autres modèles par ses protections ; la configuration observée est donc celle d’un système déployé, pas toujours celle d’Opus seul. Ces éléments imposent de vérifier les résultats sur ses propres tâches avant d’en faire une règle générale.
Le prix d’une tâche ne suit pas le tarif par token
Le même laboratoire estime à 5,98 $ le coût moyen pondéré d’une tâche de son indice pour Opus 5.5 au niveau maximal, contre 1,06 $ pour Sol au niveau maximal. Opus revient ainsi à environ 5,6 fois le coût de Sol dans cette batterie de tests, alors que ses tarifs d’entrée et de sortie sont seulement doublés. La différence vient notamment du volume produit : Artificial Analysis relève environ 119 000 tokens de sortie par tâche pour Opus contre 31 000 pour Sol, dont une grande part est consacrée au raisonnement.
Ces sommes ne sont pas un devis pour « une tâche d’entreprise ». Il s’agit d’une moyenne construite sur les évaluations de l’indice. Elles montrent toutefois pourquoi choisir un modèle à partir de son seul prix catalogue peut coûter cher. Elles montrent aussi l’autre face du calcul : un modèle plus cher qui évite une erreur ou un second passage peut valoir son surcoût sur une migration logicielle délicate.
Le niveau d’effort déplace la frontière
Comparer uniquement les deux réglages maximaux écrase une option intéressante. Dans le tableau des différents niveaux d’effort, Opus 5.5 au niveau moyen obtient un indice de 51 pour 1,34 $ par tâche, contre 48 et 1,06 $ pour Sol au maximum. L’écart de qualité se resserre donc quand on rapproche les budgets. Les niveaux « moyen » et « maximum » ne correspondent toutefois pas à une quantité identique de calcul entre fournisseurs ; ce sont des réglages propres à chaque modèle.
Pour des opérations répétées, comme classer des tickets, extraire des champs ou exécuter de petites modifications contrôlées, Sol peut offrir une meilleure économie. Pour des travaux longs, ambigus ou coûteux à reprendre, les résultats d’Opus justifient un essai sérieux. La décision gagne à s’appuyer sur le coût par résultat accepté, le temps écoulé et les corrections humaines, plutôt que sur un seul score.
Le bon arbitre reste votre propre jeu de tâches
Une équipe peut construire un test court à partir de vrais dossiers : dix bugs représentatifs, quelques migrations de code, des documents professionnels et des automatisations avec des critères de réussite vérifiables. Il faut donner aux deux modèles les mêmes outils, mesurer plusieurs essais, inclure les échecs et compter les reprises humaines. Pour les agents, le contexte mis en cache, les appels aux outils et les niveaux d’effort doivent aussi être consignés.
À ce stade, les données racontent une histoire claire mais limitée : Claude Opus 5.5 est devant sur les tâches difficiles de l’indice indépendant consulté ; GPT‑6 Sol réduit fortement la facture de cette même évaluation. Le meilleur achat dépendra de la valeur d’un point de réussite supplémentaire dans votre travail. Si une erreur bloque une livraison, payer davantage peut être rationnel. Si des milliers de tâches simples doivent être traitées chaque jour, l’économie de Sol peut l’emporter.
Références
- OpenAI Developers, fiche et tarifs de GPT‑6 Sol.
- Anthropic, fiche de Claude Opus 5.5.
- Anthropic, annonce et résultats d’Opus 5.5.
- Artificial Analysis, comparaison GPT‑6 Sol / Claude Opus 5.5.
- Artificial Analysis, niveaux d’effort et coût par tâche.
- Artificial Analysis, méthodologie de l’indice.

