Retour a tous les articles
Benchmarks

GPT-5.6 Sol vs Claude Fable 5 vs Gemini 3.1 Pro sur SWE-Bench Pro

23 juillet 2026 · 24 min de lecture · Claude / GPT / Gemini

Une couverture éditoriale crème montrant trois colonnes de modèles abstraites, étiquetées conceptuellement par couleurs de famille, avec un terraco

Le chiffre qui change la présélection

Claude Fable 5 est le modèle à battre sur la ligne SWE-Bench Pro rapportée : 80,0 %. GPT-5.6 Sol est à 64,6 %. Gemini 3.1 Pro Preview est à 54,2 %. Ces trois chiffres proviennent du tableau de lancement de GPT-5.6 publié par OpenAI le 9 juillet 2026, dans la section Coding pour SWE-Bench Pro (OpenAI).

Cela représente un écart de 15,4 points entre Claude Fable 5 et GPT-5.6 Sol, et de 25,8 points entre Claude Fable 5 et Gemini 3.1 Pro Preview. Pour quelqu’un qui construit un agent de codage, c’est trop important pour être balayé d’un revers de main.

Mais la bonne lecture est plus nuancée que le titre. Il s’agit de codage agentique au niveau du dépôt. Ce n’est pas Terminal-Bench. Ce n’est pas le leaderboard d’Aider. Ce n’est pas un benchmark d’interface codée au feeling. Si votre produit applique des correctifs à de vrais dépôts, ouvre des fichiers, lance des tests, modifie plusieurs modules et doit survivre à des graphes de dépendances complexes, SWE-Bench Pro est plus proche de votre charge de travail que beaucoup de lignes de benchmark de codage génériques. Si votre produit consiste surtout en complétions de chat, extraits de code ou résolution d’énigmes en CLI, cette ligne n’est qu’un signal parmi d’autres.

Graphique à barres horizontales sur fond crème comparant les taux de résolution SWE-Bench Pro rapportés : Claude Fable 5 à 80,0 en terra

Le tableau comparatif

Voici la version épurée, en gardant la ligne de benchmark séparée des autres chiffres d’agents de codage.

Modèle Famille du fournisseur Score SWE-Bench Pro rapporté Source du score Prix API vérifié
Claude Fable 5 Claude 80,0 % Tableau GPT-5.6 d’OpenAI (OpenAI) 10 $ en entrée / 50 $ en sortie par 1 M de tokens (Anthropic)
GPT-5.6 Sol GPT 64,6 % Tableau GPT-5.6 d’OpenAI (OpenAI) 5 $ en entrée / 30 $ en sortie par 1 M de tokens (OpenAI)
Gemini 3.1 Pro Preview Gemini 54,2 % Tableau GPT-5.6 d’OpenAI (OpenAI) ; recoupé avec la model card Gemini 3.5 Flash de Google pour Gemini 3.1 Pro sur SWE-Bench Pro Public (Google DeepMind) 2 $ en entrée / 12 $ en sortie par 1 M de tokens pour les prompts jusqu’à 200k tokens, niveau standard (Google AI)

Le chiffre de Gemini est celui qui bénéficie du meilleur recoupement. La model card Gemini 3.5 Flash de Google liste des résultats « as of May, 2026 » et indique 54,2 % pour Gemini 3.1 Pro sur « SWE-Bench Pro (Public) » avec une configuration « Single attempt » (Google DeepMind). Le tableau de juillet d’OpenAI utilise « Gemini 3.1 Pro Preview » et le même chiffre de 54,2 %. Cela ne prouve pas que les paramètres du harness soient identiques dans les moindres détails, mais cela rend le score de Gemini moins suspect qu’une citation provenant d’un seul fournisseur.

Dans cette comparaison, le score de 80,0 % de Claude Fable 5 provient du tableau d’OpenAI plutôt que d’un tableau de benchmark d’Anthropic. La page Fable d’Anthropic reste utile pour le contexte de sortie et la tarification : Fable 5 est positionné pour les « tâches les plus difficiles de connaissance et de codage », utilise le nom d’API claude-fable-5, et coûte 10 $ par million de tokens en entrée et 50 $ par million de tokens en sortie (Anthropic). Anthropic indique également que Fable 5 et Mythos 5 ont été lancés le 9 juin, suspendus le 12 juin après une directive du gouvernement américain, puis rétablis dans le monde entier le 1er juillet après la levée des contrôles à l’exportation (Anthropic).

Ce que mesure réellement SWE-Bench Pro

SWE-Bench Pro a été conçu pour dépasser le plafond de l’ancien SWE-Bench Verified. Scale le décrit comme un benchmark pour des tâches de génie logiciel à horizon long dans des dépôts plus réalistes, avec 1 865 tâches au total réparties sur 41 dépôts : 731 publiques, 858 retenues en privé et 276 commerciales (Scale). L’ensemble public utilise des dépôts open source sous licences copyleft fortes ; le sous-ensemble privé utilise des bases de code propriétaires de startups.

La métrique principale est le taux de résolution. Une tâche est considérée comme résolue lorsque le patch soumis réussit les nouveaux tests fail-to-pass et ne casse pas les tests pass-to-pass (Scale). Ce détail compte. Un modèle n’obtient pas de crédit pour un patch plausible, un joli diff ou une explication utile. Il doit modifier le dépôt d’une manière acceptée par l’environnement du benchmark.

C’est pourquoi SWE-Bench Pro appartient à la catégorie des agents de dépôt. Une exécution réaliste d’agent ressemble moins à « écrire une fonction » qu’à :

1. inspect issue and requirements
2. search repository conventions
3. edit one or more files
4. run targeted tests
5. debug failures
6. rerun regression tests
7. return a patch

C’est précisément dans ce flux que la gestion du contexte, l’utilisation d’outils, la récupération après erreur et la discipline de test commencent à compter. Un modèle brillant en génération de code isolée peut malgré tout s’effondrer lorsque l’arbre de dépendances est hostile ou que le test en échec se cache dans un cas limite spécifique à un framework.

Diagramme de flux épuré sur fond crème montrant un pipeline d’agent de codage : réception du ticket, recherche dans le dépôt, édition du patch, exécution des tests,

Le hic : le benchmark est sous tension

Le point délicat : OpenAI a publié le tableau GPT-5.6 le 9 juillet 2026, un jour après avoir publié, le 8 juillet, un audit détaillé de SWE-Bench Pro. Dans cet audit, OpenAI estimait qu’environ 30 % des tâches de SWE-Bench Pro étaient cassées et indiquait retirer sa recommandation antérieure d’adopter le benchmark (OpenAI).

L’audit a produit deux estimations différentes : un pipeline automatisé complété par une revue a signalé 200 tâches cassées, soit 27,4 %, tandis qu’une campagne d’annotation humaine en a identifié 249, soit 34,1 % (OpenAI). Les catégories d’échec listées sont exactement celles que redoutent les utilisateurs de benchmarks : tests trop stricts, prompts insuffisamment spécifiés, tests à faible couverture et prompts trompeurs.

Cela ne rend pas le tableau inutile. Cela signifie en revanche qu’il ne faut pas traiter la deuxième décimale, ni même quelques points de pourcentage, comme une vérité d’ingénierie. Un écart de 15,4 points entre Claude Fable 5 et GPT-5.6 Sol reste suffisamment significatif pour être investigué. Un écart de 1 ou 2 points constituerait une preuve faible sur ce benchmark en juillet 2026.

La posture pratique est la suivante : utilisez SWE-Bench Pro comme un signal rapporté au niveau dépôt, puis relancez votre propre harness avant de construire une architecture autour de lui.

Ne le mélangez pas avec Terminal-Bench ou Aider

Le même tableau GPT-5.6 d’OpenAI rapporte aussi Terminal-Bench 2.1, où GPT-5.6 Sol atteint 88,8 %, GPT-5.6 Sol Ultra 91,9 %, Claude Fable 5 83,1 %, et Gemini 3.1 Pro Preview 70,7 % (OpenAI). Cela raconte une autre histoire, parce que la forme de la tâche est différente. Terminal-Bench met l’accent sur les workflows en terminal. SWE-Bench Pro met l’accent sur la résolution de patchs dans des dépôts.

Fusionner ces scores en un seul chiffre de « meilleur modèle de codage » est une bonne façon pour les équipes de se tromper elles-mêmes. Les benchmarks de type Aider ajoutent une autre couche de harness : format de prompt, mode d’édition, politique de réessai et adaptateurs spécifiques aux modèles peuvent faire bouger les résultats. Ils sont utiles, mais ils ne sont pas interchangeables avec un benchmark de dépôt qui utilise sa propre construction de tâches et ses propres règles de notation.

Pour les équipes qui construisent des agents de codage, séparez votre feuille d’évaluation en couloirs :

repo_patch_resolution:
  benchmark: SWE-Bench Pro
  metric: resolve_rate
terminal_workflows:
  benchmark: Terminal-Bench
  metric: task_success
interactive_editing:
  benchmark: Aider-style runs
  metric: accepted_patch_or_tests_passed
internal_repos:
  benchmark: private eval set
  metric: merged_patch_after_review

Comparez ensuite les modèles au sein de chaque couloir. Ne faites pas la moyenne des couloirs, sauf si vous explicitez les pondérations. Un agent de migration, un bot d’écriture de tests et un agent d’opérations en terminal n’ont pas les mêmes coûts d’échec.

Conclusion

Si SWE-Bench Pro est le couloir, Claude Fable 5 est le leader rapporté parmi ces trois modèles : 80,0 % contre 64,6 % pour GPT-5.6 Sol et 54,2 % pour Gemini 3.1 Pro Preview. GPT-5.6 Sol est moins cher que Fable 5 au tarif API catalogue, 5 $/30 $ par million de tokens contre 10 $/50 $, il peut donc encore gagner en débit ajusté au coût si votre agent peut tolérer le taux de résolution rapporté plus faible. Gemini 3.1 Pro Preview est encore moins cher à 2 $/12 $ jusqu’à des prompts de 200k tokens, mais l’écart rapporté sur SWE-Bench Pro est suffisamment grand pour que vous deviez le valider sur vos propres dépôts avant de le qualifier de choix économique.

Le principal enseignement n’est pas « Claude gagne partout ». C’est ceci : pour les agents au niveau dépôt, utilisez des benchmarks au niveau dépôt, citez le harness et gardez l’état de santé du benchmark en tête. SWE-Bench Pro indique actuellement que Fable 5 mène cette comparaison, mais le benchmark lui-même présente suffisamment de problèmes de qualité documentés pour que les équipes sérieuses le traitent comme un filtre de présélection, et non comme une décision de déploiement.

Les lecteurs qui veulent essayer ces modèles concrètement peuvent appeler Claude et d’autres modèles via onehop avec une API compatible OpenAI : modifiez un seul base_url, comparez les exécutions et gardez votre harness stable (appeler Claude et d’autres modèles sur onehop). Les nouveaux comptes bénéficient de 10 $ de crédit gratuit sans carte requise, et les tarifs sont inférieurs à l’accès direct aux fournisseurs (inscrivez-vous pour recevoir 10 $ de crédit gratuit).