GPT-5.6 Sol vs Claude Fable 5 vs Gemini 3.1 Pro su SWE-Bench Pro
23 luglio 2026 · 23 min di lettura · Claude / GPT / Gemini

Il numero che cambia la shortlist
Claude Fable 5 è il modello da battere nella riga SWE-Bench Pro riportata: 80,0%. GPT-5.6 Sol è al 64,6%. Gemini 3.1 Pro Preview è al 54,2%. Questi tre numeri provengono dalla tabella di lancio di GPT-5.6 di OpenAI del 9 luglio 2026, nella sezione Coding per SWE-Bench Pro (OpenAI).
Si tratta di un divario di 15,4 punti tra Claude Fable 5 e GPT-5.6 Sol, e di 25,8 punti tra Claude Fable 5 e Gemini 3.1 Pro Preview. Per chi costruisce coding agent, è troppo ampio per liquidarlo con leggerezza.
Ma la lettura corretta è più circoscritta del titolo. Qui parliamo di coding agentico a livello di repository. Non è Terminal-Bench. Non è la leaderboard di Aider. Non è un benchmark di UI “vibe-coded”. Se il tuo prodotto applica patch a repository reali, apre file, esegue test, modifica più moduli e deve sopravvivere a grafi di dipendenze disordinati, SWE-Bench Pro è più vicino al tuo workload rispetto a molte righe di coding generiche. Se il tuo prodotto è soprattutto completamento in chat, snippet di codice o risoluzione di puzzle da CLI, questa riga è solo un segnale.

La tabella di confronto
Ecco la versione pulita, mantenendo la riga del benchmark separata dagli altri numeri sui coding agent.
| Modello | Famiglia del vendor | Punteggio SWE-Bench Pro riportato | Fonte del punteggio | Prezzo API verificato |
|---|---|---|---|---|
| Claude Fable 5 | Claude | 80,0% | Tabella GPT-5.6 di OpenAI (OpenAI) | $10 input / $50 output per 1M token (Anthropic) |
| GPT-5.6 Sol | GPT | 64,6% | Tabella GPT-5.6 di OpenAI (OpenAI) | $5 input / $30 output per 1M token (OpenAI) |
| Gemini 3.1 Pro Preview | Gemini | 54,2% | Tabella GPT-5.6 di OpenAI (OpenAI); verifica incrociata con la model card di Gemini 3.5 Flash di Google per Gemini 3.1 Pro su SWE-Bench Pro Public (Google DeepMind) | $2 input / $12 output per 1M token per prompt fino a 200k token, tier standard (Google AI) |
Il numero di Gemini ha la migliore verifica incrociata. La model card di Gemini 3.5 Flash di Google elenca risultati “as of May, 2026” e riporta Gemini 3.1 Pro al 54,2% su “SWE-Bench Pro (Public)” con una configurazione “Single attempt” (Google DeepMind). La tabella di luglio di OpenAI usa “Gemini 3.1 Pro Preview” e lo stesso numero, 54,2%. Questo non dimostra che le impostazioni dell’harness siano identiche in ogni dettaglio, ma rende il punteggio di Gemini meno sospetto rispetto a una singola citazione solo del vendor.
Il punteggio dell’80,0% di Claude Fable 5, in questo confronto, proviene dalla tabella di OpenAI e non da una tabella di benchmark di Anthropic. La pagina Fable di Anthropic resta comunque utile per il contesto di rilascio e il pricing: Fable 5 è posizionato per “hardest knowledge and coding work”, usa il nome API claude-fable-5 e costa $10 per milione di token di input e $50 per milione di token di output (Anthropic). Anthropic afferma inoltre che Fable 5 e Mythos 5 sono stati rilasciati il 9 giugno, sospesi il 12 giugno dopo una direttiva del governo USA e ripristinati globalmente il 1° luglio dopo la revoca dei controlli all’export (Anthropic).
Cosa misura davvero SWE-Bench Pro
SWE-Bench Pro è stato costruito per superare il tetto del più vecchio SWE-Bench Verified. Scale lo descrive come un benchmark per task di software engineering di lungo respiro in repository più realistici, con 1.865 task totali distribuiti su 41 repository: 731 pubblici, 858 held-out e 276 commerciali (Scale). Il set pubblico usa repository open source con licenze copyleft forti; il sottoinsieme privato usa codebase proprietarie di startup.
La metrica principale è il tasso di risoluzione. Un task conta come risolto quando la patch inviata supera i nuovi test fail-to-pass e non rompe i test pass-to-pass (Scale). Questo dettaglio conta. Un modello non riceve credito per una patch plausibile, un diff elegante o una spiegazione utile. Deve modificare il repository in un modo accettato dall’ambiente del benchmark.
Ecco perché SWE-Bench Pro rientra nella categoria degli agenti per repository. Una run realistica di un agente assomiglia meno a “scrivi una funzione” e più a:
1. inspect issue and requirements
2. search repository conventions
3. edit one or more files
4. run targeted tests
5. debug failures
6. rerun regression tests
7. return a patch
È proprio in questo flusso che la gestione del contesto, l’uso degli strumenti, il recupero dagli errori e la disciplina nei test iniziano a fare la differenza. Un modello che eccelle nella generazione di codice isolata può comunque crollare quando l’albero delle dipendenze è ostile o il test che fallisce si nasconde in un caso limite specifico di un framework.

Il punto critico: il benchmark è sotto stress
La parte scomoda: OpenAI ha pubblicato la tabella di GPT-5.6 il 9 luglio 2026, un giorno dopo aver pubblicato un audit dettagliato di SWE-Bench Pro l’8 luglio. In quell’audit, OpenAI ha stimato che circa il 30% dei task di SWE-Bench Pro è rotto e ha dichiarato di ritirare la sua precedente raccomandazione di adottare il benchmark (OpenAI).
L’audit ha trovato due stime diverse: una pipeline automatizzata con revisione ha segnalato 200 task rotti, pari al 27,4%, mentre una campagna di annotazione umana ne ha identificati 249, pari al 34,1% (OpenAI). Le categorie di errore elencate sono esattamente quelle che gli utenti dei benchmark temono: test eccessivamente rigidi, prompt sottospecificati, test con bassa copertura e prompt fuorvianti.
Questo non rende la tabella inutile. Significa però che non dovresti trattare la seconda cifra decimale, o persino alcuni punti percentuali, come verità ingegneristica. Un divario di 15,4 punti tra Claude Fable 5 e GPT-5.6 Sol è comunque abbastanza significativo da meritare un’indagine. Un divario di 1 o 2 punti sarebbe una prova debole su questo benchmark a luglio 2026.
La posizione pratica è questa: usa SWE-Bench Pro come segnale riportato a livello di repository, poi riesegui il tuo harness prima di costruirci attorno l’architettura.
Non mescolarlo con Terminal-Bench o Aider
La stessa tabella GPT-5.6 di OpenAI riporta anche Terminal-Bench 2.1, dove GPT-5.6 Sol è all’88,8%, GPT-5.6 Sol Ultra al 91,9%, Claude Fable 5 all’83,1% e Gemini 3.1 Pro Preview al 70,7% (OpenAI). Questo racconta una storia diversa perché la forma del task è diversa. Terminal-Bench enfatizza i workflow da terminale. SWE-Bench Pro enfatizza la risoluzione di patch nei repository.
Fondere questi punteggi in un unico numero da “miglior modello di coding” è il modo in cui i team si autoingannano. I benchmark in stile Aider aggiungono un ulteriore layer di harness: formato del prompt, modalità di editing, policy di retry e adapter specifici per modello possono spostare i risultati. Sono utili, ma non sono intercambiabili con un benchmark per repository che usa la propria costruzione dei task e le proprie regole di valutazione.
Per chi costruisce coding agent, separa il tuo foglio di valutazione in corsie:
repo_patch_resolution:
benchmark: SWE-Bench Pro
metric: resolve_rate
terminal_workflows:
benchmark: Terminal-Bench
metric: task_success
interactive_editing:
benchmark: Aider-style runs
metric: accepted_patch_or_tests_passed
internal_repos:
benchmark: private eval set
metric: merged_patch_after_review
Poi confronta i modelli all’interno di ciascuna corsia. Non fare la media delle corsie a meno che tu non sia esplicito sui pesi. Un agente di migrazione, un bot che scrive test e un agente di ops da terminale hanno costi di errore diversi.
In sintesi
Se SWE-Bench Pro è la corsia, Claude Fable 5 è il leader riportato tra questi tre modelli: 80,0% contro 64,6% per GPT-5.6 Sol e 54,2% per Gemini 3.1 Pro Preview. GPT-5.6 Sol è più economico di Fable 5 al prezzo API di listino, $5/$30 per milione di token contro $10/$50, quindi potrebbe comunque vincere sul throughput corretto per il costo se il tuo agente può tollerare il tasso di risoluzione riportato più basso. Gemini 3.1 Pro Preview è ancora più economico, a $2/$12 fino a prompt da 200k token, ma il divario riportato su SWE-Bench Pro è abbastanza ampio da richiedere una validazione sui tuoi repository prima di definirlo la scelta più conveniente.
Il takeaway più netto non è “Claude vince tutto”. È questo: per agenti a livello di repository, usa benchmark a livello di repository, cita l’harness e tieni d’occhio lo stato di salute del benchmark. SWE-Bench Pro al momento dice che Fable 5 guida questo confronto, ma il benchmark stesso ha abbastanza problemi di qualità documentati da spingere i team seri a trattarlo come un filtro per la shortlist, non come una decisione di deployment.
I lettori che vogliono provare questi modelli in pratica possono chiamare Claude e altri modelli tramite onehop con un’API compatibile con OpenAI: cambia un solo base_url, confronta le run e mantieni stabile il tuo harness (chiamare Claude e altri modelli su onehop). I nuovi account ricevono $10 di credito gratuito senza carta richiesta, e i prezzi sono più bassi rispetto all’accesso first-party (registrati per $10 di credito gratuito).
Letture correlate

GPT-5 vs Gemini 2.5 Pro vs Claude Opus 4 nel coding Aider Polyglot
Un confronto basato sui dati tra GPT-5, Gemini 2.5 Pro e Claude Opus 4 nel benchmark di coding Aider Polyglot.
17 giugno 2026 · 23 min di lettura

Gemini 3.1 Pro vs GPT-5.2 vs Claude Opus 4.6 su Terminal-Bench 2.0
Gemini 3.1 Pro guida l’harness condiviso di Terminal-Bench 2.0, ma la scelta dell’harness cambia il quadro del coding via CLI.
16 giugno 2026 · 23 min di lettura

Chiamare Qwen3.7 Plus con l’OpenAI SDK tramite la modalità compatibile DashScope
Porta app con OpenAI SDK a Qwen3.7 Plus modificando base_url, controlli di thinking, prezzi long-context e codice eseguibile.
23 luglio 2026 · 27 min di lettura