GPT-5.6 Sol vs Claude Fable 5 vs Gemini 3.1 Pro di SWE-Bench Pro
23 Juli 2026 · 22 menit baca · Claude / GPT / Gemini

Angka yang Mengubah Shortlist
Claude Fable 5 adalah model yang harus dikalahkan pada baris SWE-Bench Pro yang dilaporkan: 80,0%. GPT-5.6 Sol berada di 64,6%. Gemini 3.1 Pro Preview berada di 54,2%. Ketiga angka tersebut berasal dari tabel peluncuran GPT-5.6 OpenAI pada 9 Juli 2026, di bagian Coding untuk SWE-Bench Pro (OpenAI).
Itu berarti selisih 15,4 poin antara Claude Fable 5 dan GPT-5.6 Sol, serta selisih 25,8 poin antara Claude Fable 5 dan Gemini 3.1 Pro Preview. Bagi pembuat agen coding, selisih itu terlalu besar untuk diabaikan begitu saja.
Namun pembacaan yang tepat lebih sempit daripada headline-nya. Ini adalah coding agentic di level repositori. Ini bukan Terminal-Bench. Ini bukan leaderboard Aider. Ini bukan benchmark UI yang di-vibe-code. Jika produk Anda mem-patch repo sungguhan, membuka file, menjalankan test, mengedit lintas beberapa modul, dan harus bertahan menghadapi graph dependency yang berantakan, SWE-Bench Pro lebih dekat dengan workload Anda dibanding banyak baris coding generik. Jika produk Anda lebih banyak berupa chat completion, snippet kode, atau penyelesaian puzzle CLI, baris ini hanya salah satu sinyal.

Tabel Perbandingan
Berikut versi yang rapi, dengan baris benchmark dipisahkan dari angka agen coding lainnya.
| Model | Keluarga vendor | Skor SWE-Bench Pro yang dilaporkan | Sumber skor | Harga API yang dicek |
|---|---|---|---|---|
| Claude Fable 5 | Claude | 80,0% | Tabel GPT-5.6 OpenAI (OpenAI) | $10 input / $50 output per 1 juta token (Anthropic) |
| GPT-5.6 Sol | GPT | 64,6% | Tabel GPT-5.6 OpenAI (OpenAI) | $5 input / $30 output per 1 juta token (OpenAI) |
| Gemini 3.1 Pro Preview | Gemini | 54,2% | Tabel GPT-5.6 OpenAI (OpenAI); dicek silang dengan model card Gemini 3.5 Flash dari Google untuk Gemini 3.1 Pro di SWE-Bench Pro Public (Google DeepMind) | $2 input / $12 output per 1 juta token untuk prompt hingga 200k token, tier standar (Google AI) |
Angka Gemini memiliki cross-check terbaik. Model card Gemini 3.5 Flash dari Google mencantumkan hasil “per Mei 2026” dan melaporkan Gemini 3.1 Pro di 54,2% pada “SWE-Bench Pro (Public)” dengan setup “Single attempt” (Google DeepMind). Tabel OpenAI bulan Juli menggunakan “Gemini 3.1 Pro Preview” dan angka 54,2% yang sama. Itu tidak membuktikan setting harness identik dalam setiap detail, tetapi membuat skor Gemini tidak terlalu mencurigakan dibanding satu kutipan dari vendor saja.
Skor 80,0% Claude Fable 5, dalam perbandingan ini, bersumber dari tabel OpenAI, bukan dari tabel benchmark Anthropic. Halaman Fable milik Anthropic sendiri tetap berguna untuk konteks rilis dan harga: Fable 5 diposisikan untuk “pekerjaan pengetahuan dan coding tersulit,” menggunakan nama API claude-fable-5, dan dibanderol $10 per satu juta token input serta $50 per satu juta token output (Anthropic). Anthropic juga mengatakan Fable 5 dan Mythos 5 dirilis pada 9 Juni, ditangguhkan pada 12 Juni setelah arahan pemerintah AS, dan dipulihkan secara global pada 1 Juli setelah kontrol ekspor dicabut (Anthropic).
Apa yang Sebenarnya Diukur SWE-Bench Pro
SWE-Bench Pro dibuat untuk melampaui plafon SWE-Bench Verified yang lebih lama. Scale mendeskripsikannya sebagai benchmark untuk task software engineering jangka panjang di repositori yang lebih realistis, dengan total 1.865 task di 41 repositori: 731 publik, 858 held-out, dan 276 komersial (Scale). Set publik menggunakan repositori open-source dengan lisensi copyleft yang kuat; subset privat menggunakan codebase startup proprietari.
Metrik utamanya adalah resolve rate. Sebuah task dihitung resolved ketika patch yang dikirim lolos test baru fail-to-pass dan tidak merusak test pass-to-pass (Scale). Detail itu penting. Model tidak mendapat kredit untuk patch yang tampak masuk akal, diff yang rapi, atau penjelasan yang membantu. Model harus mengubah repo dengan cara yang diterima oleh environment benchmark.
Karena itulah SWE-Bench Pro masuk ke bucket agen repositori. Run agen yang realistis lebih mirip “tulis sebuah fungsi” dan lebih seperti:
1. inspect issue and requirements
2. search repository conventions
3. edit one or more files
4. run targeted tests
5. debug failures
6. rerun regression tests
7. return a patch
Flow itu persis area tempat penanganan konteks, penggunaan tool, pemulihan error, dan disiplin test mulai menjadi penting. Model yang sangat bagus dalam code generation terisolasi masih bisa gagal total ketika dependency tree tidak bersahabat atau test yang gagal tersembunyi dalam edge case spesifik framework.

Catatannya: Benchmark Ini Sedang Tertekan
Bagian yang kurang nyaman: OpenAI menerbitkan tabel GPT-5.6 pada 9 Juli 2026, satu hari setelah menerbitkan audit SWE-Bench Pro yang detail pada 8 Juli. Dalam audit tersebut, OpenAI memperkirakan sekitar 30% task SWE-Bench Pro bermasalah dan mengatakan mereka mencabut rekomendasi sebelumnya untuk mengadopsi benchmark itu (OpenAI).
Audit tersebut menemukan dua estimasi berbeda: pipeline otomatis-plus-review menandai 200 task bermasalah, atau 27,4%, sementara kampanye anotasi manusia mengidentifikasi 249, atau 34,1% (OpenAI). Kategori kegagalan yang dicantumkan persis seperti yang ditakuti pengguna benchmark: test yang terlalu ketat, prompt yang kurang spesifik, test dengan coverage rendah, dan prompt yang menyesatkan.
Itu tidak membuat tabelnya tidak berguna. Artinya, Anda tidak boleh memperlakukan angka desimal kedua, atau bahkan selisih beberapa poin persentase, sebagai kebenaran engineering. Selisih 15,4 poin antara Claude Fable 5 dan GPT-5.6 Sol masih cukup berarti untuk diselidiki. Selisih 1 atau 2 poin akan menjadi bukti yang lemah pada benchmark ini di Juli 2026.
Sikap praktisnya: gunakan SWE-Bench Pro sebagai sinyal level repositori yang dilaporkan, lalu jalankan ulang harness Anda sendiri sebelum membangun arsitektur berdasarkan sinyal tersebut.
Jangan Campur dengan Terminal-Bench atau Aider
Tabel GPT-5.6 OpenAI yang sama juga melaporkan Terminal-Bench 2.1, di mana GPT-5.6 Sol berada di 88,8%, GPT-5.6 Sol Ultra di 91,9%, Claude Fable 5 di 83,1%, dan Gemini 3.1 Pro Preview di 70,7% (OpenAI). Itu menceritakan kisah yang berbeda karena bentuk task-nya berbeda. Terminal-Bench menekankan workflow terminal. SWE-Bench Pro menekankan penyelesaian patch repo.
Mencampur skor-skor itu menjadi satu angka “model coding terbaik” adalah cara tim menipu diri sendiri. Benchmark ala Aider menambahkan lapisan harness lain: format prompt, mode edit, kebijakan retry, dan adapter spesifik model dapat menggeser hasil. Semuanya berguna, tetapi tidak dapat dipertukarkan dengan benchmark repositori yang memakai konstruksi task dan aturan penilaiannya sendiri.
Untuk pembuat agen coding, pisahkan sheet eval Anda ke beberapa lane:
repo_patch_resolution:
benchmark: SWE-Bench Pro
metric: resolve_rate
terminal_workflows:
benchmark: Terminal-Bench
metric: task_success
interactive_editing:
benchmark: Aider-style runs
metric: accepted_patch_or_tests_passed
internal_repos:
benchmark: private eval set
metric: merged_patch_after_review
Lalu bandingkan model di dalam tiap lane. Jangan rata-ratakan lane kecuali Anda eksplisit soal bobotnya. Agen migrasi, bot penulis test, dan agen terminal ops punya biaya kegagalan yang berbeda.
Kesimpulan
Jika SWE-Bench Pro adalah lane-nya, Claude Fable 5 adalah pemimpin yang dilaporkan di antara ketiga model ini: 80,0% dibanding 64,6% untuk GPT-5.6 Sol dan 54,2% untuk Gemini 3.1 Pro Preview. GPT-5.6 Sol lebih murah daripada Fable 5 pada harga API daftar, $5/$30 per satu juta token dibanding $10/$50, sehingga masih bisa menang dalam throughput yang disesuaikan biaya jika agen Anda dapat menoleransi resolve rate yang dilaporkan lebih rendah. Gemini 3.1 Pro Preview lebih murah lagi di $2/$12 hingga prompt 200k token, tetapi selisih SWE-Bench Pro yang dilaporkan cukup besar sehingga Anda sebaiknya memvalidasinya di repositori sendiri sebelum menyebutnya pilihan ekonomis.
Takeaway paling tajam bukan “Claude menang di semuanya.” Melainkan ini: untuk agen level repo, gunakan benchmark level repo, kutip harness-nya, dan tetap perhatikan kesehatan benchmark. SWE-Bench Pro saat ini mengatakan Fable 5 memimpin perbandingan ini, tetapi benchmark itu sendiri memiliki cukup banyak masalah kualitas yang terdokumentasi sehingga tim serius sebaiknya memperlakukannya sebagai filter shortlist, bukan keputusan deployment.
Pembaca yang ingin mencoba model-model ini secara langsung dapat memanggil Claude dan model lain melalui onehop dengan API yang kompatibel dengan OpenAI: ubah satu base_url, bandingkan run, dan jaga harness Anda tetap stabil (panggil Claude dan model lain di onehop). Akun baru mendapat kredit gratis $10 tanpa perlu kartu, dan harganya lebih murah daripada akses first-party (daftar untuk kredit gratis $10).
Bacaan terkait

GPT-5 vs Gemini 2.5 Pro vs Claude Opus 4 pada Pengodean Aider Polyglot
Perbandingan berbasis data antara GPT-5, Gemini 2.5 Pro, dan Claude Opus 4 pada pengodean Aider Polyglot.
17 Juni 2026 · 22 menit baca

Gemini 3.1 Pro vs GPT-5.2 vs Claude Opus 4.6 di Terminal-Bench 2.0
Gemini 3.1 Pro memimpin harness Terminal-Bench 2.0 bersama, tetapi pilihan harness mengubah cerita coding CLI.
16 Juni 2026 · 23 menit baca

Memanggil Qwen3.7 Plus dengan OpenAI SDK melalui DashScope Compatible Mode
Porting aplikasi OpenAI SDK ke Qwen3.7 Plus dengan perubahan base_url, kontrol thinking, harga konteks panjang, dan kode siap jalan.
23 Juli 2026 · 27 menit baca