GPT-5.6 Sol、Claude Fable 5 与 Gemini 3.1 Pro 在 SWE-Bench Pro 上的对比
2026年7月23日 · 13 分钟阅读 · Claude / GPT / Gemini

改变候选名单的数字
在已报告的 SWE-Bench Pro 这一行上,Claude Fable 5 是需要追赶的模型:80.0%。GPT-5.6 Sol 为 64.6%。Gemini 3.1 Pro Preview 为 54.2%。这三个数字来自 OpenAI 2026 年 7 月 9 日 GPT-5.6 发布表格中 Coding 部分的 SWE-Bench Pro(OpenAI)。
这意味着 Claude Fable 5 与 GPT-5.6 Sol 之间相差 15.4 个百分点,与 Gemini 3.1 Pro Preview 之间相差 25.8 个百分点。对于编码智能体构建者来说,这个差距大到不能轻描淡写地忽略。
但正确的解读应比标题更窄。这是仓库级的智能体式编码。它不是 Terminal-Bench。不是 Aider 的排行榜。也不是 vibe-coded UI 基准。如果你的产品会修补真实仓库、打开文件、运行测试、跨多个模块编辑,并且需要在混乱的依赖图中存活下来,那么相比许多通用编码指标,SWE-Bench Pro 更接近你的工作负载。如果你的产品主要是聊天补全、代码片段或 CLI 谜题求解,那么这一行只是一个信号。

对比表
下面是清晰版本,将这条基准指标与其他编码智能体数字分开。
| 模型 | 厂商系列 | SWE-Bench Pro 已报告分数 | 分数来源 | 已核对 API 价格 |
|---|---|---|---|---|
| Claude Fable 5 | Claude | 80.0% | OpenAI GPT-5.6 表格(OpenAI) | 每 100 万 token $10 输入 / $50 输出(Anthropic) |
| GPT-5.6 Sol | GPT | 64.6% | OpenAI GPT-5.6 表格(OpenAI) | 每 100 万 token $5 输入 / $30 输出(OpenAI) |
| Gemini 3.1 Pro Preview | Gemini | 54.2% | OpenAI GPT-5.6 表格(OpenAI);与 Google 的 Gemini 3.5 Flash 模型卡中 Gemini 3.1 Pro 在 SWE-Bench Pro Public 上的结果交叉核对(Google DeepMind) | 标准层级下,最长 200k token 提示每 100 万 token $2 输入 / $12 输出(Google AI) |
Gemini 的数字有最好的交叉核对。Google 的 Gemini 3.5 Flash 模型卡列出了“截至 2026 年 5 月”的结果,并报告 Gemini 3.1 Pro 在“SWE-Bench Pro (Public)”上的结果为 54.2%,设置为“Single attempt”(Google DeepMind)。OpenAI 7 月的表格使用“Gemini 3.1 Pro Preview”,且数字同样是 54.2%。这并不能证明每个细节上的评测框架设置完全相同,但确实让 Gemini 分数不像单一厂商引用那样可疑。
在这次对比中,Claude Fable 5 的 80.0% 分数来自 OpenAI 的表格,而不是 Anthropic 的基准表。Anthropic 自己的 Fable 页面仍然有助于了解发布背景和定价:Fable 5 被定位用于“最困难的知识和编码工作”,使用 claude-fable-5 API 名称,定价为每百万输入 token $10、每百万输出 token $50(Anthropic)。Anthropic 还表示,Fable 5 和 Mythos 5 于 6 月 9 日发布,在美国政府指令后于 6 月 12 日暂停,并在出口管制解除后于 7 月 1 日在全球恢复(Anthropic)。
SWE-Bench Pro 实际衡量什么
SWE-Bench Pro 的构建目标是突破旧版 SWE-Bench Verified 的上限。Scale 将其描述为一个面向更真实仓库中长周期软件工程任务的基准,共有 41 个仓库中的 1,865 个任务:731 个公开任务、858 个保留任务和 276 个商业任务(Scale)。公开集使用具有强 copyleft 许可证的开源仓库;私有子集使用专有的创业公司代码库。
主要指标是解决率。当提交的补丁通过新的 fail-to-pass 测试,并且没有破坏 pass-to-pass 测试时,一个任务才算已解决(Scale)。这个细节很重要。模型不会因为一个看似合理的补丁、漂亮的 diff 或有帮助的解释而得分。它必须以基准环境接受的方式修改仓库。
这就是为什么 SWE-Bench Pro 属于仓库智能体这一类。一次真实的智能体运行不像是“写一个函数”,而更像是:
1. inspect issue and requirements
2. search repository conventions
3. edit one or more files
4. run targeted tests
5. debug failures
6. rerun regression tests
7. return a patch
这种流程正是上下文处理、工具使用、错误恢复和测试纪律开始变得重要的地方。一个在孤立代码生成中表现出色的模型,在依赖树不友好或失败测试隐藏在框架特定边界情况中时,仍然可能崩溃。

问题在于:该基准正承受压力
令人不太舒服的是:OpenAI 于 2026 年 7 月 9 日发布 GPT-5.6 表格,而就在前一天,7 月 8 日,它发布了一份详细的 SWE-Bench Pro 审计。在那次审计中,OpenAI 估计约 30% 的 SWE-Bench Pro 任务存在问题,并表示撤回其此前建议采用该基准的推荐(OpenAI)。
审计得出了两个不同估计:自动化加人工复核流程标记了 200 个有问题任务,占 27.4%;而人工标注活动识别出 249 个,占 34.1%(OpenAI)。列出的失败类别正是基准用户最担心的那些:测试过于严格、提示说明不足、测试覆盖率低以及提示具有误导性。
这并不意味着该表格毫无用处。它确实意味着你不应把小数点后第二位,甚至几个百分点的差距,当作工程真相。Claude Fable 5 与 GPT-5.6 Sol 之间 15.4 个百分点的差距,仍然足够有意义,值得进一步调查。但在 2026 年 7 月这个基准上,1 到 2 个百分点的差距只能算是较弱证据。
务实的立场是:把 SWE-Bench Pro 用作已报告的仓库级信号,然后在围绕它购买架构之前,重新运行你自己的评测框架。
不要把它和 Terminal-Bench 或 Aider 混在一起
OpenAI 同一张 GPT-5.6 表格还报告了 Terminal-Bench 2.1,其中 GPT-5.6 Sol 为 88.8%,GPT-5.6 Sol Ultra 为 91.9%,Claude Fable 5 为 83.1%,Gemini 3.1 Pro Preview 为 70.7%(OpenAI)。这讲述的是另一个故事,因为任务形态不同。Terminal-Bench 强调终端工作流。SWE-Bench Pro 强调仓库补丁解决。
把这些分数混成一个“最佳编码模型”数字,就是团队自我误导的方式。Aider 风格的基准还会增加另一层评测框架:提示格式、编辑模式、重试策略和模型特定适配器都可能影响结果。它们有用,但不能与使用自身任务构建和评分规则的仓库基准互换。
对于编码智能体构建者,请把评测表拆分成不同赛道:
repo_patch_resolution:
benchmark: SWE-Bench Pro
metric: resolve_rate
terminal_workflows:
benchmark: Terminal-Bench
metric: task_success
interactive_editing:
benchmark: Aider-style runs
metric: accepted_patch_or_tests_passed
internal_repos:
benchmark: private eval set
metric: merged_patch_after_review
然后在每个赛道内部比较模型。除非你明确说明权重,否则不要对这些赛道取平均。迁移智能体、测试编写机器人和终端运维智能体有着不同的失败成本。
结论
如果赛道是 SWE-Bench Pro,那么在这三个模型中,Claude Fable 5 是已报告的领先者:80.0%,相比之下 GPT-5.6 Sol 为 64.6%,Gemini 3.1 Pro Preview 为 54.2%。按 API 标价,GPT-5.6 Sol 比 Fable 5 更便宜,每百万 token $5/$30 对比 $10/$50,因此如果你的智能体能够容忍较低的已报告解决率,它仍可能在按成本调整后的吞吐上胜出。Gemini 3.1 Pro Preview 在最长 200k-token 提示下价格更低,为 $2/$12,但其已报告的 SWE-Bench Pro 差距足够大,因此在称其为经济之选前,你应该先在自己的仓库上验证。
最关键的结论不是“Claude 赢了一切”。而是:对于仓库级智能体,要使用仓库级基准,引用评测框架,并持续关注基准健康状况。SWE-Bench Pro 目前显示 Fable 5 在这次对比中领先,但该基准本身已有足够多有记录的质量问题,严肃团队应把它视为候选名单过滤器,而不是部署决策依据。
想要亲手尝试这些模型的读者,可以通过 onehop 使用 OpenAI 兼容 API 调用 Claude 和其他模型:只需更改一个 base_url,即可比较多次运行,并保持评测框架稳定(在 onehop 上调用 Claude 和其他模型)。新账号可获得 $10 免费额度,无需绑定银行卡,且价格低于一方访问(注册领取 $10 免费额度)。
相关阅读

GPT-5、Gemini 2.5 Pro 与 Claude Opus 4 在 Aider Polyglot 编程基准上的对比
以数据为先,对比 GPT-5、Gemini 2.5 Pro 和 Claude Opus 4 在 Aider Polyglot 编程基准上的表现。
2026年6月17日 · 13 分钟阅读

Gemini 3.1 Pro vs GPT-5.2 vs Claude Opus 4.6:Terminal-Bench 2.0 对比
Gemini 3.1 Pro 在共享 Terminal-Bench 2.0 框架中领先,但框架选择会改变 CLI 编码能力的结论。
2026年6月16日 · 13 分钟阅读

通过 DashScope 兼容模式用 OpenAI SDK 调用 Qwen3.7 Plus
通过修改 base_url 将 OpenAI SDK 应用迁移到 Qwen3.7 Plus,涵盖思考控制、长上下文定价和可运行代码。
2026年7月23日 · 18 分钟阅读