返回全部文章
评测

GPT-5.6 Sol、Claude Fable 5 与 Gemini 3.1 Pro 在 SWE-Bench Pro 上的对比

2026年7月23日 · 13 分钟阅读 · Claude / GPT / Gemini

一张奶油色编辑风封面图,展示三列抽象模型列,按家族色彩进行概念标注,并带有一个 terraco

改变候选名单的数字

在已报告的 SWE-Bench Pro 这一行上,Claude Fable 5 是需要追赶的模型:80.0%。GPT-5.6 Sol 为 64.6%。Gemini 3.1 Pro Preview 为 54.2%。这三个数字来自 OpenAI 2026 年 7 月 9 日 GPT-5.6 发布表格中 Coding 部分的 SWE-Bench Pro(OpenAI)。

这意味着 Claude Fable 5 与 GPT-5.6 Sol 之间相差 15.4 个百分点,与 Gemini 3.1 Pro Preview 之间相差 25.8 个百分点。对于编码智能体构建者来说,这个差距大到不能轻描淡写地忽略。

但正确的解读应比标题更窄。这是仓库级的智能体式编码。它不是 Terminal-Bench。不是 Aider 的排行榜。也不是 vibe-coded UI 基准。如果你的产品会修补真实仓库、打开文件、运行测试、跨多个模块编辑,并且需要在混乱的依赖图中存活下来,那么相比许多通用编码指标,SWE-Bench Pro 更接近你的工作负载。如果你的产品主要是聊天补全、代码片段或 CLI 谜题求解,那么这一行只是一个信号。

奶油色背景上的横向柱状图,对比 SWE-Bench Pro 已报告解决率:Claude Fable 5 为 80.0,使用 terra 色

对比表

下面是清晰版本,将这条基准指标与其他编码智能体数字分开。

模型 厂商系列 SWE-Bench Pro 已报告分数 分数来源 已核对 API 价格
Claude Fable 5 Claude 80.0% OpenAI GPT-5.6 表格(OpenAI 每 100 万 token $10 输入 / $50 输出(Anthropic
GPT-5.6 Sol GPT 64.6% OpenAI GPT-5.6 表格(OpenAI 每 100 万 token $5 输入 / $30 输出(OpenAI
Gemini 3.1 Pro Preview Gemini 54.2% OpenAI GPT-5.6 表格(OpenAI);与 Google 的 Gemini 3.5 Flash 模型卡中 Gemini 3.1 Pro 在 SWE-Bench Pro Public 上的结果交叉核对(Google DeepMind 标准层级下,最长 200k token 提示每 100 万 token $2 输入 / $12 输出(Google AI

Gemini 的数字有最好的交叉核对。Google 的 Gemini 3.5 Flash 模型卡列出了“截至 2026 年 5 月”的结果,并报告 Gemini 3.1 Pro 在“SWE-Bench Pro (Public)”上的结果为 54.2%,设置为“Single attempt”(Google DeepMind)。OpenAI 7 月的表格使用“Gemini 3.1 Pro Preview”,且数字同样是 54.2%。这并不能证明每个细节上的评测框架设置完全相同,但确实让 Gemini 分数不像单一厂商引用那样可疑。

在这次对比中,Claude Fable 5 的 80.0% 分数来自 OpenAI 的表格,而不是 Anthropic 的基准表。Anthropic 自己的 Fable 页面仍然有助于了解发布背景和定价:Fable 5 被定位用于“最困难的知识和编码工作”,使用 claude-fable-5 API 名称,定价为每百万输入 token $10、每百万输出 token $50(Anthropic)。Anthropic 还表示,Fable 5 和 Mythos 5 于 6 月 9 日发布,在美国政府指令后于 6 月 12 日暂停,并在出口管制解除后于 7 月 1 日在全球恢复(Anthropic)。

SWE-Bench Pro 实际衡量什么

SWE-Bench Pro 的构建目标是突破旧版 SWE-Bench Verified 的上限。Scale 将其描述为一个面向更真实仓库中长周期软件工程任务的基准,共有 41 个仓库中的 1,865 个任务:731 个公开任务、858 个保留任务和 276 个商业任务(Scale)。公开集使用具有强 copyleft 许可证的开源仓库;私有子集使用专有的创业公司代码库。

主要指标是解决率。当提交的补丁通过新的 fail-to-pass 测试,并且没有破坏 pass-to-pass 测试时,一个任务才算已解决(Scale)。这个细节很重要。模型不会因为一个看似合理的补丁、漂亮的 diff 或有帮助的解释而得分。它必须以基准环境接受的方式修改仓库。

这就是为什么 SWE-Bench Pro 属于仓库智能体这一类。一次真实的智能体运行不像是“写一个函数”,而更像是:

1. inspect issue and requirements
2. search repository conventions
3. edit one or more files
4. run targeted tests
5. debug failures
6. rerun regression tests
7. return a patch

这种流程正是上下文处理、工具使用、错误恢复和测试纪律开始变得重要的地方。一个在孤立代码生成中表现出色的模型,在依赖树不友好或失败测试隐藏在框架特定边界情况中时,仍然可能崩溃。

奶油色背景上的简洁流程图,展示编码智能体流水线:问题接收、仓库搜索、补丁编辑、测试运行,

问题在于:该基准正承受压力

令人不太舒服的是:OpenAI 于 2026 年 7 月 9 日发布 GPT-5.6 表格,而就在前一天,7 月 8 日,它发布了一份详细的 SWE-Bench Pro 审计。在那次审计中,OpenAI 估计约 30% 的 SWE-Bench Pro 任务存在问题,并表示撤回其此前建议采用该基准的推荐(OpenAI)。

审计得出了两个不同估计:自动化加人工复核流程标记了 200 个有问题任务,占 27.4%;而人工标注活动识别出 249 个,占 34.1%(OpenAI)。列出的失败类别正是基准用户最担心的那些:测试过于严格、提示说明不足、测试覆盖率低以及提示具有误导性。

这并不意味着该表格毫无用处。它确实意味着你不应把小数点后第二位,甚至几个百分点的差距,当作工程真相。Claude Fable 5 与 GPT-5.6 Sol 之间 15.4 个百分点的差距,仍然足够有意义,值得进一步调查。但在 2026 年 7 月这个基准上,1 到 2 个百分点的差距只能算是较弱证据。

务实的立场是:把 SWE-Bench Pro 用作已报告的仓库级信号,然后在围绕它购买架构之前,重新运行你自己的评测框架。

不要把它和 Terminal-Bench 或 Aider 混在一起

OpenAI 同一张 GPT-5.6 表格还报告了 Terminal-Bench 2.1,其中 GPT-5.6 Sol 为 88.8%,GPT-5.6 Sol Ultra 为 91.9%,Claude Fable 5 为 83.1%,Gemini 3.1 Pro Preview 为 70.7%(OpenAI)。这讲述的是另一个故事,因为任务形态不同。Terminal-Bench 强调终端工作流。SWE-Bench Pro 强调仓库补丁解决。

把这些分数混成一个“最佳编码模型”数字,就是团队自我误导的方式。Aider 风格的基准还会增加另一层评测框架:提示格式、编辑模式、重试策略和模型特定适配器都可能影响结果。它们有用,但不能与使用自身任务构建和评分规则的仓库基准互换。

对于编码智能体构建者,请把评测表拆分成不同赛道:

repo_patch_resolution:
  benchmark: SWE-Bench Pro
  metric: resolve_rate
terminal_workflows:
  benchmark: Terminal-Bench
  metric: task_success
interactive_editing:
  benchmark: Aider-style runs
  metric: accepted_patch_or_tests_passed
internal_repos:
  benchmark: private eval set
  metric: merged_patch_after_review

然后在每个赛道内部比较模型。除非你明确说明权重,否则不要对这些赛道取平均。迁移智能体、测试编写机器人和终端运维智能体有着不同的失败成本。

结论

如果赛道是 SWE-Bench Pro,那么在这三个模型中,Claude Fable 5 是已报告的领先者:80.0%,相比之下 GPT-5.6 Sol 为 64.6%,Gemini 3.1 Pro Preview 为 54.2%。按 API 标价,GPT-5.6 Sol 比 Fable 5 更便宜,每百万 token $5/$30 对比 $10/$50,因此如果你的智能体能够容忍较低的已报告解决率,它仍可能在按成本调整后的吞吐上胜出。Gemini 3.1 Pro Preview 在最长 200k-token 提示下价格更低,为 $2/$12,但其已报告的 SWE-Bench Pro 差距足够大,因此在称其为经济之选前,你应该先在自己的仓库上验证。

最关键的结论不是“Claude 赢了一切”。而是:对于仓库级智能体,要使用仓库级基准,引用评测框架,并持续关注基准健康状况。SWE-Bench Pro 目前显示 Fable 5 在这次对比中领先,但该基准本身已有足够多有记录的质量问题,严肃团队应把它视为候选名单过滤器,而不是部署决策依据。

想要亲手尝试这些模型的读者,可以通过 onehop 使用 OpenAI 兼容 API 调用 Claude 和其他模型:只需更改一个 base_url,即可比较多次运行,并保持评测框架稳定(在 onehop 上调用 Claude 和其他模型)。新账号可获得 $10 免费额度,无需绑定银行卡,且价格低于一方访问(注册领取 $10 免费额度)。