GPT-5.6 Sol против Claude Fable 5 и Gemini 3.1 Pro на SWE-Bench Pro
23 июля 2026 г. · 22 мин чтения · Claude / GPT / Gemini

Число, которое меняет шорт-лист
Claude Fable 5 — модель, которую нужно превзойти в заявленной строке SWE-Bench Pro: 80,0%. GPT-5.6 Sol показывает 64,6%. Gemini 3.1 Pro Preview — 54,2%. Эти три числа взяты из таблицы запуска GPT-5.6 от OpenAI от 9 июля 2026 года, из раздела Coding для SWE-Bench Pro (OpenAI).
Это разрыв в 15,4 пункта между Claude Fable 5 и GPT-5.6 Sol и разрыв в 25,8 пункта между Claude Fable 5 и Gemini 3.1 Pro Preview. Для разработчика кодингового агента это слишком много, чтобы просто отмахнуться.
Но правильная интерпретация уже, чем заголовок. Речь о репозиторном агентном кодинге. Это не Terminal-Bench. Это не лидерборд Aider. Это не бенчмарк для vibe-coded UI. Если ваш продукт патчит реальные репозитории, открывает файлы, запускает тесты, правит код в нескольких модулях и должен выживать в запутанных графах зависимостей, SWE-Bench Pro ближе к вашей нагрузке, чем многие общие строки про кодинг. Если ваш продукт — в основном чатовые completions, фрагменты кода или решение CLI-головоломок, эта строка — лишь один из сигналов.

Сравнительная таблица
Вот чистая версия, где строка бенчмарка отделена от других чисел по кодинговым агентам.
| Модель | Семейство вендора | Заявленный результат SWE-Bench Pro | Источник результата | Проверенная цена API |
|---|---|---|---|---|
| Claude Fable 5 | Claude | 80,0% | Таблица OpenAI GPT-5.6 (OpenAI) | $10 input / $50 output за 1 млн токенов (Anthropic) |
| GPT-5.6 Sol | GPT | 64,6% | Таблица OpenAI GPT-5.6 (OpenAI) | $5 input / $30 output за 1 млн токенов (OpenAI) |
| Gemini 3.1 Pro Preview | Gemini | 54,2% | Таблица OpenAI GPT-5.6 (OpenAI); перепроверено по модельной карточке Google Gemini 3.5 Flash для Gemini 3.1 Pro на SWE-Bench Pro Public (Google DeepMind) | $2 input / $12 output за 1 млн токенов для промптов до 200k токенов, стандартный уровень (Google AI) |
У числа Gemini есть лучшая перекрестная проверка. В модельной карточке Google Gemini 3.5 Flash указаны результаты «по состоянию на май 2026 года», а для Gemini 3.1 Pro сообщается 54,2% на «SWE-Bench Pro (Public)» в режиме «Single attempt» (Google DeepMind). В июльской таблице OpenAI используется «Gemini 3.1 Pro Preview» и то же число 54,2%. Это не доказывает, что настройки harness во всех деталях идентичны, но делает результат Gemini менее подозрительным, чем единственная ссылка только от одного вендора.
Результат Claude Fable 5 в 80,0% в этом сравнении взят из таблицы OpenAI, а не из таблицы бенчмарков Anthropic. Собственная страница Fable у Anthropic все равно полезна для контекста релиза и цен: Fable 5 позиционируется для «самой сложной работы со знаниями и кодом», использует API-имя claude-fable-5 и стоит $10 за миллион input-токенов и $50 за миллион output-токенов (Anthropic). Anthropic также сообщает, что Fable 5 и Mythos 5 были выпущены 9 июня, приостановлены 12 июня после директивы правительства США и снова стали доступны глобально 1 июля после снятия экспортных ограничений (Anthropic).
Что на самом деле измеряет SWE-Bench Pro
SWE-Bench Pro был создан, чтобы выйти за пределы потолка более старого SWE-Bench Verified. Scale описывает его как бенчмарк для долгосрочных задач software engineering в более реалистичных репозиториях, с 1 865 задачами всего по 41 репозиторию: 731 публичная, 858 закрытых и 276 коммерческих (Scale). Публичный набор использует open-source-репозитории с сильными copyleft-лицензиями; приватное подмножество использует проприетарные кодовые базы стартапов.
Основная метрика — resolve rate. Задача считается решенной, когда отправленный патч проходит новые fail-to-pass-тесты и не ломает pass-to-pass-тесты (Scale). Эта деталь важна. Модель не получает зачет за правдоподобный патч, красивый diff или полезное объяснение. Она должна изменить репозиторий так, чтобы среда бенчмарка это приняла.
Именно поэтому SWE-Bench Pro относится к категории репозиторных агентов. Реалистичный запуск агента больше похож не на «напиши функцию», а на:
1. inspect issue and requirements
2. search repository conventions
3. edit one or more files
4. run targeted tests
5. debug failures
6. rerun regression tests
7. return a patch
Именно в таком потоке начинают по-настоящему значить работа с контекстом, использование инструментов, восстановление после ошибок и дисциплина тестирования. Модель, которая блистает в изолированной генерации кода, все еще может развалиться, когда дерево зависимостей враждебно или падающий тест прячется в специфичном для фреймворка пограничном случае.

Загвоздка: бенчмарк под давлением
Неудобная часть: OpenAI опубликовала таблицу GPT-5.6 9 июля 2026 года, через день после публикации подробного аудита SWE-Bench Pro 8 июля. В этом аудите OpenAI оценила, что около 30% задач SWE-Bench Pro сломаны, и заявила, что отзывает свою прежнюю рекомендацию принять этот бенчмарк (OpenAI).
Аудит дал две разные оценки: automated-plus-review pipeline отметил 200 сломанных задач, или 27,4%, тогда как кампания человеческой разметки выявила 249, или 34,1% (OpenAI). Перечисленные категории сбоев — ровно те, которых боятся пользователи бенчмарков: чрезмерно строгие тесты, недостаточно определенные промпты, тесты с низким покрытием и вводящие в заблуждение промпты.
Это не делает таблицу бесполезной. Но означает, что не стоит воспринимать второй знак после запятой — или даже несколько процентных пунктов — как инженерную истину. Разрыв в 15,4 пункта между Claude Fable 5 и GPT-5.6 Sol все еще достаточно значим, чтобы его исследовать. Разрыв в 1–2 пункта на этом бенчмарке в июле 2026 года был бы слабым доказательством.
Практичная позиция такая: используйте SWE-Bench Pro как заявленный репозиторный сигнал, а затем прогоняйте собственный harness, прежде чем строить вокруг него архитектуру.
Не смешивайте это с Terminal-Bench или Aider
В той же таблице GPT-5.6 OpenAI также приводит Terminal-Bench 2.1, где GPT-5.6 Sol показывает 88,8%, GPT-5.6 Sol Ultra — 91,9%, Claude Fable 5 — 83,1%, а Gemini 3.1 Pro Preview — 70,7% (OpenAI). Это рассказывает другую историю, потому что форма задач другая. Terminal-Bench делает акцент на терминальных workflow. SWE-Bench Pro делает акцент на разрешении репозиторных патчей.
Смешивать эти результаты в одно число «лучшая модель для кодинга» — верный способ обмануть самих себя. Бенчмарки в стиле Aider добавляют еще один слой harness: формат промпта, режим редактирования, политика retry и model-specific-адаптеры могут сдвигать результаты. Они полезны, но не взаимозаменяемы с репозиторным бенчмарком, у которого собственная конструкция задач и правила оценивания.
Для разработчиков кодинговых агентов разделите свой eval-лист на дорожки:
repo_patch_resolution:
benchmark: SWE-Bench Pro
metric: resolve_rate
terminal_workflows:
benchmark: Terminal-Bench
metric: task_success
interactive_editing:
benchmark: Aider-style runs
metric: accepted_patch_or_tests_passed
internal_repos:
benchmark: private eval set
metric: merged_patch_after_review
Затем сравнивайте модели внутри каждой дорожки. Не усредняйте дорожки, если явно не задали веса. У migration-агента, бота для написания тестов и терминального ops-агента разные стоимости ошибок.
Итог
Если дорожка — SWE-Bench Pro, Claude Fable 5 является заявленным лидером среди этих трех моделей: 80,0% против 64,6% у GPT-5.6 Sol и 54,2% у Gemini 3.1 Pro Preview. GPT-5.6 Sol дешевле Fable 5 по прайс-листу API: $5/$30 за миллион токенов против $10/$50, так что он все еще может победить по throughput с учетом стоимости, если ваш агент способен терпеть более низкий заявленный resolve rate. Gemini 3.1 Pro Preview еще дешевле — $2/$12 для промптов до 200k токенов, но заявленный разрыв на SWE-Bench Pro достаточно велик, чтобы проверить его на собственных репозиториях, прежде чем называть модель экономичным выбором.
Самый важный вывод — не «Claude выигрывает во всем». Он такой: для репозиторных агентов используйте репозиторные бенчмарки, указывайте harness и не забывайте о состоянии самого бенчмарка. Сейчас SWE-Bench Pro говорит, что Fable 5 лидирует в этом сравнении, но у самого бенчмарка достаточно задокументированных проблем с качеством, чтобы серьезные команды воспринимали его как фильтр для шорт-листа, а не как решение о деплое.
Читатели, которые хотят попробовать эти модели на практике, могут вызывать Claude и другие модели через onehop с OpenAI-совместимым API: поменяйте один base_url, сравните прогоны и сохраните стабильным свой harness (вызывать Claude и другие модели на onehop). Новые аккаунты получают $10 бесплатного кредита без необходимости указывать карту, а цены ниже, чем при доступе напрямую у провайдеров (получить $10 бесплатного кредита).
Похожие материалы

GPT-5 против Gemini 2.5 Pro и Claude Opus 4 в Aider Polyglot Coding
Сравнение GPT-5, Gemini 2.5 Pro и Claude Opus 4 на Aider Polyglot Coding с упором на данные.
17 июня 2026 г. · 22 мин чтения

Gemini 3.1 Pro против GPT-5.2 и Claude Opus 4.6 на Terminal-Bench 2.0
Gemini 3.1 Pro лидирует в общем прогоне Terminal-Bench 2.0, но выбор harness меняет картину для CLI-кодинга.
16 июня 2026 г. · 23 мин чтения

Вызов Qwen3.7 Plus через OpenAI SDK в совместимом режиме DashScope
Переносите приложения на OpenAI SDK на Qwen3.7 Plus: base_url, управление thinking, цены на длинный контекст и рабочий код.
23 июля 2026 г. · 27 мин чтения