Назад ко всем статьям
Бенчмарки

GPT-5.6 Sol против Claude Fable 5 и Gemini 3.1 Pro на SWE-Bench Pro

23 июля 2026 г. · 22 мин чтения · Claude / GPT / Gemini

Кремовая редакционная обложка с тремя абстрактными колонками моделей, концептуально обозначенными цветами семейств, с террако

Число, которое меняет шорт-лист

Claude Fable 5 — модель, которую нужно превзойти в заявленной строке SWE-Bench Pro: 80,0%. GPT-5.6 Sol показывает 64,6%. Gemini 3.1 Pro Preview — 54,2%. Эти три числа взяты из таблицы запуска GPT-5.6 от OpenAI от 9 июля 2026 года, из раздела Coding для SWE-Bench Pro (OpenAI).

Это разрыв в 15,4 пункта между Claude Fable 5 и GPT-5.6 Sol и разрыв в 25,8 пункта между Claude Fable 5 и Gemini 3.1 Pro Preview. Для разработчика кодингового агента это слишком много, чтобы просто отмахнуться.

Но правильная интерпретация уже, чем заголовок. Речь о репозиторном агентном кодинге. Это не Terminal-Bench. Это не лидерборд Aider. Это не бенчмарк для vibe-coded UI. Если ваш продукт патчит реальные репозитории, открывает файлы, запускает тесты, правит код в нескольких модулях и должен выживать в запутанных графах зависимостей, SWE-Bench Pro ближе к вашей нагрузке, чем многие общие строки про кодинг. Если ваш продукт — в основном чатовые completions, фрагменты кода или решение CLI-головоломок, эта строка — лишь один из сигналов.

Горизонтальная столбчатая диаграмма на кремовом фоне, сравнивающая заявленные доли решенных задач SWE-Bench Pro: Claude Fable 5 на 80,0 в терракотовом

Сравнительная таблица

Вот чистая версия, где строка бенчмарка отделена от других чисел по кодинговым агентам.

Модель Семейство вендора Заявленный результат SWE-Bench Pro Источник результата Проверенная цена API
Claude Fable 5 Claude 80,0% Таблица OpenAI GPT-5.6 (OpenAI) $10 input / $50 output за 1 млн токенов (Anthropic)
GPT-5.6 Sol GPT 64,6% Таблица OpenAI GPT-5.6 (OpenAI) $5 input / $30 output за 1 млн токенов (OpenAI)
Gemini 3.1 Pro Preview Gemini 54,2% Таблица OpenAI GPT-5.6 (OpenAI); перепроверено по модельной карточке Google Gemini 3.5 Flash для Gemini 3.1 Pro на SWE-Bench Pro Public (Google DeepMind) $2 input / $12 output за 1 млн токенов для промптов до 200k токенов, стандартный уровень (Google AI)

У числа Gemini есть лучшая перекрестная проверка. В модельной карточке Google Gemini 3.5 Flash указаны результаты «по состоянию на май 2026 года», а для Gemini 3.1 Pro сообщается 54,2% на «SWE-Bench Pro (Public)» в режиме «Single attempt» (Google DeepMind). В июльской таблице OpenAI используется «Gemini 3.1 Pro Preview» и то же число 54,2%. Это не доказывает, что настройки harness во всех деталях идентичны, но делает результат Gemini менее подозрительным, чем единственная ссылка только от одного вендора.

Результат Claude Fable 5 в 80,0% в этом сравнении взят из таблицы OpenAI, а не из таблицы бенчмарков Anthropic. Собственная страница Fable у Anthropic все равно полезна для контекста релиза и цен: Fable 5 позиционируется для «самой сложной работы со знаниями и кодом», использует API-имя claude-fable-5 и стоит $10 за миллион input-токенов и $50 за миллион output-токенов (Anthropic). Anthropic также сообщает, что Fable 5 и Mythos 5 были выпущены 9 июня, приостановлены 12 июня после директивы правительства США и снова стали доступны глобально 1 июля после снятия экспортных ограничений (Anthropic).

Что на самом деле измеряет SWE-Bench Pro

SWE-Bench Pro был создан, чтобы выйти за пределы потолка более старого SWE-Bench Verified. Scale описывает его как бенчмарк для долгосрочных задач software engineering в более реалистичных репозиториях, с 1 865 задачами всего по 41 репозиторию: 731 публичная, 858 закрытых и 276 коммерческих (Scale). Публичный набор использует open-source-репозитории с сильными copyleft-лицензиями; приватное подмножество использует проприетарные кодовые базы стартапов.

Основная метрика — resolve rate. Задача считается решенной, когда отправленный патч проходит новые fail-to-pass-тесты и не ломает pass-to-pass-тесты (Scale). Эта деталь важна. Модель не получает зачет за правдоподобный патч, красивый diff или полезное объяснение. Она должна изменить репозиторий так, чтобы среда бенчмарка это приняла.

Именно поэтому SWE-Bench Pro относится к категории репозиторных агентов. Реалистичный запуск агента больше похож не на «напиши функцию», а на:

1. inspect issue and requirements
2. search repository conventions
3. edit one or more files
4. run targeted tests
5. debug failures
6. rerun regression tests
7. return a patch

Именно в таком потоке начинают по-настоящему значить работа с контекстом, использование инструментов, восстановление после ошибок и дисциплина тестирования. Модель, которая блистает в изолированной генерации кода, все еще может развалиться, когда дерево зависимостей враждебно или падающий тест прячется в специфичном для фреймворка пограничном случае.

Чистая блок-схема на кремовом фоне, показывающая pipeline кодингового агента: прием issue, поиск по репозиторию, редактирование патча, запуск тестов,

Загвоздка: бенчмарк под давлением

Неудобная часть: OpenAI опубликовала таблицу GPT-5.6 9 июля 2026 года, через день после публикации подробного аудита SWE-Bench Pro 8 июля. В этом аудите OpenAI оценила, что около 30% задач SWE-Bench Pro сломаны, и заявила, что отзывает свою прежнюю рекомендацию принять этот бенчмарк (OpenAI).

Аудит дал две разные оценки: automated-plus-review pipeline отметил 200 сломанных задач, или 27,4%, тогда как кампания человеческой разметки выявила 249, или 34,1% (OpenAI). Перечисленные категории сбоев — ровно те, которых боятся пользователи бенчмарков: чрезмерно строгие тесты, недостаточно определенные промпты, тесты с низким покрытием и вводящие в заблуждение промпты.

Это не делает таблицу бесполезной. Но означает, что не стоит воспринимать второй знак после запятой — или даже несколько процентных пунктов — как инженерную истину. Разрыв в 15,4 пункта между Claude Fable 5 и GPT-5.6 Sol все еще достаточно значим, чтобы его исследовать. Разрыв в 1–2 пункта на этом бенчмарке в июле 2026 года был бы слабым доказательством.

Практичная позиция такая: используйте SWE-Bench Pro как заявленный репозиторный сигнал, а затем прогоняйте собственный harness, прежде чем строить вокруг него архитектуру.

Не смешивайте это с Terminal-Bench или Aider

В той же таблице GPT-5.6 OpenAI также приводит Terminal-Bench 2.1, где GPT-5.6 Sol показывает 88,8%, GPT-5.6 Sol Ultra — 91,9%, Claude Fable 5 — 83,1%, а Gemini 3.1 Pro Preview — 70,7% (OpenAI). Это рассказывает другую историю, потому что форма задач другая. Terminal-Bench делает акцент на терминальных workflow. SWE-Bench Pro делает акцент на разрешении репозиторных патчей.

Смешивать эти результаты в одно число «лучшая модель для кодинга» — верный способ обмануть самих себя. Бенчмарки в стиле Aider добавляют еще один слой harness: формат промпта, режим редактирования, политика retry и model-specific-адаптеры могут сдвигать результаты. Они полезны, но не взаимозаменяемы с репозиторным бенчмарком, у которого собственная конструкция задач и правила оценивания.

Для разработчиков кодинговых агентов разделите свой eval-лист на дорожки:

repo_patch_resolution:
  benchmark: SWE-Bench Pro
  metric: resolve_rate
terminal_workflows:
  benchmark: Terminal-Bench
  metric: task_success
interactive_editing:
  benchmark: Aider-style runs
  metric: accepted_patch_or_tests_passed
internal_repos:
  benchmark: private eval set
  metric: merged_patch_after_review

Затем сравнивайте модели внутри каждой дорожки. Не усредняйте дорожки, если явно не задали веса. У migration-агента, бота для написания тестов и терминального ops-агента разные стоимости ошибок.

Итог

Если дорожка — SWE-Bench Pro, Claude Fable 5 является заявленным лидером среди этих трех моделей: 80,0% против 64,6% у GPT-5.6 Sol и 54,2% у Gemini 3.1 Pro Preview. GPT-5.6 Sol дешевле Fable 5 по прайс-листу API: $5/$30 за миллион токенов против $10/$50, так что он все еще может победить по throughput с учетом стоимости, если ваш агент способен терпеть более низкий заявленный resolve rate. Gemini 3.1 Pro Preview еще дешевле — $2/$12 для промптов до 200k токенов, но заявленный разрыв на SWE-Bench Pro достаточно велик, чтобы проверить его на собственных репозиториях, прежде чем называть модель экономичным выбором.

Самый важный вывод — не «Claude выигрывает во всем». Он такой: для репозиторных агентов используйте репозиторные бенчмарки, указывайте harness и не забывайте о состоянии самого бенчмарка. Сейчас SWE-Bench Pro говорит, что Fable 5 лидирует в этом сравнении, но у самого бенчмарка достаточно задокументированных проблем с качеством, чтобы серьезные команды воспринимали его как фильтр для шорт-листа, а не как решение о деплое.

Читатели, которые хотят попробовать эти модели на практике, могут вызывать Claude и другие модели через onehop с OpenAI-совместимым API: поменяйте один base_url, сравните прогоны и сохраните стабильным свой harness (вызывать Claude и другие модели на onehop). Новые аккаунты получают $10 бесплатного кредита без необходимости указывать карту, а цены ниже, чем при доступе напрямую у провайдеров (получить $10 бесплатного кредита).