전체 글로 돌아가기
벤치마크

SWE-Bench Pro에서 GPT-5.6 Sol vs Claude Fable 5 vs Gemini 3.1 Pro 비교

2026년 7월 23일 · 14분 읽기 · Claude / GPT / Gemini

크림색 편집풍 커버 이미지. 세 개의 추상적인 모델 열이 제품군 색상으로 개념적으로 표시되어 있으며, 테라코

후보군을 바꾸는 숫자

보고된 SWE-Bench Pro 행에서 이겨야 할 모델은 Claude Fable 5입니다: 80.0%. GPT-5.6 Sol은 64.6%입니다. Gemini 3.1 Pro Preview는 54.2%입니다. 이 세 숫자는 OpenAI의 2026년 7월 9일 GPT-5.6 출시 표에서, Coding 섹션의 SWE-Bench Pro 항목에 나온 것입니다(OpenAI).

Claude Fable 5와 GPT-5.6 Sol 사이에는 15.4포인트 차이가 있고, Claude Fable 5와 Gemini 3.1 Pro Preview 사이에는 25.8포인트 차이가 있습니다. 코딩 에이전트 빌더에게는 가볍게 넘기기엔 너무 큰 차이입니다.

하지만 헤드라인보다 더 좁게 해석하는 것이 맞습니다. 이것은 리포지토리 수준의 에이전트형 코딩입니다. Terminal-Bench가 아닙니다. Aider의 리더보드도 아닙니다. 바이브 코딩 UI 벤치마크도 아닙니다. 제품이 실제 리포지토리에 패치를 적용하고, 파일을 열고, 테스트를 실행하고, 여러 모듈을 넘나들며 수정하고, 복잡한 의존성 그래프를 견뎌야 한다면 SWE-Bench Pro는 많은 일반적인 코딩 항목보다 워크로드에 더 가깝습니다. 제품이 주로 채팅 완성, 코드 스니펫, CLI 퍼즐 풀이에 가깝다면 이 항목은 여러 신호 중 하나일 뿐입니다.

크림색 배경의 가로 막대 차트. 보고된 SWE-Bench Pro 해결률을 비교하며 Claude Fable 5는 테라 색상으로 80.0을 기록

비교 표

다른 코딩 에이전트 수치와 벤치마크 항목을 분리해 정리한 버전입니다.

모델 벤더 제품군 보고된 SWE-Bench Pro 점수 점수 출처 확인한 API 가격
Claude Fable 5 Claude 80.0% OpenAI GPT-5.6 표(OpenAI) 100만 토큰당 입력 $10 / 출력 $50(Anthropic)
GPT-5.6 Sol GPT 64.6% OpenAI GPT-5.6 표(OpenAI) 100만 토큰당 입력 $5 / 출력 $30(OpenAI)
Gemini 3.1 Pro Preview Gemini 54.2% OpenAI GPT-5.6 표(OpenAI); Google의 Gemini 3.5 Flash 모델 카드에서 SWE-Bench Pro Public의 Gemini 3.1 Pro 결과와 교차 확인(Google DeepMind) 최대 200k 토큰 프롬프트, standard tier 기준 100만 토큰당 입력 $2 / 출력 $12(Google AI)

Gemini 수치는 교차 확인 근거가 가장 좋습니다. Google의 Gemini 3.5 Flash 모델 카드는 “2026년 5월 기준” 결과를 나열하며, “Single attempt” 설정에서 “SWE-Bench Pro (Public)”에 대해 Gemini 3.1 Pro가 54.2%라고 보고합니다(Google DeepMind). OpenAI의 7월 표도 “Gemini 3.1 Pro Preview”에 동일한 54.2% 숫자를 사용합니다. 이것이 모든 세부 harness 설정이 동일하다는 증거는 아니지만, Gemini 점수가 단일 벤더 인용만 있는 경우보다 덜 의심스럽게 보이게 합니다.

이 비교에서 Claude Fable 5의 80.0% 점수는 Anthropic 벤치마크 표가 아니라 OpenAI의 표를 출처로 합니다. Anthropic의 Fable 페이지는 출시 맥락과 가격을 확인하는 데 여전히 유용합니다. Fable 5는 “가장 어려운 지식 및 코딩 작업”을 위한 모델로 포지셔닝되어 있고, claude-fable-5 API 이름을 사용하며, 100만 입력 토큰당 $10 및 100만 출력 토큰당 $50로 책정되어 있습니다(Anthropic). Anthropic은 또한 Fable 5와 Mythos 5가 6월 9일 출시되었고, 미국 정부 지침 이후 6월 12일 중단되었으며, 수출 통제가 해제된 뒤 7월 1일 전 세계적으로 복구되었다고 밝혔습니다(Anthropic).

SWE-Bench Pro가 실제로 측정하는 것

SWE-Bench Pro는 기존 SWE-Bench Verified의 한계를 넘어서기 위해 만들어졌습니다. Scale은 이를 더 현실적인 리포지토리에서 장기 호라이즌 소프트웨어 엔지니어링 작업을 평가하는 벤치마크로 설명하며, 총 41개 리포지토리에 걸쳐 1,865개 작업이 있습니다. 공개 작업 731개, 비공개 held-out 작업 858개, 상용 작업 276개입니다(Scale). 공개 세트는 강한 카피레프트 라이선스를 가진 오픈소스 리포지토리를 사용하고, 비공개 하위 집합은 독점 스타트업 코드베이스를 사용합니다.

주요 지표는 해결률(resolve rate)입니다. 제출된 패치가 새로운 fail-to-pass 테스트를 통과하고 pass-to-pass 테스트를 깨지 않을 때 작업이 해결된 것으로 간주됩니다(Scale). 이 세부 사항은 중요합니다. 모델은 그럴듯한 패치, 보기 좋은 diff, 도움이 되는 설명만으로는 점수를 받지 못합니다. 벤치마크 환경이 받아들이는 방식으로 리포지토리를 변경해야 합니다.

그래서 SWE-Bench Pro는 리포지토리 에이전트 범주에 속합니다. 현실적인 에이전트 실행은 “함수 하나 작성하기”보다 다음에 더 가깝습니다.

1. inspect issue and requirements
2. search repository conventions
3. edit one or more files
4. run targeted tests
5. debug failures
6. rerun regression tests
7. return a patch

이 흐름이야말로 컨텍스트 처리, 도구 사용, 오류 복구, 테스트 규율이 중요해지기 시작하는 지점입니다. 고립된 코드 생성에서 빛나는 모델도 의존성 트리가 적대적이거나 실패 테스트가 프레임워크 특유의 엣지 케이스에 숨어 있으면 무너질 수 있습니다.

크림색 배경의 깔끔한 흐름도. 코딩 에이전트 파이프라인을 보여주며 issue intake, repo search, patch edit, test run,

문제점: 벤치마크가 압박을 받고 있다

불편한 부분은 이것입니다. OpenAI는 2026년 7월 9일 GPT-5.6 표를 공개했는데, 이는 7월 8일 상세한 SWE-Bench Pro 감사 결과를 공개한 바로 다음 날이었습니다. 그 감사에서 OpenAI는 SWE-Bench Pro 작업의 약 30%가 깨져 있다고 추정했고, 해당 벤치마크 채택을 권장했던 이전 입장을 철회한다고 밝혔습니다(OpenAI).

감사에서는 두 가지 서로 다른 추정치가 나왔습니다. 자동화와 리뷰를 결합한 파이프라인은 깨진 작업 200개, 즉 27.4%를 플래그했고, 인간 주석 캠페인은 249개, 즉 34.1%를 식별했습니다(OpenAI). 나열된 실패 범주는 벤치마크 사용자들이 두려워하는 바로 그 항목들입니다. 지나치게 엄격한 테스트, 불충분하게 명세된 프롬프트, 낮은 커버리지의 테스트, 오해를 유발하는 프롬프트입니다.

그렇다고 표가 쓸모없다는 뜻은 아닙니다. 다만 소수점 둘째 자리나 심지어 몇 퍼센트포인트 차이까지도 엔지니어링상 진실로 취급해서는 안 된다는 의미입니다. Claude Fable 5와 GPT-5.6 Sol 사이의 15.4포인트 차이는 여전히 조사할 만큼 의미가 있습니다. 2026년 7월의 이 벤치마크에서 1~2포인트 차이는 약한 증거일 것입니다.

실무적인 입장은 이렇습니다. SWE-Bench Pro를 보고된 리포지토리 수준 신호로 사용하되, 그것을 중심으로 아키텍처를 구매하기 전에 자체 harness를 다시 실행하세요.

Terminal-Bench나 Aider와 섞지 마세요

OpenAI의 동일한 GPT-5.6 표는 Terminal-Bench 2.1도 보고합니다. 여기서 GPT-5.6 Sol은 88.8%, GPT-5.6 Sol Ultra는 91.9%, Claude Fable 5는 83.1%, Gemini 3.1 Pro Preview는 70.7%입니다(OpenAI). 이는 다른 작업 형태이기 때문에 다른 이야기를 들려줍니다. Terminal-Bench는 터미널 워크플로를 강조합니다. SWE-Bench Pro는 리포지토리 패치 해결을 강조합니다.

이 점수들을 하나의 “최고의 코딩 모델” 숫자로 섞는 것이 팀들이 스스로를 속이는 방식입니다. Aider 스타일 벤치마크는 또 다른 harness 계층을 추가합니다. 프롬프트 형식, 편집 모드, 재시도 정책, 모델별 어댑터가 결과를 움직일 수 있습니다. 유용하긴 하지만, 자체 작업 구성과 채점 규칙을 사용하는 리포지토리 벤치마크와 서로 바꿔 쓸 수는 없습니다.

코딩 에이전트 빌더라면 평가 시트를 레인별로 분리하세요.

repo_patch_resolution:
  benchmark: SWE-Bench Pro
  metric: resolve_rate
terminal_workflows:
  benchmark: Terminal-Bench
  metric: task_success
interactive_editing:
  benchmark: Aider-style runs
  metric: accepted_patch_or_tests_passed
internal_repos:
  benchmark: private eval set
  metric: merged_patch_after_review

그다음 각 레인 안에서 모델을 비교하세요. 가중치를 명시하지 않는 한 레인들을 평균내지 마세요. 마이그레이션 에이전트, 테스트 작성 봇, 터미널 운영 에이전트는 실패 비용이 서로 다릅니다.

결론

SWE-Bench Pro가 해당 레인이라면, 이 세 모델 중 보고된 선두는 Claude Fable 5입니다. GPT-5.6 Sol의 64.6%, Gemini 3.1 Pro Preview의 54.2%에 비해 80.0%입니다. GPT-5.6 Sol은 정가 API 가격 기준으로 100만 토큰당 $5/$30으로 Fable 5의 $10/$50보다 저렴하므로, 에이전트가 더 낮은 보고 해결률을 감내할 수 있다면 비용 조정 처리량에서는 여전히 이길 수 있습니다. Gemini 3.1 Pro Preview는 최대 200k 토큰 프롬프트에서 $2/$12로 더 저렴하지만, 보고된 SWE-Bench Pro 격차가 충분히 크기 때문에 경제적인 선택이라고 부르기 전에 자체 리포지토리에서 검증해야 합니다.

가장 날카로운 요점은 “Claude가 모든 것을 이긴다”가 아닙니다. 바로 이것입니다. 리포지토리 수준 에이전트에는 리포지토리 수준 벤치마크를 사용하고, harness를 명시하며, 벤치마크의 건강 상태를 계속 확인하세요. 현재 SWE-Bench Pro는 이 비교에서 Fable 5가 앞선다고 말하지만, 벤치마크 자체에 문서화된 품질 문제가 충분히 있으므로 진지한 팀이라면 이를 배포 결정이 아니라 후보군 필터로 다뤄야 합니다.

이 모델들을 직접 사용해 보고 싶은 독자는 OpenAI 호환 API를 제공하는 onehop을 통해 Claude와 다른 모델들을 호출할 수 있습니다. base_url 하나만 바꾸고 실행을 비교하면서 harness는 안정적으로 유지하세요(onehop에서 Claude와 다른 모델 호출하기). 신규 계정은 카드 없이 $10 무료 크레딧을 받을 수 있으며, 가격은 1차 제공사 직접 접근보다 저렴합니다($10 무료 크레딧으로 가입하기).