GPT-5.6 Sol vs Claude Fable 5 vs Gemini 3.1 Pro no SWE-Bench Pro
23 de julho de 2026 · 23 min de leitura · Claude / GPT / Gemini

O número que muda a shortlist
Claude Fable 5 é o modelo a ser batido na linha reportada do SWE-Bench Pro: 80,0%. GPT-5.6 Sol está em 64,6%. Gemini 3.1 Pro Preview está em 54,2%. Esses três números vêm da tabela de lançamento do GPT-5.6 da OpenAI, de 9 de julho de 2026, na seção Coding para SWE-Bench Pro (OpenAI).
Isso representa uma diferença de 15,4 pontos entre Claude Fable 5 e GPT-5.6 Sol, e uma diferença de 25,8 pontos entre Claude Fable 5 e Gemini 3.1 Pro Preview. Para quem constrói agentes de codificação, é grande demais para ser ignorado.
Mas a leitura correta é mais específica do que a manchete. Trata-se de codificação agêntica em nível de repositório. Não é Terminal-Bench. Não é o ranking do Aider. Não é um benchmark de UI feita no vibe coding. Se o seu produto aplica patches em repositórios reais, abre arquivos, roda testes, edita em vários módulos e precisa sobreviver a grafos de dependências bagunçados, o SWE-Bench Pro está mais próximo da sua carga de trabalho do que muitas linhas genéricas de coding. Se o seu produto é principalmente completions em chat, snippets de código ou resolução de puzzles via CLI, essa linha é apenas um sinal.

A tabela de comparação
Aqui está a versão limpa, mantendo a linha do benchmark separada de outros números de agentes de codificação.
| Modelo | Família do fornecedor | Pontuação reportada no SWE-Bench Pro | Fonte da pontuação | Preço de API verificado |
|---|---|---|---|---|
| Claude Fable 5 | Claude | 80,0% | Tabela do GPT-5.6 da OpenAI (OpenAI) | US$ 10 entrada / US$ 50 saída por 1M de tokens (Anthropic) |
| GPT-5.6 Sol | GPT | 64,6% | Tabela do GPT-5.6 da OpenAI (OpenAI) | US$ 5 entrada / US$ 30 saída por 1M de tokens (OpenAI) |
| Gemini 3.1 Pro Preview | Gemini | 54,2% | Tabela do GPT-5.6 da OpenAI (OpenAI); checado em paralelo com o model card do Gemini 3.5 Flash do Google para Gemini 3.1 Pro no SWE-Bench Pro Public (Google DeepMind) | US$ 2 entrada / US$ 12 saída por 1M de tokens para prompts de até 200k tokens, tier padrão (Google AI) |
O número do Gemini tem a melhor checagem cruzada. O model card do Gemini 3.5 Flash do Google lista resultados “as of May, 2026” e reporta Gemini 3.1 Pro em 54,2% no “SWE-Bench Pro (Public)” com uma configuração de “Single attempt” (Google DeepMind). A tabela de julho da OpenAI usa “Gemini 3.1 Pro Preview” e o mesmo número de 54,2%. Isso não prova que as configurações do harness sejam idênticas em todos os detalhes, mas torna a pontuação do Gemini menos suspeita do que uma citação única, vinda de apenas um fornecedor.
A pontuação de 80,0% do Claude Fable 5, nesta comparação, vem da tabela da OpenAI, não de uma tabela de benchmark da Anthropic. A própria página do Fable da Anthropic ainda é útil para contexto de lançamento e preço: Fable 5 é posicionado para “hardest knowledge and coding work”, usa o nome de API claude-fable-5 e custa US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída (Anthropic). A Anthropic também diz que Fable 5 e Mythos 5 foram lançados em 9 de junho, suspensos em 12 de junho após uma diretriz do governo dos EUA e restaurados globalmente em 1º de julho depois que controles de exportação foram suspensos (Anthropic).
O que o SWE-Bench Pro realmente mede
O SWE-Bench Pro foi criado para ir além do teto do SWE-Bench Verified mais antigo. A Scale o descreve como um benchmark para tarefas de engenharia de software de horizonte longo em repositórios mais realistas, com 1.865 tarefas no total em 41 repositórios: 731 públicas, 858 retidas e 276 comerciais (Scale). O conjunto público usa repositórios open source com licenças copyleft fortes; o subconjunto privado usa bases de código proprietárias de startups.
A métrica principal é a taxa de resolução. Uma tarefa conta como resolvida quando o patch enviado passa nos novos testes fail-to-pass e não quebra os testes pass-to-pass (Scale). Esse detalhe importa. Um modelo não ganha crédito por um patch plausível, um diff bonito ou uma explicação útil. Ele precisa alterar o repositório de uma forma que o ambiente do benchmark aceite.
É por isso que o SWE-Bench Pro pertence ao grupo de agentes de repositório. Uma execução realista de agente se parece menos com “escreva uma função” e mais com:
1. inspect issue and requirements
2. search repository conventions
3. edit one or more files
4. run targeted tests
5. debug failures
6. rerun regression tests
7. return a patch
Esse fluxo é exatamente onde tratamento de contexto, uso de ferramentas, recuperação de erros e disciplina de testes começam a importar. Um modelo que brilha em geração de código isolada ainda pode desandar quando a árvore de dependências é hostil ou quando o teste que falha está escondido em um caso de borda específico de um framework.

O porém: o benchmark está sob pressão
A parte desconfortável: a OpenAI publicou a tabela do GPT-5.6 em 9 de julho de 2026, um dia depois de publicar uma auditoria detalhada do SWE-Bench Pro em 8 de julho. Nessa auditoria, a OpenAI estimou que cerca de 30% das tarefas do SWE-Bench Pro estão quebradas e disse que estava retirando sua recomendação anterior de adoção do benchmark (OpenAI).
A auditoria encontrou duas estimativas diferentes: um pipeline automatizado com revisão sinalizou 200 tarefas quebradas, ou 27,4%, enquanto uma campanha de anotação humana identificou 249, ou 34,1% (OpenAI). As categorias de falha listadas são exatamente as que usuários de benchmarks temem: testes excessivamente rígidos, prompts subespecificados, testes com baixa cobertura e prompts enganosos.
Isso não torna a tabela inútil. Mas significa que você não deve tratar a segunda casa decimal, nem mesmo alguns pontos percentuais, como verdade de engenharia. Uma diferença de 15,4 pontos entre Claude Fable 5 e GPT-5.6 Sol ainda é significativa o bastante para investigar. Uma diferença de 1 ou 2 pontos seria uma evidência fraca nesse benchmark em julho de 2026.
A postura prática é esta: use o SWE-Bench Pro como um sinal reportado em nível de repositório e depois rode novamente seu próprio harness antes de construir uma arquitetura em torno dele.
Não misture com Terminal-Bench ou Aider
A mesma tabela do GPT-5.6 da OpenAI também reporta o Terminal-Bench 2.1, em que GPT-5.6 Sol está em 88,8%, GPT-5.6 Sol Ultra está em 91,9%, Claude Fable 5 está em 83,1% e Gemini 3.1 Pro Preview está em 70,7% (OpenAI). Isso conta uma história diferente porque o formato da tarefa é diferente. Terminal-Bench enfatiza workflows de terminal. SWE-Bench Pro enfatiza resolução de patches em repositórios.
Misturar essas pontuações em um único número de “melhor modelo de coding” é como equipes enganam a si mesmas. Benchmarks no estilo Aider adicionam outra camada de harness: formato do prompt, modo de edição, política de retry e adaptadores específicos de modelo podem mover os resultados. Eles são úteis, mas não são intercambiáveis com um benchmark de repositório que usa sua própria construção de tarefas e regras de avaliação.
Para quem constrói agentes de codificação, separe sua planilha de avaliação em faixas:
repo_patch_resolution:
benchmark: SWE-Bench Pro
metric: resolve_rate
terminal_workflows:
benchmark: Terminal-Bench
metric: task_success
interactive_editing:
benchmark: Aider-style runs
metric: accepted_patch_or_tests_passed
internal_repos:
benchmark: private eval set
metric: merged_patch_after_review
Depois compare os modelos dentro de cada faixa. Não tire a média das faixas, a menos que você explicite os pesos. Um agente de migração, um bot que escreve testes e um agente de operações em terminal têm custos de falha diferentes.
Resumo final
Se o SWE-Bench Pro é a faixa, Claude Fable 5 é o líder reportado entre estes três modelos: 80,0% contra 64,6% do GPT-5.6 Sol e 54,2% do Gemini 3.1 Pro Preview. GPT-5.6 Sol é mais barato que Fable 5 no preço de lista da API, US$ 5/US$ 30 por milhão de tokens contra US$ 10/US$ 50, então ainda pode vencer em throughput ajustado por custo se o seu agente tolerar a taxa de resolução reportada mais baixa. Gemini 3.1 Pro Preview é ainda mais barato, US$ 2/US$ 12 até prompts de 200k tokens, mas a diferença reportada no SWE-Bench Pro é grande o bastante para você validá-la nos seus próprios repositórios antes de chamá-lo de escolha econômica.
O insight mais importante não é “Claude vence tudo”. É este: para agentes em nível de repositório, use benchmarks em nível de repositório, cite o harness e mantenha a saúde do benchmark em vista. O SWE-Bench Pro atualmente diz que Fable 5 lidera esta comparação, mas o próprio benchmark tem problemas de qualidade documentados suficientes para que equipes sérias o tratem como um filtro de shortlist, não como uma decisão de deployment.
Leitores que quiserem testar esses modelos na prática podem chamar Claude e outros modelos pela onehop com uma API compatível com OpenAI: troque um base_url, compare execuções e mantenha seu harness estável (chame Claude e outros modelos na onehop). Novas contas ganham US$ 10 de crédito grátis sem precisar de cartão, e os preços são mais baixos do que o acesso direto aos provedores (cadastre-se para receber US$ 10 de crédito grátis).
Leituras relacionadas

GPT-5 vs Gemini 2.5 Pro vs Claude Opus 4 em codificação no Aider Polyglot
Uma comparação orientada por dados entre GPT-5, Gemini 2.5 Pro e Claude Opus 4 em codificação no Aider Polyglot.
17 de junho de 2026 · 23 min de leitura

Gemini 3.1 Pro vs GPT-5.2 vs Claude Opus 4.6 no Terminal-Bench 2.0
Gemini 3.1 Pro lidera no harness compartilhado do Terminal-Bench 2.0, mas a escolha do harness muda a história para CLIs.
16 de junho de 2026 · 23 min de leitura

Chame o Qwen3.7 Plus com o SDK da OpenAI via modo compatível do DashScope
Porte apps do SDK da OpenAI para o Qwen3.7 Plus com base_url, controles de thinking, preços de contexto longo e código executável.
23 de julho de 2026 · 27 min de leitura