Volver a todos los articulos
Benchmarks

GPT-5.6 Sol vs Claude Fable 5 vs Gemini 3.1 Pro en SWE-Bench Pro

23 de julio de 2026 · 23 min de lectura · Claude / GPT / Gemini

Una imagen de portada editorial en color crema que muestra tres columnas abstractas de modelos etiquetadas conceptualmente por colores de familia, con un terraco

La cifra que cambia la lista corta

Claude Fable 5 es el modelo a batir en la fila reportada de SWE-Bench Pro: 80,0 %. GPT-5.6 Sol está en 64,6 %. Gemini 3.1 Pro Preview está en 54,2 %. Esas tres cifras proceden de la tabla de lanzamiento de GPT-5.6 de OpenAI del 9 de julio de 2026, en la sección Coding para SWE-Bench Pro (OpenAI).

Eso supone una brecha de 15,4 puntos entre Claude Fable 5 y GPT-5.6 Sol, y una brecha de 25,8 puntos entre Claude Fable 5 y Gemini 3.1 Pro Preview. Para quien construye agentes de codificación, es demasiado grande como para despacharla con un gesto.

Pero la lectura correcta es más acotada que el titular. Esto es codificación agéntica a nivel de repositorio. No es Terminal-Bench. No es la clasificación de Aider. No es un benchmark de interfaces con vibe coding. Si tu producto parchea repos reales, abre archivos, ejecuta tests, edita en varios módulos y necesita sobrevivir a grafos de dependencias complicados, SWE-Bench Pro se acerca más a tu carga de trabajo que muchas filas genéricas de codificación. Si tu producto consiste sobre todo en completados de chat, fragmentos de código o resolución de acertijos de CLI, esta fila es solo una señal.

Gráfico de barras horizontal sobre fondo crema que compara las tasas de resolución reportadas en SWE-Bench Pro: Claude Fable 5 en 80,0 en terracota

La tabla comparativa

Aquí está la versión limpia, manteniendo la fila del benchmark separada de otros números de agentes de codificación.

Modelo Familia del proveedor Puntuación reportada en SWE-Bench Pro Fuente de la puntuación Precio de API comprobado
Claude Fable 5 Claude 80,0 % Tabla de GPT-5.6 de OpenAI (OpenAI) 10 $ entrada / 50 $ salida por 1 M de tokens (Anthropic)
GPT-5.6 Sol GPT 64,6 % Tabla de GPT-5.6 de OpenAI (OpenAI) 5 $ entrada / 30 $ salida por 1 M de tokens (OpenAI)
Gemini 3.1 Pro Preview Gemini 54,2 % Tabla de GPT-5.6 de OpenAI (OpenAI); contrastado con la ficha de modelo de Gemini 3.5 Flash de Google para Gemini 3.1 Pro en SWE-Bench Pro Public (Google DeepMind) 2 $ entrada / 12 $ salida por 1 M de tokens para prompts de hasta 200k tokens, nivel estándar (Google AI)

La cifra de Gemini es la que tiene la mejor comprobación cruzada. La ficha de modelo de Gemini 3.5 Flash de Google lista resultados “as of May, 2026” y reporta Gemini 3.1 Pro con 54,2 % en “SWE-Bench Pro (Public)” con una configuración de “Single attempt” (Google DeepMind). La tabla de julio de OpenAI usa “Gemini 3.1 Pro Preview” y la misma cifra del 54,2 %. Eso no demuestra que la configuración del harness sea idéntica en todos los detalles, pero sí hace que la puntuación de Gemini resulte menos sospechosa que una cita de un único proveedor.

La puntuación del 80,0 % de Claude Fable 5, en esta comparación, procede de la tabla de OpenAI y no de una tabla de benchmarks de Anthropic. La propia página de Fable de Anthropic sigue siendo útil para el contexto de lanzamiento y los precios: Fable 5 se posiciona para el “hardest knowledge and coding work”, usa el nombre de API claude-fable-5 y cuesta 10 $ por millón de tokens de entrada y 50 $ por millón de tokens de salida (Anthropic). Anthropic también dice que Fable 5 y Mythos 5 se lanzaron el 9 de junio, se suspendieron el 12 de junio tras una directiva del gobierno de EE. UU. y se restauraron globalmente el 1 de julio después de que se levantaran los controles de exportación (Anthropic).

Qué mide realmente SWE-Bench Pro

SWE-Bench Pro se creó para ir más allá del techo del antiguo SWE-Bench Verified. Scale lo describe como un benchmark para tareas de ingeniería de software de largo horizonte en repositorios más realistas, con 1.865 tareas totales en 41 repositorios: 731 públicas, 858 reservadas y 276 comerciales (Scale). El conjunto público usa repositorios open source con licencias copyleft fuertes; el subconjunto privado usa bases de código propietarias de startups.

La métrica principal es la tasa de resolución. Una tarea cuenta como resuelta cuando el parche enviado supera las nuevas pruebas fail-to-pass y no rompe las pruebas pass-to-pass (Scale). Ese detalle importa. Un modelo no recibe crédito por un parche plausible, un diff bonito o una explicación útil. Tiene que cambiar el repo de una forma que el entorno del benchmark acepte.

Por eso SWE-Bench Pro pertenece al grupo de agentes de repositorio. Una ejecución realista de un agente se parece menos a “escribe una función” y más a:

1. inspect issue and requirements
2. search repository conventions
3. edit one or more files
4. run targeted tests
5. debug failures
6. rerun regression tests
7. return a patch

Ese flujo es justo donde empiezan a importar la gestión de contexto, el uso de herramientas, la recuperación ante errores y la disciplina con los tests. Un modelo que brilla en generación de código aislada puede venirse abajo cuando el árbol de dependencias es hostil o el test que falla se esconde en un caso límite específico de un framework.

Diagrama de flujo limpio sobre fondo crema que muestra un pipeline de agente de codificación: entrada del issue, búsqueda en el repo, edición del parche, ejecución de tests,

La pega: el benchmark está bajo presión

La parte incómoda: OpenAI publicó la tabla de GPT-5.6 el 9 de julio de 2026, un día después de publicar una auditoría detallada de SWE-Bench Pro el 8 de julio. En esa auditoría, OpenAI estimó que alrededor del 30 % de las tareas de SWE-Bench Pro están rotas y dijo que retiraba su recomendación anterior de adoptar el benchmark (OpenAI).

La auditoría encontró dos estimaciones distintas: un pipeline automatizado más revisión marcó 200 tareas rotas, o el 27,4 %, mientras que una campaña de anotación humana identificó 249, o el 34,1 % (OpenAI). Las categorías de fallo listadas son exactamente las que temen los usuarios de benchmarks: tests demasiado estrictos, prompts poco especificados, tests con baja cobertura y prompts engañosos.

Eso no hace que la tabla sea inútil. Sí significa que no deberías tratar el segundo decimal, ni siquiera unos pocos puntos porcentuales, como una verdad de ingeniería. Una brecha de 15,4 puntos entre Claude Fable 5 y GPT-5.6 Sol sigue siendo lo bastante significativa como para investigarla. Una brecha de 1 o 2 puntos sería una evidencia débil en este benchmark en julio de 2026.

La postura práctica es esta: usa SWE-Bench Pro como una señal reportada a nivel de repositorio y luego vuelve a ejecutar tu propio harness antes de comprar arquitectura en torno a ella.

No lo mezcles con Terminal-Bench ni con Aider

La misma tabla de GPT-5.6 de OpenAI también reporta Terminal-Bench 2.1, donde GPT-5.6 Sol está en 88,8 %, GPT-5.6 Sol Ultra en 91,9 %, Claude Fable 5 en 83,1 % y Gemini 3.1 Pro Preview en 70,7 % (OpenAI). Eso cuenta una historia distinta porque la forma de la tarea es distinta. Terminal-Bench enfatiza flujos de trabajo de terminal. SWE-Bench Pro enfatiza la resolución de parches en repos.

Mezclar esas puntuaciones en un único número de “mejor modelo de codificación” es la forma en que los equipos se engañan a sí mismos. Los benchmarks al estilo Aider añaden otra capa de harness: el formato del prompt, el modo de edición, la política de reintentos y los adaptadores específicos del modelo pueden mover los resultados. Son útiles, pero no son intercambiables con un benchmark de repositorios que usa su propia construcción de tareas y sus propias reglas de calificación.

Para quienes construyen agentes de codificación, separa tu hoja de evaluaciones en carriles:

repo_patch_resolution:
  benchmark: SWE-Bench Pro
  metric: resolve_rate
terminal_workflows:
  benchmark: Terminal-Bench
  metric: task_success
interactive_editing:
  benchmark: Aider-style runs
  metric: accepted_patch_or_tests_passed
internal_repos:
  benchmark: private eval set
  metric: merged_patch_after_review

Luego compara modelos dentro de cada carril. No promedies los carriles salvo que explicites los pesos. Un agente de migración, un bot que escribe tests y un agente de operaciones en terminal tienen costes de fallo distintos.

Conclusión

Si SWE-Bench Pro es el carril, Claude Fable 5 es el líder reportado entre estos tres modelos: 80,0 % frente al 64,6 % de GPT-5.6 Sol y el 54,2 % de Gemini 3.1 Pro Preview. GPT-5.6 Sol es más barato que Fable 5 con precios de API de lista, 5 $/30 $ por millón de tokens frente a 10 $/50 $, así que todavía puede ganar en throughput ajustado por coste si tu agente puede tolerar la tasa de resolución reportada más baja. Gemini 3.1 Pro Preview es aún más barato, 2 $/12 $ hasta prompts de 200k tokens, pero la brecha reportada en SWE-Bench Pro es lo bastante grande como para que debas validarla en tus propios repositorios antes de llamarlo la opción económica.

La conclusión más clara no es “Claude lo gana todo”. Es esta: para agentes a nivel de repo, usa benchmarks a nivel de repo, cita el harness y mantén a la vista la salud del benchmark. SWE-Bench Pro dice actualmente que Fable 5 lidera esta comparación, pero el propio benchmark tiene suficientes problemas de calidad documentados como para que los equipos serios lo traten como un filtro para la lista corta, no como una decisión de despliegue.

Los lectores que quieran probar estos modelos de primera mano pueden llamar a Claude y a otros modelos a través de onehop con una API compatible con OpenAI: cambia un base_url, compara ejecuciones y mantén estable tu harness (llamar a Claude y a otros modelos en onehop). Las cuentas nuevas reciben 10 $ de crédito gratis sin necesidad de tarjeta, y el precio es más barato que el acceso directo de los proveedores (regístrate para obtener 10 $ de crédito gratis).