Fable 5.1 lidera Real-SWE con 38.8%; Benchmark reduce scores

Nuevo benchmark de Specific Labs evalúa agentes de código en bases privadas. Ningún modelo supera el 40%, y la caída contra el SWE-Bench Pro es de más de 42 puntos.
Specific Labs, startup del lote F25 de Y Combinator, publicó el 13 de septiembre el Real-SWE, un benchmark que evalúa agentes de código en bases privadas licenciadas de empresas reales. El Claude Fable 5.1 lidera con 38.8% de tareas resueltas, por delante del GPT-6 Astra (33.8%) y del Gemini 3.8 Flash (31.2%). El corte de dificultad cambia el marcador público: en el SWE-Bench Pro, el Fable 5.1 registra 81.2%.
Qué mide el Real-SWE
Cada tarea proporciona al agente una base de código que nunca ha visto (una aplicación con más de 200 mil usuarios, una plataforma fintech que procesa 100 mil extractos bancarios, herramientas internas de ventas de una empresa B2B) y el contexto que un ingeniero humano tendría antes de comenzar. La mediana es de 11 archivos por tarea. El agente necesita producir el diff que resuelve el ticket; pruebas automatizadas verifican si el comportamiento pretendido fue entregado sin romper el resto.
El punto que los fundadores de Specific Labs enfatizan: benchmarks públicos como el SWE-Bench están contaminados. Modelos de frontera ya han visto, directa o indirectamente, los repositorios abiertos que componen estas pruebas. Los números decrecen cuando el agente se encuentra con código genuinamente fuera de la distribución.
Qué dice el resultado a los compradores de IA de código
La distancia de 42.4 puntos entre el Fable 5.1 en el SWE-Bench Pro (81.2%) y en el Real-SWE (38.8%) redefine la métrica que los compradores empresariales estaban utilizando. Comprar un plan de "ingeniero de IA" basado en puntajes de benchmark público significa contratar rendimiento en Django, Flask y en los demás repositorios muestreados hasta el agotamiento. Dentro de un monolito Java de 15 años, o de un SAP personalizado sin documentación, el Fable 5.1 hoy entrega dos de cada cinco tickets. El GPT-6 Astra y el Gemini 3.8 Flash entregan uno de cada tres.
Ningún modelo pasa de la mitad en el Real-SWE. Para equipos de plataforma que planean usar agentes como capa de resolución autónoma de errores, el número real de revertidos, tickets reabiertos y revisiones humanas seguirá siendo lo suficientemente alto como para que la economía dependa de quienes revisan, no de quienes escriben.
Lectura global: prisa por automatizar entregas
Para las empresas estadounidenses del modelo, el resultado es de uso doble: valida la superioridad del Fable 5.1 en código, pero expone el tope de cualquier alegación de que el modelo reemplaza ingenieros de nivel medio. Anthropic informó a los inversores que su ingresos anualizados superaron los 30 mil millones de dólares este año; la compra que los grandes clientes hacen hoy es de productividad marginal por asiento, no de externalización de equipos completos.
Para India, es la curva que llevó a TCS a despedir 23.460 personas en FY26 para acelerar. El escepticismo sobre esta apuesta gana munición: si el mejor modelo entrega 38.8% en bases privadas típicas de engagement con clientes, TCS, Infosys y Wipro necesitan mantener ingenieros senior en el proceso justo donde prometieron reducir bench. El margen de "entrega AI-first" no proviene del modelo resolviendo el ticket solo, proviene del ingeniero remoto revisando tres diffs por hora en lugar de escribir uno.
Para Brasil, la lectura llega a través de los hubs de BPO y servicios compartidos que operan para clientes estadounidenses y europeos desde São Paulo y Curitiba, y por la pila de sistemas legados que el sector bancario y de seguros brasileño ha acumulado en los últimos veinte años. Las bases de COBOL y Java 1.6 que ejecutan la banca central puntuarían aún peor. Bradesco anuncia 6 mil millones de R$ al año en tecnología y Itaú, 2.7 mil millones solo en el primer trimestre; gran parte de esto es operación de mantenimiento en código que nunca entrará en el entrenamiento de un modelo público.
Dónde el Real-SWE aún puede engañar
La crítica obvia es la muestra. Tres docenas de bases privadas de empresas dispuestas a licenciar código no son la totalidad de la Fortune 500. Si la mezcla se inclina hacia SaaS relativamente reciente, el número exagera la dificultad en dirección a lo "nuevo" y subestima lo que ocurre dentro de un mainframe bancario. El equipo de Aider ya señaló un sesgo similar en el SWE-Bench Verified.
El segundo punto: 38.8% es el techo de resolución en intento único. Agentes con múltiples intentos, recuperación externa y humano en el loop entregan más. La pregunta para el CIO no es "¿Fable resuelve el 38%?", es cuánto cuesta cada intento que falla el Fable. Mientras Anthropic mantiene la lista de precios en 15 dólares por millón de tokens de salida en el Fable 5.1, cada ronda de reintento entra en la cuenta antes de que la economía cierre.