DeepSeek supera su propio modelo Pro en benchmarks agentivos con V4-Flash-0731 por US$ 0,14 por millón de tokens

Lanzado el 31 de julio, el V4-Flash-0731 registra 82,7 en TerminalBench 2.1, frente a 72,1 del V4-Pro-Preview, con la misma arquitectura de la vista previa de abril y un costo de US$ 0,14 por millón de tokens de entrada.
DeepSeek publicó el DeepSeek-V4-Flash-0731 en Hugging Face y movió la API oficial a beta pública el 31 de julio de 2026. La empresa fue directa en la documentación del modelo: la arquitectura y el tamaño del checkpoint son idénticos a la vista previa de abril. El modelo mantiene 284 mil millones de parámetros totales, con 13 mil millones activados por token a través de Mixture-of-Experts dispersa, ventana de contexto de 1 millón de tokens y salida máxima de 384 mil tokens. Lo que cambió fue el post-entrenamiento, rehecho con enfoque en coding, razonamiento, uso de herramientas y flujos agentivos.
Para los equipos de producto que ya utilizaban el endpoint deepseek-v4-flash, la transición fue automática: las aplicaciones heredaron la actualización sin modificación de código. El modelo empezó a soportar nativamente el formato Responses API y entró en beta en el Codex API, el mismo estándar de interfaz adoptado por OpenAI, lo que facilita comparaciones directas entre los dos entornos de herramientas sin migración de pila.
Los números son de DeepSeek, y son sustanciales
Según datos publicados por la propia DeepSeek, el V4-Flash-0731 supera al V4-Pro-Preview en todos los nueve benchmarks agentivos de la empresa. En TerminalBench 2.1, el nuevo modelo registra 82,7, frente a 72,1 del Pro-Preview y 61,8 del Flash Preview de abril. En DeepSWE, la diferencia es aún más expresiva: 54,4 en el 0731 contra 7,3 en la vista previa, una variación de 7,4 veces. El índice de inteligencia de la Artificial Analysis sitúa el modelo en 50 puntos, 10 por encima del Flash anterior.
La advertencia es necesaria: todos estos números provienen del harness interno de DeepSeek. Ningún laboratorio independiente había reproducido las métricas hasta el cierre de este artículo. Esto no invalida el dato, pero lo mantiene en el territorio de declaración del proveedor mientras aguarda verificación externa.
El precio es el argumento que no depende de benchmark
El V4-Flash-0731 está listado en OpenRouter a US$ 0,14 por millón de tokens de entrada en caché miss y US$ 0,28 por millón de tokens de salida. Los hits de caché bajan a US$ 0,0028. Anthropic cobra US$ 2,00 por millón de tokens de entrada en Sonnet 5, precio introductorio vigente hasta el 31 de agosto de 2026, y US$ 5,00 en Opus 5, según tablas de precio publicadas por la empresa en julio de 2026. La diferencia en el caso del modelo tope de línea de Anthropic es de 36 veces.
En TerminalBench 2.1, el Opus 4.8 de Anthropic registra 85,0, según la tabla comparativa publicada por la propia DeepSeek, 2,3 puntos por encima del V4-Flash-0731. El Sonnet 5, que Anthropic posiciona como teniendo un rendimiento cercano al Opus 4.8, cuesta 14 veces más que el V4-Flash-0731 al precio introductorio. Si los benchmarks de DeepSeek se sostienen bajo evaluación externa, la distancia entre el modelo chino y el tope del mercado occidental es menor que la distancia entre sus precios.
De China a Silicon Valley y Bengaluru
DeepSeek es operada por High Flyer Capital Management, gestora cuantitativa con sede en Shenzhen. El modelo distribuye pesos abiertos a través de Hugging Face, donde la Inferencia hospedada reportó un throughput de 400 tokens por segundo a US$ 10 por hora, y está disponible globalmente a través de API, incluyendo por OpenRouter y por el propio endpoint de DeepSeek.
En Estados Unidos, el lanzamiento coincide con el pico de adopción de agentes de código en entornos de desarrollo. Empresas de software y startups de automatización que evalúan costo de inferencia a escala tienen, ahora, un argumento de precio concreto: US$ 0,14 por millón de tokens de entrada, independientemente de la procedencia geográfica del modelo.
En India, Wipro, Infosys y HCL Technologies administran contratos de automatización de software evaluados en decenas de miles de millones de dólares. Para arquitectos de solución de estas firmas, un modelo con benchmarks agentivos de esta magnitud, por menos de una décima del precio introductorio del Sonnet 5, requalifica el cálculo entre adoptar la infraestructura de modelo preferida por los clientes occidentales y construir pila propia con alternativas de costo menor.
Lo que el mercado aguarda en las próximas semanas es directo: reproducción independiente. Si laboratorios externos confirman los benchmarks agentivos del 0731, el modelo presiona a los proveedores occidentales a justificar márgenes que hoy se sustentan, en parte, en la ausencia de alternativas verificadas en esa franja de precio. Si los números se reducen bajo evaluación de terceros, el episodio endurece el escepticismo creciente sobre benchmarks auto-publicados en un sector donde el incentivo a inflar métricas es estructural y la capacidad de verificación externa aún es lenta.