Estrategia5 minRedacción

DeepSeek lanza V4.1 Flash a US$ 0,60 por millón de tokens

Analista jovem em pé diante de duas telas em consultoria paulistana pela manhã, comparando planilha de custo por token e console da API da DeepSeek, com caderno aberto e setas desenhadas a mão.

DeepSeek anunció V4.1 Flash el martes, activo desde el 10 de septiembre a las 12h (hora de Pekín). Arquitectura MoE de 552B, 1M de tokens de contexto y enrutamiento automático del Pro al Flash el 14 de septiembre.

Un nuevo Flash, un nuevo techo de precio


DeepSeek anunció el martes 9 de septiembre el modelo V4.1 Flash, disponible a partir de las 12h, hora de Pekín, el 10 de septiembre (04:00 UTC). La tabla de precios entró en vigor al mismo tiempo. En tarifa fuera de pico, el V4.1 Flash cobra US$ 0,15 por millón de tokens de entrada no cacheados, US$ 0,003 por millón de tokens de entrada en caché y US$ 0,60 por millón de tokens de salida. En horario pico, entre 1h y 4h y entre 6h y 10h UTC en días laborables, los valores se duplican. A partir del 14 de septiembre, toda llamada dirigida a deepseek-v4-pro será enrutada automáticamente al Flash, cobrada a la tarifa más baja.


¿Qué hay en su interior?


Arquitectura Causal Encoder-Decoder asimétrica con 552 mil millones de parámetros totales, solo 8 mil millones activos en el procesamiento de entrada y 16 mil millones en la generación de salida. Ventana de contexto de hasta 1 millón de tokens. Comprensión multimodal nativa de texto e imagen. Es el modelo más pequeño de la nueva familia de arquitectura de DeepSeek, diseñado para una inferencia más económica y una escala futura. Según la evaluación pública de AlphaSignal, el V4.1 Flash supera al modelo insignia anterior de la propia empresa con una cuarta parte del costo de memoria.


En los benchmarks compilados por terceros, el Flash empata o está dentro de la distancia de tiro del GPT-5.6 Sol y del Claude Opus 5 en pruebas de codificación y uso de agente. En evaluaciones intensivas de conocimiento como HLE, y en algunas pruebas de terminal y codificación, los dos modelos occidentales siguen liderando con un margen claro. DeepSeek aún no ha publicado un informe técnico oficial ni una tabla de benchmark, por lo que parte de la lectura deberá esperar la próxima ola de replicaciones independientes.


¿Qué cambia para el comprador de IA en las próximas dos semanas?


El precio mínimo para un modelo de frontera con 1 millón de tokens de contexto y capacidad multimodal ha caído a US$ 0,60 por millón de tokens de salida. Anthropic cobra US$ 10 por millón de entrada y US$ 50 por millón de salida en Fable 5.1. OpenAI cobra en un rango comparable en Astra. La diferencia es de un orden de magnitud.


La recorte inmediato se centra en tres conversaciones. La primera es sobre trabajo de agente en masa. Consultorías de mediana tamaño que han construido su capa de orquestación sobre Sonnet o Fable deberán rehacer la hoja de cálculo en tres escenarios la próxima semana. Una operación con el 20% del volumen enrutado a DeepSeek en tareas de menor riesgo (resumen, extracción, transformación de texto) cambia drásticamente la tasa mensual de infraestructura. Gran parte del trabajo empresarial en LLM no requiere el modelo de más alto nivel del proveedor occidental, y el V4.1 Flash está diseñado para ese segmento.


La segunda es sobre soberanía y adquisiciones. Bancos europeos operando bajo la Ley de IA y ventas privadas de datos bajo el GDPR necesitan garantías contractuales del proveedor, hoy más difíciles de obtener de DeepSeek. Compradores empresariales en EE.UU. evalúan restricciones jurisdiccionales sobre modelos de origen chino en pipelines conectados a datos sensibles, una discusión que ha cobrado fuerza tras el paquete de la administración Biden sobre computación avanzada y restricciones a la exportación de chips. Multinacionales brasileñas que operan en los tres mercados deberán operar más de un modelo en producción, con una política de enrutamiento por tipo de dato y jurisdicción.


La tercera es sobre la hoja de ruta. El enrutamiento automático de deepseek-v4-pro al Flash a partir del 14 de septiembre es el formato que Anthropic y OpenAI han evitado hasta ahora. Downgrade transparente por el margen de costo, cumpliendo el contrato del cliente a la nueva tarifa. Si funciona, cambiará la expectativa del mercado sobre lo que el comprador empresarial puede esperar de continuidad cuando un proveedor lanza una generación más barata de su propia línea.


Lo que el consejo necesita escuchar


La reducción del costo del token no se extiende indefinidamente. Los costos de entrenamiento siguen aumentando, y cada nuevo ciclo de infraestructura comprime el costo de inferencia al final, no al principio del ciclo. Varios analistas ven parte del capex de entrenamiento como transitorio, pero Anthropic y Google siguen operando con margen, lo que separa la lectura de la que se aplica a un laboratorio que quema capital de riesgo. Lo que muestra el Flash 4.1 es que el techo de precio de frontera para trabajo multimodal con 1 millón de tokens ha caído en una semana. Quien vaya a firmar un contrato plurianual en octubre debería solicitar una cláusula de revisión automática por caída del precio de referencia. Es la misma cláusula que un comprador de materias primas solicitaba en los años 90. Ha vuelto a tener sentido para la IA.

El análisis de la semana, por correo

Una edición semanal con lo que importa a quien decide. Sin anuncios, sin patrocinio.

Cancelación en un clic, cuando quieras.

Estrategia