DeepSeek lança V4.1 Flash com 1 milhão de tokens de contexto e joga saída para US$ 0,60 por milhão

DeepSeek anunciou o V4.1 Flash na terça, ativo a partir das 12h de Pequim de 10 de setembro. Arquitetura MoE de 552B, 1M de tokens de contexto e roteamento automático do Pro para o Flash em 14 de setembro.
Um novo Flash, um novo teto de preço
DeepSeek anunciou na terça, 9 de setembro, o modelo V4.1 Flash, disponível a partir das 12h de horário de Pequim de 10 de setembro (04:00 UTC). A tabela de preços passou a valer no mesmo horário. Em tarifa fora do pico, o V4.1 Flash cobra US$ 0,15 por milhão de tokens de entrada não cacheados, US$ 0,003 por milhão de tokens de entrada em cache e US$ 0,60 por milhão de tokens de saída. Em horário de pico, entre 1h e 4h e entre 6h e 10h UTC nos dias úteis, os valores dobram. A partir de 14 de setembro, toda chamada endereçada a deepseek-v4-pro será roteada automaticamente para o Flash, cobrada pela tarifa mais barata.
O que ele é por dentro
Arquitetura Causal Encoder-Decoder assimétrica com 552 bilhões de parâmetros totais, apenas 8 bilhões ativos no processamento de entrada e 16 bilhões na geração de saída. Janela de contexto de até 1 milhão de tokens. Compreensão multimodal nativa de texto e imagem. É o menor modelo da nova família de arquitetura da DeepSeek, projetada para inferência mais barata e escala posterior. Segundo avaliação pública da AlphaSignal, o V4.1 Flash bate o flagship anterior da própria empresa com um quarto do custo de memória.
Nos benchmarks compilados por terceiros, o Flash empata ou fica dentro da distância de tiro do GPT-5.6 Sol e do Claude Opus 5 em provas de coding e uso de agente. Em avaliações intensivas de conhecimento como HLE, e em algumas provas de terminal e coding, os dois modelos ocidentais continuam à frente com margem clara. A DeepSeek ainda não publicou relatório técnico oficial nem tabela de benchmark, então parte da leitura precisa esperar a próxima onda de replicações independentes.
O que muda para o comprador de IA nas próximas duas semanas
O piso de preço para modelo de fronteira com 1 milhão de tokens de contexto e capacidade multimodal caiu para US$ 0,60 por milhão de tokens de saída. Anthropic cobra US$ 10 por milhão de entrada e US$ 50 por milhão de saída no Fable 5.1. OpenAI cobra em faixa comparável no Astra. A diferença é de uma ordem de grandeza.
O recorte imediato cai sobre três conversas. A primeira é sobre trabalho de agente em massa. Consultorias de médio porte que construíram sua camada de orquestração em cima de Sonnet ou Fable vão refazer a planilha em três cenários na próxima semana. Uma operação com 20% do volume roteado para DeepSeek em tarefas de menor risco (resumo, extração, transformação de texto) muda o run rate mensal de infraestrutura em ordem grande. Boa parte do trabalho enterprise em LLM não exige o topo de linha do fornecedor ocidental, e o V4.1 Flash é feito para essa fatia.
A segunda é sobre soberania e procurement. Bancos europeus operando sob AI Act e vendas privadas de dados sob GDPR precisam de garantia contratual do fornecedor, hoje mais difícil de obter da DeepSeek. Comprador enterprise nos EUA avalia restrições jurisdicionais sobre modelos de origem chinesa em pipelines conectados a dados sensíveis, uma discussão que ganhou peso após o pacote da administração Biden sobre computação avançada e restrições de exportação de chips. Multinacionais brasileiras que operam nos três mercados terão que rodar mais de um modelo em produção, com política de roteamento por tipo de dado e jurisdição.
A terceira é sobre roadmap. O roteamento automático de deepseek-v4-pro para o Flash a partir de 14 de setembro é o formato que Anthropic e OpenAI evitaram até agora. Downgrade transparente pela margem de custo, com contrato do cliente sendo cumprido na tarifa nova. Se der certo, muda a expectativa do mercado sobre o que o comprador enterprise pode esperar de continuidade quando um fornecedor lança uma geração mais barata da própria linha.
O que o board precisa ouvir
O barateamento do token não estica indefinidamente. Custos de treinamento continuam a subir, e cada nova rodada de infra recomprime o custo de inferência ao fim, não no começo do ciclo. Vários analistas veem parte do capex de treinamento como transitório, mas o Anthropic e o Google continuam operando com margem, o que separa a leitura da que se aplica a laboratório queimando capital de risco. O que o Flash 4.1 mostra é que o teto de preço de fronteira para trabalho multimodal com 1 milhão de tokens caiu em uma semana. Quem for assinar contrato plurianual em outubro deveria pedir cláusula de revisão automática por queda de preço de referência. É a mesma cláusula que comprador de commodity pedia nos anos 1990. Voltou a fazer sentido para IA.