StepFun lança Step 5 Preview, modelo 600B a US$ 1 por milhão

MoE esparso de 600 bilhões de parâmetros com 1 milhão de contexto marcou 33,3% no Terminal-Bench 4.0 e cobra US$ 1,00 por milhão de tokens de entrada. Pesos abertos em 15 de outubro.
A StepFun abriu a API do Step 5 Preview em 20 de setembro, no mesmo dia do anúncio do modelo. São 600 bilhões de parâmetros em arquitetura MoE esparsa, 27 bilhões ativos por token e janela de contexto de 1 milhão, com entrada de texto, imagem e vídeo. O preço na API própria da companhia é de US$ 1,00 por milhão de tokens de entrada em cache miss, US$ 0,05 em cache hit e US$ 2,70 por milhão de tokens de saída, com tokens de raciocínio cobrados como saída, segundo o material divulgado pela empresa.
A Artificial Analysis pontuou o modelo em 44 no Intelligence Index v4.3, número idêntico ao do Kimi K3 e um ponto abaixo do GLM-5.3 e do Claude Opus 5. O DeepSeek V4.1 Flash, publicado dez dias antes, ficou em 40. A diferença relevante não está no índice agregado. No Terminal-Bench 4.0, que mede tarefas de terminal em várias etapas, o Step 5 Preview marcou 33,3% contra cerca de 12,6% do Kimi K3 e 26,8% do DeepSeek V4.1 Flash. No SciCode, os dois primeiros empatam em 59%. A velocidade de saída medida foi de 99,8 tokens por segundo, ante mediana de 64,6 entre os modelos acompanhados pela mesma casa.
O preço é o argumento
Um modelo que empata com o Kimi K3 em inteligência agregada e cobra US$ 1,00 na entrada muda a conta de quem opera agentes em produção. Pela medição da Artificial Analysis, o Step 5 Preview sai por cerca de um sétimo do preço do GPT-5.6 Sol. Para uma equipe que roda um agente de engenharia sobre um repositório grande, porém, o número que importa é outro: US$ 0,05 por milhão de tokens em cache hit. Um loop agêntico relê o mesmo contexto dezenas de vezes por tarefa, e é nesse repeteco que a fatura se forma.
A StepFun informou que os pesos completos saem em 15 de outubro. Esse é o ponto que separa um lançamento de um anúncio de preço. Uma empresa europeia ou brasileira que não pode enviar dado para um endpoint sediado na China continua impedida de usar a API, mas pode baixar os pesos e rodar o modelo na própria infraestrutura, sob o regime de dados que já possui. Foi por esse caminho, e não pela API, que DeepSeek e Qwen entraram em provas de conceito corporativas no Ocidente ao longo de 2026.
Há uma ressalva que a folha de benchmarks não cobre. Step 5 Preview é, pelo próprio nome, uma prévia: a StepFun não publicou dados de disponibilidade, limite de requisições por minuto nem compromisso de versão congelada. Para um banco que coloca um agente em produção com SLA contratual, isso pesa mais do que um ponto no Intelligence Index.
Onde a conta muda, de Bangalore a São Paulo
Nos Estados Unidos, o efeito imediato recai sobre a margem de quem vende token. OpenAI e Anthropic precificam capacidade de fronteira, e um modelo aberto que entrega 33,3% no Terminal-Bench por US$ 1,00 na entrada não substitui o topo. Ele retira dos laboratórios americanos a faixa de trabalho repetitivo de agente, que é a de maior volume e a que sustenta o consumo contínuo de tokens ao longo do mês.
Na Índia, onde TCS, Infosys e Wipro reconstroem a entrega em torno de pipelines agênticos, o custo por token é linha de custo direto de contrato. Uma queda de uma ordem de grandeza no preço de inferência aparece na margem bruta do trimestre seguinte ou no preço cobrado do cliente. O histórico do setor indica que aparece nos dois, com defasagem de um ou dois trimestres entre um e outro.
No Brasil, o gargalo dos projetos de agentes em bancos e seguradoras raramente é a qualidade do modelo. É o custo por interação em operações com dezenas de milhões de clientes, somado à exigência de manter dado sensível dentro do país. Pesos abertos rodando em nuvem local resolvem os dois de uma vez. Por isso 15 de outubro importa mais que 20 de setembro para o CIO que monta o roadmap de 2027 por aqui.
A StepFun listou engenharia de software, tarefas agênticas de horizonte longo, trabalho de conhecimento profissional e finanças como alvos declarados do modelo. Nenhum dos quatro é chatbot. O que os laboratórios chineses disputam neste momento não é a conversa, é a execução em segundo plano, cobrada por token e medida em horas de trabalho que deixam de ser feitas por gente. O empate em 44 pontos vira detalhe quando um dos dois lados publica os pesos três semanas depois.