Análise Principal
Estratégia5 min

Google corta 17% no preço do Gemini 3.6 Flash e inicia pré-treino do Gemini 4

Estação de trabalho vazia com monitor exibindo curva de queda de preço de tokens de IA.

Google lançou o Gemini 3.6 Flash a US$ 1,50 por milhão de tokens de entrada e US$ 7,50 na saída, com 17% menos tokens gerados. No mesmo dia, DeepMind confirmou o início do maior pré-treino da história.

O Google lançou nesta terça-feira o Gemini 3.6 Flash com corte direto de preço: US$ 7,50 por milhão de tokens de saída contra US$ 9,00 da versão 3.5, e US$ 1,50 por milhão na entrada. Cache de contexto ficou em US$ 0,15 por milhão, com armazenamento a US$ 1,00 por milhão por hora. Segundo a empresa, o modelo consome 17% menos tokens na saída para completar o mesmo fluxo agêntico multi-etapa, empilhando uma segunda redução de custo em cima do preço menor.


O timing importa mais que o valor absoluto. Logan Kilpatrick, gerente sênior de produto do Google DeepMind, anunciou no mesmo dia o início do "pré-treino mais ambicioso" da história da empresa, o Gemini 4. É a primeira vez que o Google sobrepõe publicamente um modelo comercial em vigor com um sucessor confirmado no forno, forçando OpenAI e Anthropic a decidirem se respondem em preço agora ou esperam a próxima geração do rival aparecer.


Os números que Anthropic e OpenAI vão ler primeiro


Nos benchmarks divulgados pelo Google, o 3.6 Flash marca 49% no DeepSWE (contra 37% do 3.5 Flash), 63,9% no MLE Bench (49,7% antes), 83,0% no OSWorld-Verified (78,4%) e 1421 no GDPval-AA v2 (1349). São ganhos concentrados em três frentes que o mercado de agentes empresariais paga caro para resolver: engenharia de software, uso de sistemas operacionais e execução multi-passo com ferramentas externas.


Em US$ 7,50 por milhão de tokens de saída, o Flash disputa a mesma faixa do Claude Haiku 4.5 e do GPT Luna, o tier mais barato do trio Sol/Terra/Luna que a OpenAI liberou em 9 de julho. O ponto de vista do Google é explícito na página de preços: o Flash é o modelo default para pipelines de código, extração de dados e agentes de atendimento onde o custo por chamada domina a economia do produto.


O que muda para quem já compra tokens em escala


Para um CIO que roda um agente de suporte com 5 milhões de conversas por mês e 3 mil tokens de saída por conversa, o preço bruto cai de US$ 135 mil para US$ 112,5 mil ao ano na base do 3.5 Flash. Aplicando o corte de 17% no volume de tokens gerados, a fatura anual sai por volta de US$ 93 mil, uma diferença de aproximadamente 31% em relação à geração anterior no mesmo cenário. É a mesma matemática que empurrou a Klarna a padronizar Flash para triagem de tickets em 2025, segundo apresentação da fintech no Google Cloud Next.


O efeito não é local. Nos hubs de entrega da Accenture em Bengaluru e da Capgemini em Cracóvia, onde a maior parte dos MVPs de agente hoje roda em Vertex AI, o Flash 3.6 vira o baseline barato de referência que qualquer proposta de arquitetura precisa justificar. No Reino Unido, onde a Cohere posicionou seu modelo Command para o mercado soberano, o novo preço do Flash aperta o discurso de "AI europeia" a defender margem contra um hyperscaler que ficou 31% mais barato em menos de seis meses.


A sombra do Gemini 4 é o ponto real


O anúncio de Kilpatrick não veio com timeline, benchmark ou arquitetura. É uma mensagem para o comitê de compras: quem assinar um contrato de três anos com concorrente vai ter que renegociar antes do prazo se o Gemini 4 entregar o que o marketing sugere. Sundar Pichai já disse no call do segundo trimestre que o Gemini 3 Pro superou "de forma decisiva" o restante do mercado no benchmark interno da empresa, e a próxima curva vem no maior treino de compute que o Google já financiou.


Vale ver como Anthropic e OpenAI respondem. A Anthropic prometeu no press briefing do Claude Opus 4.7, em maio, que "não seguiria uma corrida de preço" e privilegiaria margem por qualidade. A OpenAI segmentou a linha 5.6 em três nomes exatamente para não canibalizar o próprio Sol quando o Luna precisar competir com Flash. Se o Gemini 3.6 Flash começar a ganhar deals de fornecedores de SaaS que hoje usam GPT Luna como backend de agente, a segmentação passa a operar contra a receita da OpenAI, não a favor.


A pergunta que o Google não respondeu no anúncio: se o Gemini 4 leva 18 meses para chegar, como sustentar o incentivo econômico do Flash 3.6 ao longo desse intervalo? A resposta virá do próximo ciclo de preço, não do próximo modelo.

Análise Principal
Google corta 17% no preço do Gemini 3.6 Flash e inicia pré-treino do Gemini 4 | The New Times