Google recorta 17% en el precio de Gemini 3.6 Flash e inicia la preentrenamiento de Gemini 4

Google lanzó Gemini 3.6 Flash a $1.50 por millón de tokens de entrada y $7.50 en salida, con un 17% menos de tokens generados. En el mismo día, DeepMind confirmó el inicio del mayor preentrenamiento de la historia.
Google lanzó este martes el Gemini 3.6 Flash con un recorte de precio directo: $7.50 por millón de tokens de salida en comparación con $9.00 de la versión 3.5, y $1.50 por millón en la entrada. El caché de contexto se quedó en $0.15 por millón, con almacenamiento a $1.00 por millón por hora. Según la empresa, el modelo consume un 17% menos de tokens en la salida para completar el mismo flujo ágil multi-etapa, aglomerando una segunda reducción de costo sobre el precio más bajo.
El momento importa más que el valor absoluto. Logan Kilpatrick, gerente senior de producto de Google DeepMind, anunció el mismo día el inicio del "preentrenamiento más ambicioso" en la historia de la empresa, el Gemini 4. Es la primera vez que Google superpone públicamente un modelo comercial en vigor con un sucesor confirmado en proceso, forzando a OpenAI y Anthropic a decidir si responden en precio ahora o esperan a que la próxima generación del rival aparezca.
Los números que Anthropic y OpenAI leerán primero
En los benchmarks divulgados por Google, el 3.6 Flash marca 49% en DeepSWE (en comparación con 37% del 3.5 Flash), 63.9% en MLE Bench (49.7% antes), 83.0% en OSWorld-Verified (78.4%) y 1421 en GDPval-AA v2 (1349). Son ganancias concentradas en tres frentes que el mercado de agentes empresariales paga caro por resolver: ingeniería de software, uso de sistemas operativos y ejecución multi-paso con herramientas externas.
A $7.50 por millón de tokens de salida, el Flash compite en la misma franja que el Claude Haiku 4.5 y el GPT Luna, el nivel más barato del trío Sol/Tierra/Luna que OpenAI lanzó el 9 de julio. El punto de vista de Google es explícito en la página de precios: el Flash es el modelo por defecto para pipelines de código, extracción de datos y agentes de atención donde el costo por llamada domina la economía del producto.
Qué cambia para quienes ya compran tokens a gran escala
Para un CIO que ejecuta un agente de soporte con 5 millones de conversaciones al mes y 3 mil tokens de salida por conversación, el precio bruto cae de $135,000 a $112,500 al año en la base del 3.5 Flash. Aplicando el recorte del 17% en el volumen de tokens generados, la factura anual queda en alrededor de $93,000, una diferencia de aproximadamente 31% en comparación con la generación anterior en el mismo escenario. Es la misma matemática que empujó a Klarna a estandarizar Flash para la triage de tickets en 2025, según la presentación de la fintech en Google Cloud Next.
El efecto no es local. En los hubs de entrega de Accenture en Bengaluru y de Capgemini en Cracovia, donde la mayor parte de los MVPs de agentes hoy corren en Vertex AI, el Flash 3.6 se convierte en la referencia barata que cualquier propuesta de arquitectura necesita justificar. En el Reino Unido, donde Cohere posicionó su modelo Command para el mercado soberano, el nuevo precio del Flash aprieta el discurso de "IA europea" para defender márgenes frente a un hyperscaler que se volvió un 31% más barato en menos de seis meses.
La sombra de Gemini 4 es el punto real
El anuncio de Kilpatrick no vino con cronograma, benchmark ni arquitectura. Es un mensaje para el comité de compras: quien firme un contrato de tres años con un competidor tendrá que renegociar antes de tiempo si el Gemini 4 entrega lo que el marketing sugiere. Sundar Pichai ya dijo en la llamada del segundo trimestre que el Gemini 3 Pro superó "de manera decisiva" al resto del mercado en el benchmark interno de la empresa, y la próxima curva viene en el mayor entrenamiento de compute que Google ha financiado.
Vale la pena ver cómo responden Anthropic y OpenAI. Anthropic prometió en el briefing de prensa del Claude Opus 4.7, en mayo, que "no seguiría una carrera de precios" y privilegiaría márgenes por calidad. OpenAI segmentó la línea 5.6 en tres nombres precisamente para no canibalizar su propio Sol cuando el Luna necesite competir con Flash. Si el Gemini 3.6 Flash comienza a ganar contratos de proveedores de SaaS que hoy usan GPT Luna como backend de agente, la segmentación comenzará a operar en contra de los ingresos de OpenAI, no a favor.
La pregunta que Google no respondió en el anuncio: si el Gemini 4 tarda 18 meses en llegar, ¿cómo sostener el incentivo económico del Flash 3.6 a lo largo de ese intervalo? La respuesta vendrá del próximo ciclo de precios, no del próximo modelo.