Gemini Omni
Volver a artículos
9 min de lectura

Google lanza Gemini 3.7 Flash: razonamiento híbrido para coding, agentes y trabajo de conocimiento

Gemini 3.7 Flash llega el 13 de agosto de 2026 con razonamiento híbrido nativo, presupuestos de pensamiento configurables, benchmarks de coding de frontera y un 50% de descuento introductorio hasta diciembre.

Gemini 3.7 FlashHybrid ReasoningCodingBenchmarksPricingAnnouncement2026Español

Un nuevo buque insignia para el razonamiento híbrido

El 13 de agosto de 2026, Google presentó Gemini 3.7 Flash, su modelo insignia de razonamiento híbrido diseñado para coding, agentes y trabajo de conocimiento complejo. A diferencia de las generaciones Flash anteriores que sacrificaban profundidad por velocidad, 3.7 Flash incorpora razonamiento nativo configurable directamente en la API: ajustas la profundidad de pensamiento por solicitud sin cambiar a un «modelo de razonamiento» separado.

El lanzamiento apunta a tres audiencias a la vez: desarrolladores que despliegan agentes en producción, equipos que ejecutan tareas de coding de largo horizonte y empresas que necesitan análisis multimodal fiable sobre conjuntos documentales masivos. Google posiciona 3.7 Flash como el modelo que por fin hace que un solo endpoint sirva tanto para respuestas de chat en menos de 100 ms como para investigaciones profundas de varios minutos.

Razonamiento híbrido nativo y presupuesto de pensamiento

El elemento central es thinking_config.thinking_budget: un entero que controla cuántos tokens de razonamiento interno puede consumir el modelo antes de responder.

thinking_budgetComportamientoIdeal para
0Modo rápido de latencia ultra baja (primer token en menos de 85 ms)Chat en vivo, autocompletado, enrutamiento de alto QPS
256–1024Planificación ligera en varios pasosEnrutamiento de herramientas, refactors simples, síntesis RAG
4096–16384Razonamiento profundo en varios pasosBucles de agentes, depuración compleja, informes de investigación
32768–65536Profundidad máximaCoding de largo horizonte, cambios de arquitectura en múltiples archivos

Configúralo en la Gemini API así:

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="Refactoriza este componente React para usar hooks y añade error boundaries.",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(
            thinking_budget=8192  # 0 = modo rápido; hasta 65536 para razonamiento profundo
        )
    ),
)
print(response.text)

Como el razonamiento es nativo y no un añadido, la latencia escala de forma fluida: un thinking_budget de 0 se comporta como un Flash clásico, mientras que valores más altos desbloquean calidad chain-of-thought sin cambiar el ID del modelo. La facturación separa tokens de salida visibles de tokens de pensamiento interno, así solo pagas la profundidad que solicitas.

Destacados de benchmarks

Google publicó cifras comparativas frente a Gemini 3.6 Flash, Claude Sonnet 5 y GPT-5.6 Terra. 3.7 Flash lidera en todas las evaluaciones listadas:

BenchmarkGemini 3.7 FlashGemini 3.6 FlashClaude Sonnet 5GPT-5.6 Terra
FrontierCode 1.143.6%34.4%39.1%37.8%
DeepSWE v1.165.3%49.0%56.2%53.4%
WebDev Arena (Elo)1588153815521544
GDP.pdf34.0%22.0%28.5%26.8%
AutomationBench30.4%17.0%23.1%21.5%
GDM-MRCR v297.0%91.2%94.5%93.1%
HLE-Verified53.6%44.8%48.2%46.7%

Dos cifras destacan para quienes construyen:

  • DeepSWE v1.1 al 65.3%: un salto de 16 puntos sobre 3.6 Flash, señal de que el coding agéntico es el objetivo principal de entrenamiento.
  • GDM-MRCR v2 al 97.0%: recuperación casi perfecta en contexto largo con ventana de 2,5M tokens, crítica para flujos documentales.

Para contexto sobre la generación anterior, consulta nuestra comparación Gemini 3.6 Flash vs 3.5 Flash.

Precios y 50% de descuento introductorio

Google aplica una promoción de lanzamiento agresiva:

Precio intro (hasta 31 dic 2026)Precio estándar (desde 1 ene 2027)
Entrada$0.75 / 1M tokens$1.50 / 1M tokens
Salida$3.75 / 1M tokens$7.50 / 1M tokens
Caché de contexto$0.075 / 1M tokens$0.075 / 1M tokens

Es un 50% de descuento en entrada y salida durante lo que queda de 2026. La caché de contexto — útil cuando reutilizas prompts de sistema o corpus documentales grandes — se mantiene en $0.075 por millón de tokens con independencia de la promoción.

Combinado con menos idas y vueltas de llamadas a herramientas a presupuestos de pensamiento más altos, el coste efectivo por tarea de agente completada puede quedar muy por debajo del precio por token. Nuestra guía de estimación de costes de la API desglosa la matemática para cargas típicas.

Capacidades multimodales, web dev y agentes

Más allá de los benchmarks, 3.7 Flash incluye capacidades listas para producción que importan en despliegues reales:

  • Ventana de contexto de 2,5M tokens: ingiere codebases completos, paquetes contractuales o corpus de investigación de una sola vez.
  • 245 tokens de salida/s: lo bastante rápido para transmitir código UI e informes largos sin estrangular la experiencia.
  • 99.7% de precisión en ejecución de herramientas JSON: salidas estructuradas fiables para cadenas de herramientas de agentes.
  • Computer use: automatización integrada en el cliente para flujos de navegador y escritorio.
  • Fidelidad en generación de UI: mayor precisión de layout en WebDev Arena (1588 Elo) se traduce en frontends generados más limpios desde el primer momento.

Estas funciones están disponibles hoy en Gemini API, Google AI Studio, Gemini Enterprise y Google Antigravity.

Guía para desarrolladores y migración

Si actualizas desde 3.6 Flash o 3.5 Flash-Lite, empieza con estos patrones:

  1. Sustituye el ID del modelo: cambia gemini-3.6-flash por gemini-3.7-flash; la superficie de la API es retrocompatible.
  2. Configura presupuestos de pensamiento por tipo de tarea: usa 0 para chat orientado al usuario, 1024 para Q&A RAG, 8192+ para agentes de coding y 32768 solo para trabajos batch nocturnos donde la latencia no importa.
  3. Activa la caché de contexto: si tu prompt de sistema o conjunto documental supera 32K tokens y se repite entre solicitudes, la caché reduce el coste de entrada un 90%.
  4. Ajusta los esquemas de herramientas: el 99.7% de precisión JSON premia esquemas estrictos; definiciones laxas siguen fallando en la capa de aplicación.
  5. Monitoriza el uso de tokens de pensamiento: registra usage_metadata para entender qué pasos del agente realmente necesitan razonamiento profundo frente al modo rápido.

Para patrones de flujos agénticos, consulta nuestra guía de flujos agénticos con 3.5 Flash-Lite; el concepto de presupuesto de pensamiento se extiende naturalmente a 3.7 Flash con mayor granularidad.

Conclusión

Gemini 3.7 Flash es el primer modelo de nivel Flash donde velocidad y profundidad no son excluyentes. El thinking_budget configurable permite que un solo modelo sirva chat sensible a la latencia y coding agéntico profundo, y el precio de lanzamiento hace barata la experimentación hasta finales de 2026.

Relacionado