Gemini 3.6 Flash vs 3.5 Flash: benchmarks, precios y cuándo migrar (2026)
Gemini 3.6 Flash supera a 3.5 Flash en todos los benchmarks, recorta un 17% los tokens de salida y baja precios. Tablas comparativas completas y guía de migración.
Una rara actualización “estrictamente mejor”
La mayoría de las actualizaciones de modelos sacrifican algo: calidad por velocidad, precio por capacidad. Gemini 3.6 Flash vs Gemini 3.5 Flash es el caso inusual en el que el modelo nuevo gana en todos los ejes que Google publicó el 21 de julio de 2026: mejores puntuaciones de benchmark, menos tokens de salida, menos pasos de razonamiento y llamadas a herramientas, y un precio por token más bajo. Este análisis recorre las cifras y luego pasa a lo práctico: quién debería migrar, cuándo y qué conviene volver a probar.
Si primero quieres el contexto completo del lanzamiento de los tres modelos, empieza por nuestro resumen del anuncio.
Eficiencia de tokens: el titular que nadie debería saltarse
El número más trascendente del lanzamiento no es una puntuación de benchmark. En el Artificial Analysis Index, 3.6 Flash consume un 17% menos de tokens de salida que 3.5 Flash para el mismo trabajo. En DeepSWE de Datacurve, Google observó reducciones de hasta el 65%.

Por qué importa más de lo que parece:
- Los tokens de salida son los caros ($7.50/1M frente a $1.50/1M de entrada). Recortarlos un 17–65% ataca el término dominante del coste.
- Menos tokens = menor latencia. Un agente que habla menos termina antes, y las cadenas de varios pasos multiplican el efecto.
- Menos pasos de razonamiento y llamadas a herramientas significan menos idas y vueltas, menos puntos de fallo y menos sobrecarga de orquestación por tarea.
Google publicó una demo comparativa sobre una tarea de uso de ordenador: mira el vídeo de comparación de eficiencia de tokens.
Comparación completa de benchmarks
| Benchmark | Qué mide | Gemini 3.6 Flash | Gemini 3.5 Flash | Delta |
|---|---|---|---|---|
| DeepSWE | Ingeniería de software agéntica | 49% | 37% | +12 pts |
| MLE Bench | Investigación e ingeniería de ML | 63.9% | 49.7% | +14.2 pts |
| OSWorld-Verified | Uso de ordenador | 83.0% | 78.4% | +4.6 pts |
| GDPval-AA v2 | Trabajo del conocimiento real | 1421 | 1349 | +72 |

Tres lecturas de la tabla:
- El salto en DeepSWE (37% → 49%) es el que debería importar a los equipos de código: Google lo atribuye a una mayor precisión —menos ediciones de código no deseadas y menos bucles de ejecución—, no solo a más capacidad bruta.
- MLE Bench (+14.2 puntos) es la mayor ganancia y señala un avance real en flujos de investigación de ML: andamiaje de experimentos, análisis de datos, depuración de bucles de entrenamiento.
- OSWorld-Verified con 83.0% importa porque el uso de ordenador es ahora una herramienta integrada del lado del cliente en la API de Gemini y Gemini Enterprise. El salto de capacidad y el cambio de empaquetado llegan a la vez.
Precios: más barato por token y por tarea
| Gemini 3.6 Flash | Gemini 3.5 Flash | |
|---|---|---|
| Precio de entrada | $1.50 / 1M tokens | Más alto |
| Precio de salida | $7.50 / 1M tokens | Más alto |
| Tokens de salida por tarea | ~17% menos (hasta 65% en DeepSWE) | Línea base |
| Coste efectivo por tarea agéntica | Significativamente menor | Línea base |
La clave es el efecto compuesto. Una tarea que antes emitía 100K tokens de salida ahora emite ~83K, y cada uno de esos tokens cuesta menos. Para una carga que ejecuta millones de tareas agénticas al mes, el ahorro aparece en la factura sin tocar tus prompts.
Uso de ordenador: de complemento a función integrada
Con 3.6 Flash, el uso de ordenador se entrega como herramienta integrada del lado del cliente vía la API de Gemini y Gemini Enterprise. Sumado a la mejora en OSWorld-Verified (78.4% → 83.0%), los equipos que construyen agentes de navegador, automatización tipo RPA o bots de QA obtienen a la vez un modelo más fuerte y menos código de integración. Si mantenías andamiaje propio de uso de ordenador alrededor de 3.5 Flash, planea eliminar parte de él.
Postura de seguridad
3.6 Flash llega con salvaguardas Frontier Safety mejoradas en los dominios CBRN y de ciberataque, y Google informa de que es sustancialmente más resistente a los jailbreaks que 3.5 Flash. Igual de relevante para los equipos de producto: también fue entrenado para reducir los rechazos ante peticiones benignas. Si 3.5 Flash rechazaba ocasionalmente prompts legítimos relacionados con seguridad o medicina en tu producto, vuelve a probar esos flujos: la tasa de falsos rechazos debería bajar.
Qué dicen los primeros clientes
La lista de lanzamiento de Google —Figma, Harvey, Hebbia, JetBrains— merece descifrarse:
- Figma y JetBrains son empresas de herramientas con inferencia de alto volumen y sensible a la latencia: un respaldo a la historia de velocidad y eficiencia.
- Harvey (legal) y Hebbia (finanzas) elogiaron específicamente el trabajo multimodal con documentos: análisis, gráficos y datos, y redacción de informes. Si tu carga es trabajo del conocimiento intensivo en documentos, la ganancia en GDPval-AA v2 (1349 → 1421) es tu referencia relevante.
Guía de migración: cuándo cambiar
| Tu situación | Recomendación |
|---|---|
| Código agéntico (agentes SWE, bots de revisión de código) | Migra ya: las mayores ganancias en calidad y eficiencia de tokens (DeepSWE +12 pts, hasta 65% menos tokens) |
| Uso de ordenador / automatización de navegador | Migra ya: mejores puntuaciones y la herramienta integrada reemplaza el andamiaje propio |
| Análisis de documentos / informes | Migra ya: validado por los casos de Harvey y Hebbia |
| Tareas simples de alto volumen y latencia crítica | Considera 3.5 Flash-Lite en su lugar: mira nuestra guía de Flash-Lite |
| Prompts muy afinados con parseo estricto del formato de salida | Migra con cuidado: la eficiencia de tokens cambia la verbosidad; revalida parsers y ejemplos few-shot |
| Sistemas de producción congelados por cumplimiento | Prográmalo: no hay deprecación forzosa anunciada, pero precio + eficiencia hacen que quedarse salga caro |
Checklist práctico antes de cambiar la cadena del modelo:
- Vuelve a ejecutar tu suite de evaluación: el estilo de salida es más compacto y corto; las aserciones sobre longitud o redacción de respuestas pueden romperse.
- Revisa el parseo de salida estructurada: menos verbosidad suele ser buena noticia para la fiabilidad del JSON, pero verifícalo.
- Vuelve a probar los flujos sensibles a rechazos: espera menos falsos rechazos, pero confirma que tus filtros de seguridad siguen alineados.
- Mide de nuevo el coste por tarea, no por token: la reducción del 17–65% en tokens hace que las comparaciones por token infravaloren el ahorro.
Veredicto
Gemini 3.6 Flash es el raro sucesor sin trade-off publicado: mejor en código, investigación de ML, uso de ordenador y trabajo del conocimiento, mientras emite menos tokens a precios más bajos. A menos que tu stack dependa de formatos de salida congelados, migrar desde 3.5 Flash no es tanto una cuestión de si hacerlo como de en qué sprint.