Gemini Omni
Volver a artículos
9 min de lectura

Gemini 3.6 Flash vs 3.5 Flash: benchmarks, precios y cuándo migrar (2026)

Gemini 3.6 Flash supera a 3.5 Flash en todos los benchmarks, recorta un 17% los tokens de salida y baja precios. Tablas comparativas completas y guía de migración.

Gemini 3.6 FlashGemini 3.5 FlashComparisonBenchmarksMigration2026Español

Una rara actualización “estrictamente mejor”

La mayoría de las actualizaciones de modelos sacrifican algo: calidad por velocidad, precio por capacidad. Gemini 3.6 Flash vs Gemini 3.5 Flash es el caso inusual en el que el modelo nuevo gana en todos los ejes que Google publicó el 21 de julio de 2026: mejores puntuaciones de benchmark, menos tokens de salida, menos pasos de razonamiento y llamadas a herramientas, y un precio por token más bajo. Este análisis recorre las cifras y luego pasa a lo práctico: quién debería migrar, cuándo y qué conviene volver a probar.

Si primero quieres el contexto completo del lanzamiento de los tres modelos, empieza por nuestro resumen del anuncio.

Eficiencia de tokens: el titular que nadie debería saltarse

El número más trascendente del lanzamiento no es una puntuación de benchmark. En el Artificial Analysis Index, 3.6 Flash consume un 17% menos de tokens de salida que 3.5 Flash para el mismo trabajo. En DeepSWE de Datacurve, Google observó reducciones de hasta el 65%.

Gemini 3.6 Flash muestra mejor eficiencia de tokens y menor verbosidad que 3.5 Flash en una tarea de OSWorld-Verified

Por qué importa más de lo que parece:

  • Los tokens de salida son los caros ($7.50/1M frente a $1.50/1M de entrada). Recortarlos un 17–65% ataca el término dominante del coste.
  • Menos tokens = menor latencia. Un agente que habla menos termina antes, y las cadenas de varios pasos multiplican el efecto.
  • Menos pasos de razonamiento y llamadas a herramientas significan menos idas y vueltas, menos puntos de fallo y menos sobrecarga de orquestación por tarea.

Google publicó una demo comparativa sobre una tarea de uso de ordenador: mira el vídeo de comparación de eficiencia de tokens.

Comparación completa de benchmarks

BenchmarkQué mideGemini 3.6 FlashGemini 3.5 FlashDelta
DeepSWEIngeniería de software agéntica49%37%+12 pts
MLE BenchInvestigación e ingeniería de ML63.9%49.7%+14.2 pts
OSWorld-VerifiedUso de ordenador83.0%78.4%+4.6 pts
GDPval-AA v2Trabajo del conocimiento real14211349+72

Mejoras de calidad de Gemini 3.6 Flash sobre 3.5 Flash en código, investigación de ML, uso de ordenador y trabajo del conocimiento

Tres lecturas de la tabla:

  • El salto en DeepSWE (37% → 49%) es el que debería importar a los equipos de código: Google lo atribuye a una mayor precisión —menos ediciones de código no deseadas y menos bucles de ejecución—, no solo a más capacidad bruta.
  • MLE Bench (+14.2 puntos) es la mayor ganancia y señala un avance real en flujos de investigación de ML: andamiaje de experimentos, análisis de datos, depuración de bucles de entrenamiento.
  • OSWorld-Verified con 83.0% importa porque el uso de ordenador es ahora una herramienta integrada del lado del cliente en la API de Gemini y Gemini Enterprise. El salto de capacidad y el cambio de empaquetado llegan a la vez.

Precios: más barato por token y por tarea

Gemini 3.6 FlashGemini 3.5 Flash
Precio de entrada$1.50 / 1M tokensMás alto
Precio de salida$7.50 / 1M tokensMás alto
Tokens de salida por tarea~17% menos (hasta 65% en DeepSWE)Línea base
Coste efectivo por tarea agénticaSignificativamente menorLínea base

La clave es el efecto compuesto. Una tarea que antes emitía 100K tokens de salida ahora emite ~83K, y cada uno de esos tokens cuesta menos. Para una carga que ejecuta millones de tareas agénticas al mes, el ahorro aparece en la factura sin tocar tus prompts.

Uso de ordenador: de complemento a función integrada

Con 3.6 Flash, el uso de ordenador se entrega como herramienta integrada del lado del cliente vía la API de Gemini y Gemini Enterprise. Sumado a la mejora en OSWorld-Verified (78.4% → 83.0%), los equipos que construyen agentes de navegador, automatización tipo RPA o bots de QA obtienen a la vez un modelo más fuerte y menos código de integración. Si mantenías andamiaje propio de uso de ordenador alrededor de 3.5 Flash, planea eliminar parte de él.

Postura de seguridad

3.6 Flash llega con salvaguardas Frontier Safety mejoradas en los dominios CBRN y de ciberataque, y Google informa de que es sustancialmente más resistente a los jailbreaks que 3.5 Flash. Igual de relevante para los equipos de producto: también fue entrenado para reducir los rechazos ante peticiones benignas. Si 3.5 Flash rechazaba ocasionalmente prompts legítimos relacionados con seguridad o medicina en tu producto, vuelve a probar esos flujos: la tasa de falsos rechazos debería bajar.

Qué dicen los primeros clientes

La lista de lanzamiento de Google —Figma, Harvey, Hebbia, JetBrains— merece descifrarse:

  • Figma y JetBrains son empresas de herramientas con inferencia de alto volumen y sensible a la latencia: un respaldo a la historia de velocidad y eficiencia.
  • Harvey (legal) y Hebbia (finanzas) elogiaron específicamente el trabajo multimodal con documentos: análisis, gráficos y datos, y redacción de informes. Si tu carga es trabajo del conocimiento intensivo en documentos, la ganancia en GDPval-AA v2 (1349 → 1421) es tu referencia relevante.

Guía de migración: cuándo cambiar

Tu situaciónRecomendación
Código agéntico (agentes SWE, bots de revisión de código)Migra ya: las mayores ganancias en calidad y eficiencia de tokens (DeepSWE +12 pts, hasta 65% menos tokens)
Uso de ordenador / automatización de navegadorMigra ya: mejores puntuaciones y la herramienta integrada reemplaza el andamiaje propio
Análisis de documentos / informesMigra ya: validado por los casos de Harvey y Hebbia
Tareas simples de alto volumen y latencia críticaConsidera 3.5 Flash-Lite en su lugar: mira nuestra guía de Flash-Lite
Prompts muy afinados con parseo estricto del formato de salidaMigra con cuidado: la eficiencia de tokens cambia la verbosidad; revalida parsers y ejemplos few-shot
Sistemas de producción congelados por cumplimientoPrográmalo: no hay deprecación forzosa anunciada, pero precio + eficiencia hacen que quedarse salga caro

Checklist práctico antes de cambiar la cadena del modelo:

  1. Vuelve a ejecutar tu suite de evaluación: el estilo de salida es más compacto y corto; las aserciones sobre longitud o redacción de respuestas pueden romperse.
  2. Revisa el parseo de salida estructurada: menos verbosidad suele ser buena noticia para la fiabilidad del JSON, pero verifícalo.
  3. Vuelve a probar los flujos sensibles a rechazos: espera menos falsos rechazos, pero confirma que tus filtros de seguridad siguen alineados.
  4. Mide de nuevo el coste por tarea, no por token: la reducción del 17–65% en tokens hace que las comparaciones por token infravaloren el ahorro.

Veredicto

Gemini 3.6 Flash es el raro sucesor sin trade-off publicado: mejor en código, investigación de ML, uso de ordenador y trabajo del conocimiento, mientras emite menos tokens a precios más bajos. A menos que tu stack dependa de formatos de salida congelados, migrar desde 3.5 Flash no es tanto una cuestión de si hacerlo como de en qué sprint.

Relacionado