Gemini Omni
Volver a artículos
10 min de lectura

Guía de Gemini 3.5 Flash-Lite: escalar flujos agénticos a 350 tokens/s (2026)

Gemini 3.5 Flash-Lite corre a 350 tokens/s por $0.30/1M de entrada. Benchmarks vs 3.1 Flash-Lite y Gemini 3 Flash, niveles de pensamiento, costes y tabla de decisión.

Gemini 3.5 Flash-LiteAgentic WorkflowsGuideBenchmarksPricing2026Español

El nivel de volumen se ha puesto serio

Gemini 3.5 Flash-Lite, anunciado el 21 de julio de 2026, es el modelo de clase 3.5 más rápido y rentable de Google: 350 tokens de salida por segundo (Artificial Analysis), con un precio de $0.30 por 1M de tokens de entrada y $2.50 por 1M de tokens de salida. Históricamente, los niveles “Lite” eran donde la calidad iba a morir: buenos para clasificación y texto rutinario, arriesgados para cualquier cosa agéntica. Este lanzamiento rompe ese patrón: en varias evaluaciones agénticas y de código, 3.5 Flash-Lite supera directamente al mayor Gemini 3 Flash.

Esta guía cubre dónde encaja Flash-Lite en la gama, cómo configurar sus niveles de pensamiento, cuánto cuesta realmente a escala y qué modelo elegir para cada carga. El contexto del lanzamiento está en nuestro resumen del anuncio.

Salto generacional: vs 3.1 Flash-Lite

El salto respecto a la generación Lite anterior es el mayor en la historia de la familia:

BenchmarkQué mideGemini 3.5 Flash-LiteGemini 3.1 Flash-Lite
Terminal-Bench 2.1Tareas de terminal, código y agentes54%31%
GDM-MRCR v2Recuperación en contexto largo72.2%60.1%
GDPval-AA v2Ejecución de tareas reales1140642

Comparación de benchmarks de Gemini 3.5 Flash-Lite frente a generaciones anteriores de Flash-Lite

El dato a interiorizar es el GDPval-AA v2 casi duplicándose (642 → 1140): la ejecución de tareas del mundo real era exactamente donde los antiguos modelos Lite se venían abajo en agentes de producción.

La sorpresa: ganar a Gemini 3 Flash

Más sorprendente que la ganancia generacional es la de nivel cruzado. En varias evaluaciones agénticas y de código, 3.5 Flash-Lite supera a Gemini 3 Flash, un modelo más grande y más caro:

BenchmarkGemini 3.5 Flash-LiteGemini 3 Flash
SWE-Bench Pro54.2%49.6%
OSWorld-Verified74.0%65.1%

Si hoy ejecutas cargas en 2.5 Flash o 3 Flash porque no se podía confiar en los niveles Lite para trabajo agéntico, esa suposición ha quedado obsoleta: Flash-Lite es más rápido y más capaz en estas tareas.

Niveles de pensamiento: un modelo, dos modos de operación

Flash-Lite llega con niveles de pensamiento configurables, que en la práctica lo convierten en dos productos:

  • Pensamiento minimal / low: prioriza latencia y coste para tareas de alto volumen: búsqueda agéntica, procesamiento de documentos, extracción, clasificación, enrutamiento. Este es el modo de 350 tokens/s.
  • Niveles de pensamiento más altos: activan un razonamiento más profundo para cargas de subagentes de varios pasos, donde Flash-Lite actúa como trabajador bajo un modelo orquestador.

Ese segundo modo coincide con el patrón de demo de la propia Google: 3.6 Flash como agente maestro y flotas de subagentes 3.5 Flash-Lite trabajando en paralelo (una demo genera 25 conceptos de diseño web simultáneamente). El uso de ordenador también es una herramienta integrada en Flash-Lite, así que los subagentes pueden operar interfaces sin andamiaje extra. Mira la demo de velocidad Flash-Lite vs 3.5 Flash de Google (vídeo) para ver la diferencia de latencia en tareas de alto volumen.

Análisis de costes: lo que cuesta realmente la escala

Precios: $0.30/1M de entrada, $2.50/1M de salida. Un ejemplo de carga: un agente de procesamiento de documentos que maneja 1 millón de documentos al mes, con una media de 3K tokens de entrada y 500 de salida por documento:

Componente de costeCálculoCoste mensual
Tokens de entrada1M docs × 3K tokens = 3B tokens × $0.30/1M$900
Tokens de salida1M docs × 500 tokens = 0.5B tokens × $2.50/1M$1,250
Total con 3.5 Flash-Lite$2,150
La misma carga con 3.6 Flash ($1.50 / $7.50)$4,500 + $3,750$8,250

Aproximadamente una diferencia de coste de 4× para una carga que Lite maneja bien; y a 350 tokens/s, el resumen de 500 tokens de cada documento se emite en menos de 1.5 segundos. La estrategia que se deriva: enruta el 90% del volumen rutinario a Flash-Lite y escala el 10% difícil a 3.6 Flash.

Tabla de decisión: qué modelo para qué carga

Carga de trabajoEligePor qué
Búsqueda agéntica / RAG con alto QPS3.5 Flash-Lite (pensamiento minimal)350 tokens/s, menor coste por consulta
Procesamiento / extracción masiva de documentos3.5 Flash-Lite4× más barato que 3.6 Flash; GDM-MRCR v2 72.2% en contexto largo
Clasificación, enrutamiento, moderación3.5 Flash-Lite (pensamiento minimal)Latencia crítica, calidad de sobra
Flotas de subagentes en paralelo bajo un orquestador3.5 Flash-Lite (pensamiento alto)Modo diseñado para ello; uso de ordenador integrado
Código agéntico complejo (agentes SWE)3.6 FlashDeepSWE 49%; mayor precisión, menos ediciones malas
Flujos de investigación de ML3.6 FlashMLE Bench 63.9% frente a 49.7% de 3.5 Flash
Agentes de uso de ordenador en tareas difíciles3.6 FlashOSWorld-Verified 83.0% (frente a 74.0% de Lite)
Análisis multimodal de documentos y redacción de informes3.6 FlashValidado por Harvey / Hebbia en el lanzamiento
Pipelines heredados todavía en 3.5 FlashMigra hacia arriba o abajo3.6 Flash para calidad, Flash-Lite para volumen — mira la guía de migración
Detección y parcheo de vulnerabilidades de seguridad3.5 Flash CyberSolo vía piloto de CodeMender (gobiernos y socios de confianza)

Regla general: usa Flash-Lite por defecto y escala solo ante fallos, en lugar de partir del modelo grande y optimizar después. El modo de fallo es visible (malas salidas); el desperdicio del sobredimensionamiento es silencioso.

Dónde está disponible

3.5 Flash-Lite ya está activo en la API de Gemini (Google AI Studio, Android Studio), la Gemini Enterprise Agent Platform y la app de Gemini, y se está desplegando dentro de la Búsqueda de Google, lo que dice mucho sobre la confianza de Google en su perfil de costes a escala planetaria. Entre los primeros clientes están Ashler, Palo Alto Networks y Ramp.

Apunte: 3.5 Flash Cyber y CodeMender

El mismo lanzamiento presentó Gemini 3.5 Flash Cyber: 3.5 Flash afinado para encontrar y corregir vulnerabilidades de seguridad. Dentro de CodeMender, varios agentes Flash Cyber trabajan en paralelo y fusionan sus hallazgos en un único informe combinado, alcanzando un rendimiento competitivo de frontera en CyberGym. Fíjate en la arquitectura: es el mismo patrón de “flota de especialistas eficientes” que describe esta guía, aplicado a la seguridad.

El acceso es deliberadamente estrecho: un piloto de acceso limitado exclusivo para gobiernos y socios de confianza vía CodeMender, reflejo del riesgo de doble uso del descubrimiento automatizado de vulnerabilidades. Los detalles están en nuestro resumen del anuncio.

En conclusión

3.5 Flash-Lite redibuja la frontera precio-rendimiento para cargas agénticas: más rápido que cualquier cosa en la serie 3.5, unas 4× más barato que 3.6 Flash y, por primera vez en un modelo Lite, genuinamente fiable en benchmarks agénticos. Diseña tu enrutamiento de modo que Flash-Lite sea el valor por defecto y 3.6 Flash la vía de escalado, y tu curva de costes te lo agradecerá.

Relacionado