Guía de Gemini 3.5 Flash-Lite: escalar flujos agénticos a 350 tokens/s (2026)
Gemini 3.5 Flash-Lite corre a 350 tokens/s por $0.30/1M de entrada. Benchmarks vs 3.1 Flash-Lite y Gemini 3 Flash, niveles de pensamiento, costes y tabla de decisión.
El nivel de volumen se ha puesto serio
Gemini 3.5 Flash-Lite, anunciado el 21 de julio de 2026, es el modelo de clase 3.5 más rápido y rentable de Google: 350 tokens de salida por segundo (Artificial Analysis), con un precio de $0.30 por 1M de tokens de entrada y $2.50 por 1M de tokens de salida. Históricamente, los niveles “Lite” eran donde la calidad iba a morir: buenos para clasificación y texto rutinario, arriesgados para cualquier cosa agéntica. Este lanzamiento rompe ese patrón: en varias evaluaciones agénticas y de código, 3.5 Flash-Lite supera directamente al mayor Gemini 3 Flash.
Esta guía cubre dónde encaja Flash-Lite en la gama, cómo configurar sus niveles de pensamiento, cuánto cuesta realmente a escala y qué modelo elegir para cada carga. El contexto del lanzamiento está en nuestro resumen del anuncio.
Salto generacional: vs 3.1 Flash-Lite
El salto respecto a la generación Lite anterior es el mayor en la historia de la familia:
| Benchmark | Qué mide | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | Tareas de terminal, código y agentes | 54% | 31% |
| GDM-MRCR v2 | Recuperación en contexto largo | 72.2% | 60.1% |
| GDPval-AA v2 | Ejecución de tareas reales | 1140 | 642 |

El dato a interiorizar es el GDPval-AA v2 casi duplicándose (642 → 1140): la ejecución de tareas del mundo real era exactamente donde los antiguos modelos Lite se venían abajo en agentes de producción.
La sorpresa: ganar a Gemini 3 Flash
Más sorprendente que la ganancia generacional es la de nivel cruzado. En varias evaluaciones agénticas y de código, 3.5 Flash-Lite supera a Gemini 3 Flash, un modelo más grande y más caro:
| Benchmark | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | 54.2% | 49.6% |
| OSWorld-Verified | 74.0% | 65.1% |
Si hoy ejecutas cargas en 2.5 Flash o 3 Flash porque no se podía confiar en los niveles Lite para trabajo agéntico, esa suposición ha quedado obsoleta: Flash-Lite es más rápido y más capaz en estas tareas.
Niveles de pensamiento: un modelo, dos modos de operación
Flash-Lite llega con niveles de pensamiento configurables, que en la práctica lo convierten en dos productos:
- Pensamiento minimal / low: prioriza latencia y coste para tareas de alto volumen: búsqueda agéntica, procesamiento de documentos, extracción, clasificación, enrutamiento. Este es el modo de 350 tokens/s.
- Niveles de pensamiento más altos: activan un razonamiento más profundo para cargas de subagentes de varios pasos, donde Flash-Lite actúa como trabajador bajo un modelo orquestador.
Ese segundo modo coincide con el patrón de demo de la propia Google: 3.6 Flash como agente maestro y flotas de subagentes 3.5 Flash-Lite trabajando en paralelo (una demo genera 25 conceptos de diseño web simultáneamente). El uso de ordenador también es una herramienta integrada en Flash-Lite, así que los subagentes pueden operar interfaces sin andamiaje extra. Mira la demo de velocidad Flash-Lite vs 3.5 Flash de Google (vídeo) para ver la diferencia de latencia en tareas de alto volumen.
Análisis de costes: lo que cuesta realmente la escala
Precios: $0.30/1M de entrada, $2.50/1M de salida. Un ejemplo de carga: un agente de procesamiento de documentos que maneja 1 millón de documentos al mes, con una media de 3K tokens de entrada y 500 de salida por documento:
| Componente de coste | Cálculo | Coste mensual |
|---|---|---|
| Tokens de entrada | 1M docs × 3K tokens = 3B tokens × $0.30/1M | $900 |
| Tokens de salida | 1M docs × 500 tokens = 0.5B tokens × $2.50/1M | $1,250 |
| Total con 3.5 Flash-Lite | $2,150 | |
| La misma carga con 3.6 Flash ($1.50 / $7.50) | $4,500 + $3,750 | $8,250 |
Aproximadamente una diferencia de coste de 4× para una carga que Lite maneja bien; y a 350 tokens/s, el resumen de 500 tokens de cada documento se emite en menos de 1.5 segundos. La estrategia que se deriva: enruta el 90% del volumen rutinario a Flash-Lite y escala el 10% difícil a 3.6 Flash.
Tabla de decisión: qué modelo para qué carga
| Carga de trabajo | Elige | Por qué |
|---|---|---|
| Búsqueda agéntica / RAG con alto QPS | 3.5 Flash-Lite (pensamiento minimal) | 350 tokens/s, menor coste por consulta |
| Procesamiento / extracción masiva de documentos | 3.5 Flash-Lite | 4× más barato que 3.6 Flash; GDM-MRCR v2 72.2% en contexto largo |
| Clasificación, enrutamiento, moderación | 3.5 Flash-Lite (pensamiento minimal) | Latencia crítica, calidad de sobra |
| Flotas de subagentes en paralelo bajo un orquestador | 3.5 Flash-Lite (pensamiento alto) | Modo diseñado para ello; uso de ordenador integrado |
| Código agéntico complejo (agentes SWE) | 3.6 Flash | DeepSWE 49%; mayor precisión, menos ediciones malas |
| Flujos de investigación de ML | 3.6 Flash | MLE Bench 63.9% frente a 49.7% de 3.5 Flash |
| Agentes de uso de ordenador en tareas difíciles | 3.6 Flash | OSWorld-Verified 83.0% (frente a 74.0% de Lite) |
| Análisis multimodal de documentos y redacción de informes | 3.6 Flash | Validado por Harvey / Hebbia en el lanzamiento |
| Pipelines heredados todavía en 3.5 Flash | Migra hacia arriba o abajo | 3.6 Flash para calidad, Flash-Lite para volumen — mira la guía de migración |
| Detección y parcheo de vulnerabilidades de seguridad | 3.5 Flash Cyber | Solo vía piloto de CodeMender (gobiernos y socios de confianza) |
Regla general: usa Flash-Lite por defecto y escala solo ante fallos, en lugar de partir del modelo grande y optimizar después. El modo de fallo es visible (malas salidas); el desperdicio del sobredimensionamiento es silencioso.
Dónde está disponible
3.5 Flash-Lite ya está activo en la API de Gemini (Google AI Studio, Android Studio), la Gemini Enterprise Agent Platform y la app de Gemini, y se está desplegando dentro de la Búsqueda de Google, lo que dice mucho sobre la confianza de Google en su perfil de costes a escala planetaria. Entre los primeros clientes están Ashler, Palo Alto Networks y Ramp.
Apunte: 3.5 Flash Cyber y CodeMender
El mismo lanzamiento presentó Gemini 3.5 Flash Cyber: 3.5 Flash afinado para encontrar y corregir vulnerabilidades de seguridad. Dentro de CodeMender, varios agentes Flash Cyber trabajan en paralelo y fusionan sus hallazgos en un único informe combinado, alcanzando un rendimiento competitivo de frontera en CyberGym. Fíjate en la arquitectura: es el mismo patrón de “flota de especialistas eficientes” que describe esta guía, aplicado a la seguridad.
El acceso es deliberadamente estrecho: un piloto de acceso limitado exclusivo para gobiernos y socios de confianza vía CodeMender, reflejo del riesgo de doble uso del descubrimiento automatizado de vulnerabilidades. Los detalles están en nuestro resumen del anuncio.
En conclusión
3.5 Flash-Lite redibuja la frontera precio-rendimiento para cargas agénticas: más rápido que cualquier cosa en la serie 3.5, unas 4× más barato que 3.6 Flash y, por primera vez en un modelo Lite, genuinamente fiable en benchmarks agénticos. Diseña tu enrutamiento de modo que Flash-Lite sea el valor por defecto y 3.6 Flash la vía de escalado, y tu curva de costes te lo agradecerá.