Guida a Gemini 3.5 Flash-Lite: scalare i workflow agentici a 350 token/s (2026)
Gemini 3.5 Flash-Lite gira a 350 token/s a $0.30/1M in input. Benchmark vs 3.1 Flash-Lite e Gemini 3 Flash, livelli di ragionamento, costi e tabella decisionale.
La fascia del volume ha iniziato a fare sul serio
Gemini 3.5 Flash-Lite, annunciato il 21 luglio 2026, è il modello più veloce ed economico della classe 3.5 di Google: 350 token di output al secondo (Artificial Analysis), al prezzo di $0.30 per 1M di token di input e $2.50 per 1M di token di output. Storicamente le fasce “Lite” erano il posto dove la qualità andava a morire — buone per classificazione e boilerplate, rischiose per qualsiasi cosa agentica. Questa release rompe lo schema: su diversi eval agentici e di coding, 3.5 Flash-Lite batte nettamente il più grande Gemini 3 Flash.
Questa guida spiega dove si colloca Flash-Lite nella gamma, come configurare i suoi livelli di ragionamento, quanto costa davvero su larga scala e quale modello scegliere per quale carico di lavoro. Il contesto del lancio è nella nostra panoramica dell’annuncio.
Salto generazionale: vs 3.1 Flash-Lite
Il balzo rispetto alla generazione Lite precedente è il più grande nella storia della famiglia:
| Benchmark | Cosa misura | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | Coding e task agentici da terminale | 54% | 31% |
| GDM-MRCR v2 | Retrieval a contesto lungo | 72.2% | 60.1% |
| GDPval-AA v2 | Esecuzione di task reali | 1140 | 642 |

Il valore GDPval-AA v2 quasi raddoppiato (642 → 1140) è quello da interiorizzare: l’esecuzione di task reali era esattamente il punto in cui i vecchi modelli Lite crollavano negli agenti in produzione.
La sorpresa: battere Gemini 3 Flash
Più sorprendente del guadagno generazionale è quello tra fasce. Su diversi eval agentici e di coding, 3.5 Flash-Lite supera Gemini 3 Flash — un modello più grande e più costoso:
| Benchmark | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | 54.2% | 49.6% |
| OSWorld-Verified | 74.0% | 65.1% |
Se oggi tieni i tuoi carichi di lavoro su 2.5 Flash o 3 Flash perché delle fasce Lite non ci si poteva fidare per il lavoro agentico, quell’assunzione è ormai superata: Flash-Lite è al tempo stesso più veloce e più capace su questi task.
Livelli di ragionamento: un modello, due modalità operative
Flash-Lite arriva con livelli di ragionamento configurabili, che di fatto lo rendono due prodotti:
- Ragionamento minimal / low — priorità a latenza e costi per task ad alto volume: ricerca agentica, elaborazione di documenti, estrazione, classificazione, routing. È la modalità da 350 token/s.
- Livelli di ragionamento più alti — attivano un ragionamento più profondo per carichi di lavoro con subagenti multi-step, dove Flash-Lite lavora come worker sotto un modello orchestratore.
La seconda modalità corrisponde al pattern delle demo di Google: 3.6 Flash come agente master, flotte di subagenti 3.5 Flash-Lite che lavorano in parallelo (una demo genera 25 concept di web design simultaneamente). Anche su Flash-Lite l’uso del computer è uno strumento integrato, quindi i subagenti possono operare sulle interfacce senza impalcature extra. Guarda la demo di velocità Flash-Lite vs 3.5 Flash (video) per la differenza di latenza sui task ad alto volume.
Analisi dei costi: quanto costa davvero la scala
Prezzi: $0.30/1M in input, $2.50/1M in output. Ecco un carico di lavoro d’esempio — un agente di elaborazione documenti che gestisce 1 milione di documenti al mese, con una media di 3K token di input e 500 token di output per documento:
| Voce di costo | Calcolo | Costo mensile |
|---|---|---|
| Token di input | 1M doc × 3K token = 3B token × $0.30/1M | $900 |
| Token di output | 1M doc × 500 token = 0.5B token × $2.50/1M | $1,250 |
| Totale su 3.5 Flash-Lite | $2,150 | |
| Stesso carico su 3.6 Flash ($1.50 / $7.50) | $4,500 + $3,750 | $8,250 |
Circa una differenza di costo di 4× per un carico che Lite gestisce bene — e a 350 token/s il riassunto da 500 token di ogni documento esce in streaming in meno di 1.5 secondi. La strategia che ne segue: instrada il 90% del volume di routine su Flash-Lite ed escalation del 10% difficile verso 3.6 Flash.
Tabella decisionale: quale modello per quale carico di lavoro
| Carico di lavoro | Scelta | Perché |
|---|---|---|
| Ricerca agentica / RAG ad alto QPS | 3.5 Flash-Lite (ragionamento minimal) | 350 token/s, costo per query più basso |
| Elaborazione massiva di documenti / estrazione | 3.5 Flash-Lite | 4× più economico di 3.6 Flash; GDM-MRCR v2 72.2% sul long-context |
| Classificazione, routing, moderazione | 3.5 Flash-Lite (ragionamento minimal) | Latenza critica, margine di qualità da vendere |
| Flotte di subagenti paralleli sotto un orchestratore | 3.5 Flash-Lite (ragionamento più alto) | Modalità progettata apposta; uso del computer integrato |
| Coding agentico complesso (agenti SWE) | 3.6 Flash | DeepSWE 49%; maggiore precisione, meno modifiche sbagliate |
| Workflow di ricerca ML | 3.6 Flash | MLE Bench 63.9% contro 49.7% di 3.5 Flash |
| Agenti di uso del computer su task difficili | 3.6 Flash | OSWorld-Verified 83.0% (contro 74.0% di Lite) |
| Analisi multimodale di documenti e stesura di report | 3.6 Flash | Validato da Harvey / Hebbia al lancio |
| Pipeline legacy ancora su 3.5 Flash | Migra su o giù | 3.6 Flash per la qualità, Flash-Lite per il volume — vedi la guida alla migrazione |
| Rilevamento e patching di vulnerabilità di sicurezza | 3.5 Flash Cyber | Solo via pilota CodeMender (governi e partner fidati) |
Regola pratica: parti da Flash-Lite ed effettua l’escalation in caso di fallimento, invece di partire dal modello grande e ottimizzare dopo. Il fallimento è visibile (output scadenti); lo spreco del sovradimensionamento è silenzioso.
Dove è disponibile
3.5 Flash-Lite è attivo da oggi nella Gemini API (Google AI Studio, Android Studio), nella Gemini Enterprise Agent Platform e nell’app Gemini — e si sta diffondendo dentro Google Search, il che la dice lunga sulla fiducia di Google nel suo profilo di costo su scala planetaria. Tra i primi clienti figurano Ashler, Palo Alto Networks e Ramp.
Nota a margine: 3.5 Flash Cyber e CodeMender
Lo stesso lancio ha introdotto Gemini 3.5 Flash Cyber — 3.5 Flash ottimizzato per trovare e correggere vulnerabilità di sicurezza. Dentro CodeMender, più agenti Flash Cyber lavorano in parallelo e uniscono i loro risultati in un unico report combinato, raggiungendo prestazioni competitive con i modelli di frontiera su CyberGym. Nota l’architettura: è lo stesso pattern “flotta di specialisti efficienti” descritto in questa guida, applicato alla sicurezza.
L’accesso è deliberatamente ristretto: un pilota ad accesso limitato riservato esclusivamente a governi e partner fidati via CodeMender, a riflettere il rischio a doppio uso della scoperta automatica di vulnerabilità. Dettagli nella nostra panoramica dell’annuncio.
In conclusione
3.5 Flash-Lite ridisegna la frontiera prezzo-prestazioni per i carichi di lavoro agentici: più veloce di qualsiasi cosa nella serie 3.5, circa 4× più economico di 3.6 Flash e — per la prima volta in un modello Lite — davvero affidabile sui benchmark agentici. Costruisci il tuo routing con Flash-Lite come default e 3.6 Flash come percorso di escalation, e la tua curva dei costi ti ringrazierà.