Gemini Omni
Torna agli articoli
10 min di lettura

Guida a Gemini 3.5 Flash-Lite: scalare i workflow agentici a 350 token/s (2026)

Gemini 3.5 Flash-Lite gira a 350 token/s a $0.30/1M in input. Benchmark vs 3.1 Flash-Lite e Gemini 3 Flash, livelli di ragionamento, costi e tabella decisionale.

Gemini 3.5 Flash-LiteAgentic WorkflowsGuideBenchmarksPricing2026Italiano

La fascia del volume ha iniziato a fare sul serio

Gemini 3.5 Flash-Lite, annunciato il 21 luglio 2026, è il modello più veloce ed economico della classe 3.5 di Google: 350 token di output al secondo (Artificial Analysis), al prezzo di $0.30 per 1M di token di input e $2.50 per 1M di token di output. Storicamente le fasce “Lite” erano il posto dove la qualità andava a morire — buone per classificazione e boilerplate, rischiose per qualsiasi cosa agentica. Questa release rompe lo schema: su diversi eval agentici e di coding, 3.5 Flash-Lite batte nettamente il più grande Gemini 3 Flash.

Questa guida spiega dove si colloca Flash-Lite nella gamma, come configurare i suoi livelli di ragionamento, quanto costa davvero su larga scala e quale modello scegliere per quale carico di lavoro. Il contesto del lancio è nella nostra panoramica dell’annuncio.

Salto generazionale: vs 3.1 Flash-Lite

Il balzo rispetto alla generazione Lite precedente è il più grande nella storia della famiglia:

BenchmarkCosa misuraGemini 3.5 Flash-LiteGemini 3.1 Flash-Lite
Terminal-Bench 2.1Coding e task agentici da terminale54%31%
GDM-MRCR v2Retrieval a contesto lungo72.2%60.1%
GDPval-AA v2Esecuzione di task reali1140642

Confronto dei benchmark di Gemini 3.5 Flash-Lite con le generazioni precedenti di Flash-Lite

Il valore GDPval-AA v2 quasi raddoppiato (642 → 1140) è quello da interiorizzare: l’esecuzione di task reali era esattamente il punto in cui i vecchi modelli Lite crollavano negli agenti in produzione.

La sorpresa: battere Gemini 3 Flash

Più sorprendente del guadagno generazionale è quello tra fasce. Su diversi eval agentici e di coding, 3.5 Flash-Lite supera Gemini 3 Flash — un modello più grande e più costoso:

BenchmarkGemini 3.5 Flash-LiteGemini 3 Flash
SWE-Bench Pro54.2%49.6%
OSWorld-Verified74.0%65.1%

Se oggi tieni i tuoi carichi di lavoro su 2.5 Flash o 3 Flash perché delle fasce Lite non ci si poteva fidare per il lavoro agentico, quell’assunzione è ormai superata: Flash-Lite è al tempo stesso più veloce e più capace su questi task.

Livelli di ragionamento: un modello, due modalità operative

Flash-Lite arriva con livelli di ragionamento configurabili, che di fatto lo rendono due prodotti:

  • Ragionamento minimal / low — priorità a latenza e costi per task ad alto volume: ricerca agentica, elaborazione di documenti, estrazione, classificazione, routing. È la modalità da 350 token/s.
  • Livelli di ragionamento più alti — attivano un ragionamento più profondo per carichi di lavoro con subagenti multi-step, dove Flash-Lite lavora come worker sotto un modello orchestratore.

La seconda modalità corrisponde al pattern delle demo di Google: 3.6 Flash come agente master, flotte di subagenti 3.5 Flash-Lite che lavorano in parallelo (una demo genera 25 concept di web design simultaneamente). Anche su Flash-Lite l’uso del computer è uno strumento integrato, quindi i subagenti possono operare sulle interfacce senza impalcature extra. Guarda la demo di velocità Flash-Lite vs 3.5 Flash (video) per la differenza di latenza sui task ad alto volume.

Analisi dei costi: quanto costa davvero la scala

Prezzi: $0.30/1M in input, $2.50/1M in output. Ecco un carico di lavoro d’esempio — un agente di elaborazione documenti che gestisce 1 milione di documenti al mese, con una media di 3K token di input e 500 token di output per documento:

Voce di costoCalcoloCosto mensile
Token di input1M doc × 3K token = 3B token × $0.30/1M$900
Token di output1M doc × 500 token = 0.5B token × $2.50/1M$1,250
Totale su 3.5 Flash-Lite$2,150
Stesso carico su 3.6 Flash ($1.50 / $7.50)$4,500 + $3,750$8,250

Circa una differenza di costo di 4× per un carico che Lite gestisce bene — e a 350 token/s il riassunto da 500 token di ogni documento esce in streaming in meno di 1.5 secondi. La strategia che ne segue: instrada il 90% del volume di routine su Flash-Lite ed escalation del 10% difficile verso 3.6 Flash.

Tabella decisionale: quale modello per quale carico di lavoro

Carico di lavoroSceltaPerché
Ricerca agentica / RAG ad alto QPS3.5 Flash-Lite (ragionamento minimal)350 token/s, costo per query più basso
Elaborazione massiva di documenti / estrazione3.5 Flash-Lite4× più economico di 3.6 Flash; GDM-MRCR v2 72.2% sul long-context
Classificazione, routing, moderazione3.5 Flash-Lite (ragionamento minimal)Latenza critica, margine di qualità da vendere
Flotte di subagenti paralleli sotto un orchestratore3.5 Flash-Lite (ragionamento più alto)Modalità progettata apposta; uso del computer integrato
Coding agentico complesso (agenti SWE)3.6 FlashDeepSWE 49%; maggiore precisione, meno modifiche sbagliate
Workflow di ricerca ML3.6 FlashMLE Bench 63.9% contro 49.7% di 3.5 Flash
Agenti di uso del computer su task difficili3.6 FlashOSWorld-Verified 83.0% (contro 74.0% di Lite)
Analisi multimodale di documenti e stesura di report3.6 FlashValidato da Harvey / Hebbia al lancio
Pipeline legacy ancora su 3.5 FlashMigra su o giù3.6 Flash per la qualità, Flash-Lite per il volume — vedi la guida alla migrazione
Rilevamento e patching di vulnerabilità di sicurezza3.5 Flash CyberSolo via pilota CodeMender (governi e partner fidati)

Regola pratica: parti da Flash-Lite ed effettua l’escalation in caso di fallimento, invece di partire dal modello grande e ottimizzare dopo. Il fallimento è visibile (output scadenti); lo spreco del sovradimensionamento è silenzioso.

Dove è disponibile

3.5 Flash-Lite è attivo da oggi nella Gemini API (Google AI Studio, Android Studio), nella Gemini Enterprise Agent Platform e nell’app Gemini — e si sta diffondendo dentro Google Search, il che la dice lunga sulla fiducia di Google nel suo profilo di costo su scala planetaria. Tra i primi clienti figurano Ashler, Palo Alto Networks e Ramp.

Nota a margine: 3.5 Flash Cyber e CodeMender

Lo stesso lancio ha introdotto Gemini 3.5 Flash Cyber — 3.5 Flash ottimizzato per trovare e correggere vulnerabilità di sicurezza. Dentro CodeMender, più agenti Flash Cyber lavorano in parallelo e uniscono i loro risultati in un unico report combinato, raggiungendo prestazioni competitive con i modelli di frontiera su CyberGym. Nota l’architettura: è lo stesso pattern “flotta di specialisti efficienti” descritto in questa guida, applicato alla sicurezza.

L’accesso è deliberatamente ristretto: un pilota ad accesso limitato riservato esclusivamente a governi e partner fidati via CodeMender, a riflettere il rischio a doppio uso della scoperta automatica di vulnerabilità. Dettagli nella nostra panoramica dell’annuncio.

In conclusione

3.5 Flash-Lite ridisegna la frontiera prezzo-prestazioni per i carichi di lavoro agentici: più veloce di qualsiasi cosa nella serie 3.5, circa 4× più economico di 3.6 Flash e — per la prima volta in un modello Lite — davvero affidabile sui benchmark agentici. Costruisci il tuo routing con Flash-Lite come default e 3.6 Flash come percorso di escalation, e la tua curva dei costi ti ringrazierà.

Correlati