Gemini 3.6 Flash vs 3.5 Flash: benchmark, prezzi e quando migrare (2026)
Gemini 3.6 Flash supera 3.5 Flash su ogni benchmark, taglia i token di output del 17% e costa meno. Tabelle di confronto complete e playbook di migrazione.
Un raro upgrade “strettamente migliore”
La maggior parte degli aggiornamenti di modello sacrifica qualcosa — qualità per velocità, prezzo per capacità. Gemini 3.6 Flash vs Gemini 3.5 Flash è il caso insolito in cui il modello più nuovo vince su ogni asse pubblicato da Google il 21 luglio 2026: punteggi di benchmark più alti, meno token di output, meno passaggi di ragionamento e chiamate agli strumenti, e un prezzo per token più basso. Questo approfondimento passa in rassegna i numeri e poi diventa pratico: chi dovrebbe migrare, quando e cosa ritestare.
Se prima vuoi il contesto completo del lancio dei tre modelli, parti dalla nostra panoramica dell’annuncio.
Efficienza dei token: il titolo che nessuno dovrebbe saltare
Il numero più importante di questa release non è un punteggio di benchmark. Sull’Artificial Analysis Index, 3.6 Flash consuma il 17% di token di output in meno rispetto a 3.5 Flash a parità di lavoro. Su DeepSWE di Datacurve, Google ha osservato riduzioni fino al 65%.

Perché conta più di quanto sembri:
- I token di output sono quelli costosi ($7.50/1M contro $1.50/1M in input). Tagliarli del 17–65% attacca la voce di costo dominante.
- Meno token = latenza più bassa. Un agente che dice meno finisce prima, e le catene multi-step amplificano l’effetto.
- Meno passaggi di ragionamento e chiamate agli strumenti significano meno round-trip, meno punti di guasto e meno overhead di orchestrazione per task.
Google ha pubblicato una demo affiancata su un task di uso del computer — guarda il video di confronto sull’efficienza dei token.
Confronto completo dei benchmark
| Benchmark | Cosa misura | Gemini 3.6 Flash | Gemini 3.5 Flash | Delta |
|---|---|---|---|---|
| DeepSWE | Ingegneria del software agentica | 49% | 37% | +12 punti |
| MLE Bench | Ricerca e ingegneria ML | 63.9% | 49.7% | +14.2 punti |
| OSWorld-Verified | Uso del computer | 83.0% | 78.4% | +4.6 punti |
| GDPval-AA v2 | Knowledge work reale | 1421 | 1349 | +72 |

Tre letture della tabella:
- Il salto su DeepSWE (37% → 49%) è quello che dovrebbe interessare ai team di coding: Google lo attribuisce a una maggiore precisione — meno modifiche indesiderate al codice e meno cicli di esecuzione, non solo più capacità grezza.
- MLE Bench (+14.2 punti) è il guadagno più grande e segnala un vero passo avanti nei workflow di ricerca ML: impalcature per esperimenti, analisi dei dati, debug dei loop di training.
- OSWorld-Verified all’83.0% conta perché l’uso del computer è ora uno strumento client-side integrato nella Gemini API e in Gemini Enterprise. Il salto di capacità e il cambio di packaging arrivano insieme.
Prezzi: più economico per token, più economico per task
| Gemini 3.6 Flash | Gemini 3.5 Flash | |
|---|---|---|
| Prezzo di input | $1.50 / 1M token | Più alto |
| Prezzo di output | $7.50 / 1M token | Più alto |
| Token di output per task | ~17% in meno (fino al 65% su DeepSWE) | Baseline |
| Costo effettivo per task agentico | Sensibilmente più basso | Baseline |
Il punto è la composizione degli effetti. Un task che prima emetteva 100K token di output ora ne emette ~83K, e ognuno di quei token costa meno. Per un carico di lavoro che esegue milioni di task agentici al mese, i risparmi compaiono in fattura senza toccare i prompt.
Uso del computer: da add-on a funzionalità integrata
Con 3.6 Flash, l’uso del computer arriva come strumento client-side integrato tramite la Gemini API e Gemini Enterprise. Combinato con il miglioramento su OSWorld-Verified (78.4% → 83.0%), i team che costruiscono agenti browser, automazioni in stile RPA o bot di QA ottengono sia un modello più forte sia meno codice di integrazione. Se finora mantenevi un’impalcatura custom per l’uso del computer attorno a 3.5 Flash, preparati a cancellarne una parte.
Postura di sicurezza
3.6 Flash arriva con protezioni Frontier Safety potenziate nei domini CBRN e dell’offensiva informatica, e Google riferisce che è sensibilmente più resistente ai jailbreak rispetto a 3.5 Flash. Altrettanto rilevante per i team di prodotto: è stato anche addestrato a ridurre i rifiuti su richieste legittime. Se 3.5 Flash a volte rifiutava prompt legittimi in ambito sicurezza o medico nel tuo prodotto, ritesta quei flussi — il tasso di falsi rifiuti dovrebbe calare.
Cosa dicono i primi clienti
La lista di lancio di Google — Figma, Harvey, Hebbia, JetBrains — merita di essere decodificata:
- Figma e JetBrains sono aziende di tooling con inferenza ad alto volume e sensibile alla latenza: un endorsement della storia velocità/efficienza.
- Harvey (legale) e Hebbia (finanza) hanno lodato in particolare il lavoro multimodale sui documenti: parsing, analisi di grafici e dati, stesura di report. Se il tuo carico di lavoro è knowledge work ricco di documenti, il guadagno su GDPval-AA v2 (1349 → 1421) è il tuo proxy di riferimento.
Playbook di migrazione: quando passare
| La tua situazione | Raccomandazione |
|---|---|
| Coding agentico (agenti SWE, bot di code review) | Migra subito — i maggiori guadagni di qualità ed efficienza dei token (DeepSWE +12 punti, fino al 65% di token in meno) |
| Uso del computer / automazione browser | Migra subito — punteggi migliori e tooling integrato che sostituisce l’impalcatura custom |
| Parsing di documenti / analisi / stesura di report | Migra subito — validato dai casi d’uso di Harvey e Hebbia |
| Task semplici ad alto volume e latenza critica | Valuta invece 3.5 Flash-Lite — vedi la nostra guida a Flash-Lite |
| Prompt fortemente ottimizzati con parsing rigido del formato di output | Migra con cautela — l’efficienza dei token cambia la verbosità; rivalida parser ed esempi few-shot |
| Sistemi in produzione congelati per compliance | Pianificala — nessuna deprecazione forzata annunciata, ma prezzo ed efficienza rendono costoso restare |
Checklist pratica prima di cambiare la stringa del modello:
- Riesegui la tua suite di eval — lo stile di output è più asciutto e corto; le asserzioni su lunghezza o formulazione delle risposte possono rompersi.
- Ricontrolla il parsing dell’output strutturato — la verbosità ridotta è di solito una buona notizia per l’affidabilità del JSON, ma verifica.
- Ritesta i flussi sensibili ai rifiuti — aspettati meno falsi rifiuti, ma conferma che i tuoi filtri di sicurezza restino allineati.
- Rimisura il costo per task, non per token — la riduzione del 17–65% dei token fa sì che i confronti per token sottostimino i risparmi.
Verdetto
Gemini 3.6 Flash è il raro successore senza trade-off pubblicati: migliore in coding, ricerca ML, uso del computer e knowledge work, emettendo meno token a prezzi più bassi. A meno che il tuo stack non dipenda da formati di output congelati, migrare da 3.5 Flash non è tanto una questione di se quanto di in quale sprint.