Google lancia Gemini 3.7 Flash: ragionamento ibrido per coding, agenti e knowledge work
Gemini 3.7 Flash arriva il 13 agosto 2026 con ragionamento ibrido nativo, budget di pensiero configurabili, benchmark di coding frontier e sconto introduttivo del 50% fino a dicembre.
Un nuovo flagship per il ragionamento ibrido
Il 13 agosto 2026, Google ha rilasciato Gemini 3.7 Flash — il suo modello flagship di ragionamento ibrido pensato per coding, agenti e knowledge work complesso. A differenza delle generazioni Flash precedenti che scambiavano profondità per velocità, 3.7 Flash integra ragionamento nativo configurabile direttamente nell’API: regoli la profondità di pensiero per richiesta senza passare a un «modello di ragionamento» separato.
Il lancio punta a tre audience contemporaneamente: sviluppatori che deployano agenti in produzione, team che eseguono task di coding a lungo orizzonte e aziende che necessitano analisi multimodali affidabili su enormi set documentali. Google posiziona 3.7 Flash come il modello che finalmente fa funzionare un unico endpoint sia per risposte chat sotto i 100 ms sia per ricerche approfondite di diversi minuti.
Ragionamento ibrido nativo e thinking budget
Il fulcro è thinking_config.thinking_budget — un intero che controlla quanti token di ragionamento interno il modello può consumare prima di rispondere.
thinking_budget | Comportamento | Ideale per |
|---|---|---|
| 0 | Modalità veloce a latenza ultra-bassa (primo token sotto 85 ms) | Chat live, autocompletamento, routing ad alto QPS |
| 256–1024 | Pianificazione leggera multi-step | Routing tool, refactor semplici, sintesi RAG |
| 4096–16384 | Ragionamento profondo multi-step | Loop di agenti, debug complesso, report di ricerca |
| 32768–65536 | Profondità massima | Coding a lungo orizzonte, cambi architetturali multi-file |
Configuralo nella Gemini API così:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Refactora questo componente React per usare gli hooks e aggiungi error boundaries.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=8192 # 0 = modalità veloce; fino a 65536 per ragionamento profondo
)
),
)
print(response.text)
Poiché il ragionamento è nativo e non aggiunto, la latenza scala in modo fluido: un thinking_budget di 0 si comporta come un Flash classico, valori più alti sbloccano qualità chain-of-thought senza cambiare ID modello. La fatturazione separa token di output visibili da token di pensiero interni: paghi solo la profondità richiesta.
Highlight dei benchmark
Google ha pubblicato numeri head-to-head contro Gemini 3.6 Flash, Claude Sonnet 5 e GPT-5.6 Terra. 3.7 Flash guida in tutte le valutazioni elencate:
| Benchmark | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 | 43.6% | 34.4% | 39.1% | 37.8% |
| DeepSWE v1.1 | 65.3% | 49.0% | 56.2% | 53.4% |
| WebDev Arena (Elo) | 1588 | 1538 | 1552 | 1544 |
| GDP.pdf | 34.0% | 22.0% | 28.5% | 26.8% |
| AutomationBench | 30.4% | 17.0% | 23.1% | 21.5% |
| GDM-MRCR v2 | 97.0% | 91.2% | 94.5% | 93.1% |
| HLE-Verified | 53.6% | 44.8% | 48.2% | 46.7% |
Due numeri spiccano per chi costruisce:
- DeepSWE v1.1 al 65.3% — un salto di 16 punti su 3.6 Flash, segno che il coding agentico è l’obiettivo primario di training.
- GDM-MRCR v2 al 97.0% — retrieval quasi perfetto in contesto lungo su finestra da 2,5M token, critico per workflow documentali.
Per il contesto sulla generazione precedente, vedi il nostro confronto Gemini 3.6 Flash vs 3.5 Flash.
Prezzi e sconto introduttivo del 50%
Google applica una promozione di lancio aggressiva:
| Prezzo intro (fino al 31 dic 2026) | Prezzo standard (dal 1 gen 2027) | |
|---|---|---|
| Input | $0,75 / 1M token | $1,50 / 1M token |
| Output | $3,75 / 1M token | $7,50 / 1M token |
| Context caching | $0,075 / 1M token | $0,075 / 1M token |
È uno sconto del 50% su input e output per il resto del 2026. Il context caching — utile quando riutilizzi grandi system prompt o corpus documentali — resta a $0,075 per milione di token indipendentemente dalla promo.
Combinato con meno round-trip di chiamate tool a budget di pensiero più alti, il costo effettivo per task agente completato può scendere ben sotto il prezzo per token. La nostra guida alla stima costi API illustra i calcoli per carichi tipici.
Capacità multimodali, web dev e agenti
Oltre ai benchmark, 3.7 Flash include capacità pronte per la produzione:
- Finestra di contesto da 2,5M token — ingerire codebase intere, pacchetti contrattuali o corpus di ricerca in un passaggio.
- 245 token di output/s — abbastanza veloce per streammare codice UI e report lunghi senza strozzare l’esperienza.
- 99,7% di precisione nell’esecuzione tool JSON — output strutturati affidabili per catene di tool degli agenti.
- Computer use — automazione client-side integrata per workflow browser e desktop.
- Fedeltà nella generazione UI — maggiore accuratezza del layout su WebDev Arena (1588 Elo) significa frontend generati più puliti.
Disponibili oggi tramite Gemini API, Google AI Studio, Gemini Enterprise e Google Antigravity.
Guida sviluppatore e migrazione
Se aggiorni da 3.6 Flash o 3.5 Flash-Lite, inizia con questi pattern:
- Sostituisci l’ID modello — cambia
gemini-3.6-flashingemini-3.7-flash; la superficie API è retrocompatibile. - Imposta thinking budget per tipo di task —
0per chat utente,1024per Q&A RAG,8192+per agenti di coding,32768solo per job batch notturni dove la latenza non conta. - Abilita context caching — se system prompt o set documentali superano 32K token e si ripetono tra richieste, il caching taglia i costi input del 90%.
- Ottimizza gli schema tool — la precisione JSON al 99,7% premia schema rigorosi; definizioni lasse falliscono ancora a livello applicativo.
- Monitora l’uso di token di pensiero — logga
usage_metadataper capire quali step agente richiedono davvero ragionamento profondo.
Per pattern di workflow agentici, vedi la nostra guida ai workflow agentici 3.5 Flash-Lite — il concetto di thinking budget si estende naturalmente a 3.7 Flash con granularità più fine.
Conclusione
Gemini 3.7 Flash è il primo modello di livello Flash dove velocità e profondità non si escludono. Il thinking_budget configurabile permette a un solo modello di servire chat sensibile alla latenza e coding agentico profondo, e i prezzi di lancio rendono economici gli esperimenti fino a fine 2026.