Gemini Omni
Torna agli articoli
9 min di lettura

Google lancia Gemini 3.7 Flash: ragionamento ibrido per coding, agenti e knowledge work

Gemini 3.7 Flash arriva il 13 agosto 2026 con ragionamento ibrido nativo, budget di pensiero configurabili, benchmark di coding frontier e sconto introduttivo del 50% fino a dicembre.

Gemini 3.7 FlashHybrid ReasoningCodingBenchmarksPricingAnnouncement2026Italiano

Un nuovo flagship per il ragionamento ibrido

Il 13 agosto 2026, Google ha rilasciato Gemini 3.7 Flash — il suo modello flagship di ragionamento ibrido pensato per coding, agenti e knowledge work complesso. A differenza delle generazioni Flash precedenti che scambiavano profondità per velocità, 3.7 Flash integra ragionamento nativo configurabile direttamente nell’API: regoli la profondità di pensiero per richiesta senza passare a un «modello di ragionamento» separato.

Il lancio punta a tre audience contemporaneamente: sviluppatori che deployano agenti in produzione, team che eseguono task di coding a lungo orizzonte e aziende che necessitano analisi multimodali affidabili su enormi set documentali. Google posiziona 3.7 Flash come il modello che finalmente fa funzionare un unico endpoint sia per risposte chat sotto i 100 ms sia per ricerche approfondite di diversi minuti.

Ragionamento ibrido nativo e thinking budget

Il fulcro è thinking_config.thinking_budget — un intero che controlla quanti token di ragionamento interno il modello può consumare prima di rispondere.

thinking_budgetComportamentoIdeale per
0Modalità veloce a latenza ultra-bassa (primo token sotto 85 ms)Chat live, autocompletamento, routing ad alto QPS
256–1024Pianificazione leggera multi-stepRouting tool, refactor semplici, sintesi RAG
4096–16384Ragionamento profondo multi-stepLoop di agenti, debug complesso, report di ricerca
32768–65536Profondità massimaCoding a lungo orizzonte, cambi architetturali multi-file

Configuralo nella Gemini API così:

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="Refactora questo componente React per usare gli hooks e aggiungi error boundaries.",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(
            thinking_budget=8192  # 0 = modalità veloce; fino a 65536 per ragionamento profondo
        )
    ),
)
print(response.text)

Poiché il ragionamento è nativo e non aggiunto, la latenza scala in modo fluido: un thinking_budget di 0 si comporta come un Flash classico, valori più alti sbloccano qualità chain-of-thought senza cambiare ID modello. La fatturazione separa token di output visibili da token di pensiero interni: paghi solo la profondità richiesta.

Highlight dei benchmark

Google ha pubblicato numeri head-to-head contro Gemini 3.6 Flash, Claude Sonnet 5 e GPT-5.6 Terra. 3.7 Flash guida in tutte le valutazioni elencate:

BenchmarkGemini 3.7 FlashGemini 3.6 FlashClaude Sonnet 5GPT-5.6 Terra
FrontierCode 1.143.6%34.4%39.1%37.8%
DeepSWE v1.165.3%49.0%56.2%53.4%
WebDev Arena (Elo)1588153815521544
GDP.pdf34.0%22.0%28.5%26.8%
AutomationBench30.4%17.0%23.1%21.5%
GDM-MRCR v297.0%91.2%94.5%93.1%
HLE-Verified53.6%44.8%48.2%46.7%

Due numeri spiccano per chi costruisce:

  • DeepSWE v1.1 al 65.3% — un salto di 16 punti su 3.6 Flash, segno che il coding agentico è l’obiettivo primario di training.
  • GDM-MRCR v2 al 97.0% — retrieval quasi perfetto in contesto lungo su finestra da 2,5M token, critico per workflow documentali.

Per il contesto sulla generazione precedente, vedi il nostro confronto Gemini 3.6 Flash vs 3.5 Flash.

Prezzi e sconto introduttivo del 50%

Google applica una promozione di lancio aggressiva:

Prezzo intro (fino al 31 dic 2026)Prezzo standard (dal 1 gen 2027)
Input$0,75 / 1M token$1,50 / 1M token
Output$3,75 / 1M token$7,50 / 1M token
Context caching$0,075 / 1M token$0,075 / 1M token

È uno sconto del 50% su input e output per il resto del 2026. Il context caching — utile quando riutilizzi grandi system prompt o corpus documentali — resta a $0,075 per milione di token indipendentemente dalla promo.

Combinato con meno round-trip di chiamate tool a budget di pensiero più alti, il costo effettivo per task agente completato può scendere ben sotto il prezzo per token. La nostra guida alla stima costi API illustra i calcoli per carichi tipici.

Capacità multimodali, web dev e agenti

Oltre ai benchmark, 3.7 Flash include capacità pronte per la produzione:

  • Finestra di contesto da 2,5M token — ingerire codebase intere, pacchetti contrattuali o corpus di ricerca in un passaggio.
  • 245 token di output/s — abbastanza veloce per streammare codice UI e report lunghi senza strozzare l’esperienza.
  • 99,7% di precisione nell’esecuzione tool JSON — output strutturati affidabili per catene di tool degli agenti.
  • Computer use — automazione client-side integrata per workflow browser e desktop.
  • Fedeltà nella generazione UI — maggiore accuratezza del layout su WebDev Arena (1588 Elo) significa frontend generati più puliti.

Disponibili oggi tramite Gemini API, Google AI Studio, Gemini Enterprise e Google Antigravity.

Guida sviluppatore e migrazione

Se aggiorni da 3.6 Flash o 3.5 Flash-Lite, inizia con questi pattern:

  1. Sostituisci l’ID modello — cambia gemini-3.6-flash in gemini-3.7-flash; la superficie API è retrocompatibile.
  2. Imposta thinking budget per tipo di task0 per chat utente, 1024 per Q&A RAG, 8192+ per agenti di coding, 32768 solo per job batch notturni dove la latenza non conta.
  3. Abilita context caching — se system prompt o set documentali superano 32K token e si ripetono tra richieste, il caching taglia i costi input del 90%.
  4. Ottimizza gli schema tool — la precisione JSON al 99,7% premia schema rigorosi; definizioni lasse falliscono ancora a livello applicativo.
  5. Monitora l’uso di token di pensiero — logga usage_metadata per capire quali step agente richiedono davvero ragionamento profondo.

Per pattern di workflow agentici, vedi la nostra guida ai workflow agentici 3.5 Flash-Lite — il concetto di thinking budget si estende naturalmente a 3.7 Flash con granularità più fine.

Conclusione

Gemini 3.7 Flash è il primo modello di livello Flash dove velocità e profondità non si escludono. Il thinking_budget configurabile permette a un solo modello di servire chat sensibile alla latenza e coding agentico profondo, e i prezzi di lancio rendono economici gli esperimenti fino a fine 2026.

Correlati