Google lança Gemini 3.7 Flash: raciocínio híbrido para coding, agentes e trabalho de conhecimento
Gemini 3.7 Flash chega em 13 de agosto de 2026 com raciocínio híbrido nativo, orçamentos de pensamento configuráveis, benchmarks de coding frontier e 50% de desconto introdutório até dezembro.
Um novo carro-chefe para raciocínio híbrido
Em 13 de agosto de 2026, o Google lançou o Gemini 3.7 Flash — seu modelo carro-chefe de raciocínio híbrido feito para coding, agentes e trabalho de conhecimento complexo. Diferente das gerações Flash anteriores que trocavam profundidade por velocidade, o 3.7 Flash traz raciocínio nativo configurável embutido na API: você ajusta a profundidade de pensamento por requisição sem mudar para um «modelo de raciocínio» separado.
O lançamento mira três públicos ao mesmo tempo: desenvolvedores implantando agentes em produção, equipes executando tarefas longas de coding e empresas que precisam de análise multimodal confiável sobre conjuntos documentais massivos. O Google posiciona o 3.7 Flash como o modelo em que um único endpoint finalmente atende tanto respostas de chat abaixo de 100 ms quanto pesquisas profundas de vários minutos.
Raciocínio híbrido nativo e thinking budget
O centro é thinking_config.thinking_budget — um inteiro que controla quantos tokens de raciocínio interno o modelo pode consumir antes de responder.
thinking_budget | Comportamento | Melhor para |
|---|---|---|
| 0 | Modo rápido de latência ultra baixa (primeiro token abaixo de 85 ms) | Chat ao vivo, autocompletar, roteamento de alto QPS |
| 256–1024 | Planejamento leve multi-etapas | Roteamento de ferramentas, refactors simples, síntese RAG |
| 4096–16384 | Raciocínio profundo multi-etapas | Loops de agentes, debug complexo, relatórios de pesquisa |
| 32768–65536 | Profundidade máxima | Coding de longo horizonte, mudanças de arquitetura multi-arquivo |
Configure na Gemini API assim:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Refatore este componente React para usar hooks e adicione error boundaries.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=8192 # 0 = modo rápido; até 65536 para raciocínio profundo
)
),
)
print(response.text)
Como o raciocínio é nativo e não acoplado, a latência escala suavemente: thinking_budget 0 se comporta como um Flash clássico, valores maiores liberam qualidade chain-of-thought sem trocar o ID do modelo. A cobrança separa tokens de saída visíveis de tokens de pensamento interno — você paga só pela profundidade solicitada.
Destaques de benchmarks
O Google publicou números head-to-head contra Gemini 3.6 Flash, Claude Sonnet 5 e GPT-5.6 Terra. O 3.7 Flash lidera em todas as avaliações listadas:
| Benchmark | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 | 43.6% | 34.4% | 39.1% | 37.8% |
| DeepSWE v1.1 | 65.3% | 49.0% | 56.2% | 53.4% |
| WebDev Arena (Elo) | 1588 | 1538 | 1552 | 1544 |
| GDP.pdf | 34.0% | 22.0% | 28.5% | 26.8% |
| AutomationBench | 30.4% | 17.0% | 23.1% | 21.5% |
| GDM-MRCR v2 | 97.0% | 91.2% | 94.5% | 93.1% |
| HLE-Verified | 53.6% | 44.8% | 48.2% | 46.7% |
Dois números se destacam para quem constrói:
- DeepSWE v1.1 em 65.3% — salto de 16 pontos sobre o 3.6 Flash; coding agêntico é o alvo principal de treinamento.
- GDM-MRCR v2 em 97.0% — recuperação quase perfeita em contexto longo com janela de 2,5M tokens, crítica para fluxos documentais.
Para contexto da geração anterior, veja nossa comparação Gemini 3.6 Flash vs 3.5 Flash.
Preços e 50% de desconto introdutório
O Google está com promoção agressiva de lançamento:
| Preço intro (até 31 de dez. de 2026) | Preço padrão (a partir de 1º de jan. de 2027) | |
|---|---|---|
| Entrada | US$ 0,75 / 1M tokens | US$ 1,50 / 1M tokens |
| Saída | US$ 3,75 / 1M tokens | US$ 7,50 / 1M tokens |
| Cache de contexto | US$ 0,075 / 1M tokens | US$ 0,075 / 1M tokens |
São 50% de desconto em entrada e saída pelo restante de 2026. O cache de contexto — útil ao reutilizar prompts de sistema ou corpus documentais grandes — permanece em US$ 0,075 por milhão de tokens independente da promo.
Combinado com menos idas e vindas de chamadas de ferramentas em budgets de pensamento mais altos, o custo efetivo por tarefa de agente concluída pode ficar bem abaixo do preço por token. Nosso guia de estimativa de custos da API detalha a matemática para cargas típicas.
Capacidades multimodais, web dev e agentes
Além dos benchmarks, o 3.7 Flash traz recursos prontos para produção:
- Janela de contexto de 2,5M tokens — ingira codebases inteiras, pacotes contratuais ou corpus de pesquisa de uma vez.
- 245 tokens de saída/s — rápido o suficiente para streamar código UI e relatórios longos sem estrangular a UX.
- 99,7% de precisão na execução de ferramentas JSON — saídas estruturadas confiáveis para cadeias de ferramentas de agentes.
- Computer use — automação client-side integrada para fluxos de navegador e desktop.
- Fidelidade na geração de UI — maior precisão de layout no WebDev Arena (1588 Elo) significa frontends gerados mais limpos.
Disponível hoje via Gemini API, Google AI Studio, Gemini Enterprise e Google Antigravity.
Guia do desenvolvedor e migração
Se você está atualizando do 3.6 Flash ou 3.5 Flash-Lite, comece com estes padrões:
- Substitua o ID do modelo — troque
gemini-3.6-flashporgemini-3.7-flash; a superfície da API é retrocompatível. - Defina thinking budgets por tipo de tarefa —
0para chat voltado ao usuário,1024para Q&A RAG,8192+para agentes de coding,32768só para jobs batch noturnos onde latência não importa. - Ative cache de contexto — se seu prompt de sistema ou conjunto documental passa de 32K tokens e se repete entre requisições, o cache reduz custo de entrada em 90%.
- Ajuste schemas de ferramentas — a precisão JSON de 99,7% recompensa schemas rígidos; definições frouxas ainda falham na camada de aplicação.
- Monitore uso de tokens de pensamento — registre
usage_metadatapara entender quais passos do agente realmente precisam de raciocínio profundo.
Para padrões de fluxos agênticos, veja nosso guia de fluxos agênticos 3.5 Flash-Lite — o conceito de thinking budget se estende naturalmente ao 3.7 Flash com granularidade mais fina.
Conclusão
Gemini 3.7 Flash é o primeiro modelo de nível Flash em que velocidade e profundidade não são mutuamente exclusivas. O thinking_budget configurável permite que um modelo atenda chat sensível à latência e coding agêntico profundo, e o preço de lançamento torna a experimentação barata até o fim de 2026.