Gemini Omni
Voltar para artigos
9 min de leitura

Google lança Gemini 3.7 Flash: raciocínio híbrido para coding, agentes e trabalho de conhecimento

Gemini 3.7 Flash chega em 13 de agosto de 2026 com raciocínio híbrido nativo, orçamentos de pensamento configuráveis, benchmarks de coding frontier e 50% de desconto introdutório até dezembro.

Gemini 3.7 FlashHybrid ReasoningCodingBenchmarksPricingAnnouncement2026Português

Um novo carro-chefe para raciocínio híbrido

Em 13 de agosto de 2026, o Google lançou o Gemini 3.7 Flash — seu modelo carro-chefe de raciocínio híbrido feito para coding, agentes e trabalho de conhecimento complexo. Diferente das gerações Flash anteriores que trocavam profundidade por velocidade, o 3.7 Flash traz raciocínio nativo configurável embutido na API: você ajusta a profundidade de pensamento por requisição sem mudar para um «modelo de raciocínio» separado.

O lançamento mira três públicos ao mesmo tempo: desenvolvedores implantando agentes em produção, equipes executando tarefas longas de coding e empresas que precisam de análise multimodal confiável sobre conjuntos documentais massivos. O Google posiciona o 3.7 Flash como o modelo em que um único endpoint finalmente atende tanto respostas de chat abaixo de 100 ms quanto pesquisas profundas de vários minutos.

Raciocínio híbrido nativo e thinking budget

O centro é thinking_config.thinking_budget — um inteiro que controla quantos tokens de raciocínio interno o modelo pode consumir antes de responder.

thinking_budgetComportamentoMelhor para
0Modo rápido de latência ultra baixa (primeiro token abaixo de 85 ms)Chat ao vivo, autocompletar, roteamento de alto QPS
256–1024Planejamento leve multi-etapasRoteamento de ferramentas, refactors simples, síntese RAG
4096–16384Raciocínio profundo multi-etapasLoops de agentes, debug complexo, relatórios de pesquisa
32768–65536Profundidade máximaCoding de longo horizonte, mudanças de arquitetura multi-arquivo

Configure na Gemini API assim:

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="Refatore este componente React para usar hooks e adicione error boundaries.",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(
            thinking_budget=8192  # 0 = modo rápido; até 65536 para raciocínio profundo
        )
    ),
)
print(response.text)

Como o raciocínio é nativo e não acoplado, a latência escala suavemente: thinking_budget 0 se comporta como um Flash clássico, valores maiores liberam qualidade chain-of-thought sem trocar o ID do modelo. A cobrança separa tokens de saída visíveis de tokens de pensamento interno — você paga só pela profundidade solicitada.

Destaques de benchmarks

O Google publicou números head-to-head contra Gemini 3.6 Flash, Claude Sonnet 5 e GPT-5.6 Terra. O 3.7 Flash lidera em todas as avaliações listadas:

BenchmarkGemini 3.7 FlashGemini 3.6 FlashClaude Sonnet 5GPT-5.6 Terra
FrontierCode 1.143.6%34.4%39.1%37.8%
DeepSWE v1.165.3%49.0%56.2%53.4%
WebDev Arena (Elo)1588153815521544
GDP.pdf34.0%22.0%28.5%26.8%
AutomationBench30.4%17.0%23.1%21.5%
GDM-MRCR v297.0%91.2%94.5%93.1%
HLE-Verified53.6%44.8%48.2%46.7%

Dois números se destacam para quem constrói:

  • DeepSWE v1.1 em 65.3% — salto de 16 pontos sobre o 3.6 Flash; coding agêntico é o alvo principal de treinamento.
  • GDM-MRCR v2 em 97.0% — recuperação quase perfeita em contexto longo com janela de 2,5M tokens, crítica para fluxos documentais.

Para contexto da geração anterior, veja nossa comparação Gemini 3.6 Flash vs 3.5 Flash.

Preços e 50% de desconto introdutório

O Google está com promoção agressiva de lançamento:

Preço intro (até 31 de dez. de 2026)Preço padrão (a partir de 1º de jan. de 2027)
EntradaUS$ 0,75 / 1M tokensUS$ 1,50 / 1M tokens
SaídaUS$ 3,75 / 1M tokensUS$ 7,50 / 1M tokens
Cache de contextoUS$ 0,075 / 1M tokensUS$ 0,075 / 1M tokens

São 50% de desconto em entrada e saída pelo restante de 2026. O cache de contexto — útil ao reutilizar prompts de sistema ou corpus documentais grandes — permanece em US$ 0,075 por milhão de tokens independente da promo.

Combinado com menos idas e vindas de chamadas de ferramentas em budgets de pensamento mais altos, o custo efetivo por tarefa de agente concluída pode ficar bem abaixo do preço por token. Nosso guia de estimativa de custos da API detalha a matemática para cargas típicas.

Capacidades multimodais, web dev e agentes

Além dos benchmarks, o 3.7 Flash traz recursos prontos para produção:

  • Janela de contexto de 2,5M tokens — ingira codebases inteiras, pacotes contratuais ou corpus de pesquisa de uma vez.
  • 245 tokens de saída/s — rápido o suficiente para streamar código UI e relatórios longos sem estrangular a UX.
  • 99,7% de precisão na execução de ferramentas JSON — saídas estruturadas confiáveis para cadeias de ferramentas de agentes.
  • Computer use — automação client-side integrada para fluxos de navegador e desktop.
  • Fidelidade na geração de UI — maior precisão de layout no WebDev Arena (1588 Elo) significa frontends gerados mais limpos.

Disponível hoje via Gemini API, Google AI Studio, Gemini Enterprise e Google Antigravity.

Guia do desenvolvedor e migração

Se você está atualizando do 3.6 Flash ou 3.5 Flash-Lite, comece com estes padrões:

  1. Substitua o ID do modelo — troque gemini-3.6-flash por gemini-3.7-flash; a superfície da API é retrocompatível.
  2. Defina thinking budgets por tipo de tarefa0 para chat voltado ao usuário, 1024 para Q&A RAG, 8192+ para agentes de coding, 32768 só para jobs batch noturnos onde latência não importa.
  3. Ative cache de contexto — se seu prompt de sistema ou conjunto documental passa de 32K tokens e se repete entre requisições, o cache reduz custo de entrada em 90%.
  4. Ajuste schemas de ferramentas — a precisão JSON de 99,7% recompensa schemas rígidos; definições frouxas ainda falham na camada de aplicação.
  5. Monitore uso de tokens de pensamento — registre usage_metadata para entender quais passos do agente realmente precisam de raciocínio profundo.

Para padrões de fluxos agênticos, veja nosso guia de fluxos agênticos 3.5 Flash-Lite — o conceito de thinking budget se estende naturalmente ao 3.7 Flash com granularidade mais fina.

Conclusão

Gemini 3.7 Flash é o primeiro modelo de nível Flash em que velocidade e profundidade não são mutuamente exclusivas. O thinking_budget configurável permite que um modelo atenda chat sensível à latência e coding agêntico profundo, e o preço de lançamento torna a experimentação barata até o fim de 2026.

Relacionados