Gemini Omni
Voltar para artigos
9 min de leitura

Gemini 3.6 Flash vs 3.5 Flash: benchmarks, preços e quando migrar (2026)

O Gemini 3.6 Flash vence o 3.5 Flash em todos os benchmarks, corta 17% dos tokens de saída e ainda custa menos. Tabelas comparativas completas e playbook de migração.

Gemini 3.6 FlashGemini 3.5 FlashComparisonBenchmarksMigration2026Português

Um raro upgrade “estritamente melhor”

A maioria das atualizações de modelo sacrifica alguma coisa — qualidade por velocidade, preço por capacidade. Gemini 3.6 Flash vs Gemini 3.5 Flash é o caso incomum em que o modelo mais novo vence em todos os eixos que o Google publicou em 21 de julho de 2026: pontuações de benchmark mais altas, menos tokens de saída, menos etapas de raciocínio e chamadas de ferramentas, e um preço por token mais baixo. Esta análise percorre os números e depois fica prática: quem deve migrar, quando e o que testar de novo.

Se você quiser primeiro o contexto completo do lançamento dos três modelos, comece pelo nosso panorama do anúncio.

Eficiência de tokens: a manchete que ninguém deveria pular

O número mais importante deste lançamento não é uma pontuação de benchmark. No Artificial Analysis Index, o 3.6 Flash consome 17% menos tokens de saída que o 3.5 Flash para o mesmo trabalho. No DeepSWE da Datacurve, o Google observou reduções de até 65%.

O Gemini 3.6 Flash mostra melhor eficiência de tokens e menos verbosidade que o 3.5 Flash em uma tarefa do OSWorld-Verified

Por que isso importa mais do que parece:

  • Os tokens de saída são os caros ($7.50/1M contra $1.50/1M de entrada). Cortá-los em 17–65% ataca o componente dominante do custo.
  • Menos tokens = menos latência. Um agente que fala menos termina antes, e cadeias de várias etapas amplificam o efeito.
  • Menos etapas de raciocínio e chamadas de ferramentas significam menos idas e voltas, menos pontos de falha e menos sobrecarga de orquestração por tarefa.

O Google publicou uma demonstração lado a lado disso em uma tarefa de uso de computador — veja o vídeo comparativo de eficiência de tokens.

Comparação completa de benchmarks

BenchmarkO que medeGemini 3.6 FlashGemini 3.5 FlashDiferença
DeepSWEEngenharia de software agêntica49%37%+12 pts
MLE BenchPesquisa e engenharia de ML63.9%49.7%+14.2 pts
OSWorld-VerifiedUso de computador83.0%78.4%+4.6 pts
GDPval-AA v2Trabalho de conhecimento no mundo real14211349+72

Ganhos de qualidade do Gemini 3.6 Flash sobre o 3.5 Flash em código, pesquisa de ML, uso de computador e trabalho de conhecimento

Três leituras da tabela:

  • O salto no DeepSWE (37% → 49%) é o que deve interessar às equipes de código: o Google o atribui a maior precisão — menos edições indesejadas de código e menos loops de execução, e não apenas mais capacidade bruta.
  • O MLE Bench (+14.2 pontos) é o maior ganho e sinaliza um avanço real em fluxos de trabalho de pesquisa em ML — estruturação de experimentos, análise de dados, depuração de loops de treinamento.
  • O OSWorld-Verified em 83.0% importa porque o uso de computador agora é uma ferramenta client-side integrada na Gemini API e no Gemini Enterprise. O salto de capacidade e a mudança de empacotamento chegam juntos.

Preços: mais barato por token, mais barato por tarefa

Gemini 3.6 FlashGemini 3.5 Flash
Preço de entrada$1.50 / 1M tokensMais alto
Preço de saída$7.50 / 1M tokensMais alto
Tokens de saída por tarefa~17% a menos (até 65% no DeepSWE)Linha de base
Custo efetivo por tarefa agênticaSensivelmente menorLinha de base

O ponto é a composição dos efeitos. Uma tarefa que antes emitia 100K tokens de saída agora emite ~83K, e cada um desses tokens custa menos. Para uma carga que executa milhões de tarefas agênticas por mês, a economia aparece na fatura sem mexer nos seus prompts.

Uso de computador: de complemento a recurso integrado

Com o 3.6 Flash, o uso de computador chega como ferramenta client-side integrada via Gemini API e Gemini Enterprise. Combinado com a melhoria no OSWorld-Verified (78.4% → 83.0%), equipes que constroem agentes de navegador, automações no estilo RPA ou bots de QA ganham tanto um modelo mais forte quanto menos código de integração. Se você mantinha uma estrutura própria de uso de computador em torno do 3.5 Flash, planeje apagar parte dela.

Postura de segurança

O 3.6 Flash chega com salvaguardas Frontier Safety aprimoradas nos domínios QBRN e de ciberofensiva, e o Google relata que ele é substancialmente mais resistente a jailbreaks que o 3.5 Flash. Igualmente relevante para equipes de produto: ele também foi treinado para reduzir recusas em solicitações legítimas. Se o 3.5 Flash às vezes recusava prompts legítimos ligados a segurança ou medicina no seu produto, teste esses fluxos novamente — a taxa de falsas recusas deve cair.

O que dizem os primeiros clientes

A lista de lançamento do Google — Figma, Harvey, Hebbia, JetBrains — merece ser decodificada:

  • Figma e JetBrains são empresas de ferramentas com inferência de alto volume e sensível à latência: um endosso da história de velocidade e eficiência.
  • Harvey (jurídico) e Hebbia (finanças) elogiaram especificamente o trabalho multimodal com documentos: análise de documentos, de gráficos e de dados, e redação de relatórios. Se a sua carga é trabalho de conhecimento intensivo em documentos, o ganho no GDPval-AA v2 (1349 → 1421) é o seu indicador relevante.

Playbook de migração: quando trocar

Sua situaçãoRecomendação
Código agêntico (agentes SWE, bots de code review)Migre agora — maiores ganhos de qualidade e eficiência de tokens (DeepSWE +12 pts, até 65% menos tokens)
Uso de computador / automação de navegadorMigre agora — pontuações melhores e ferramentas integradas substituem a estrutura própria
Análise de documentos / relatóriosMigre agora — validado pelos casos de uso da Harvey e da Hebbia
Tarefas simples de alto volume com latência críticaConsidere o 3.5 Flash-Lite — veja nosso guia do Flash-Lite
Prompts muito ajustados com parsing rígido do formato de saídaMigre com cautela — a eficiência de tokens muda a verbosidade; revalide parsers e exemplos few-shot
Sistemas de produção congelados por complianceAgende a migração — nenhuma descontinuação forçada foi anunciada, mas preço e eficiência tornam caro ficar parado

Checklist prático antes de trocar a string do modelo:

  1. Rode novamente sua suíte de avaliações — o estilo de saída está mais enxuto e curto; asserções sobre tamanho ou fraseado das respostas podem quebrar.
  2. Reconfira o parsing de saída estruturada — menos verbosidade costuma ser boa notícia para a confiabilidade do JSON, mas verifique.
  3. Reteste fluxos sensíveis a recusas — espere menos falsas recusas, mas confirme que seus filtros de segurança continuam alinhados.
  4. Meça de novo o custo por tarefa, não por token — a redução de 17–65% nos tokens faz comparações por token subestimarem a economia.

Veredito

O Gemini 3.6 Flash é o raro sucessor sem trade-offs publicados: melhor em código, pesquisa de ML, uso de computador e trabalho de conhecimento, emitindo menos tokens a preços menores. A menos que seu stack dependa de formatos de saída congelados, migrar do 3.5 Flash é menos uma questão de se e mais de em qual sprint.

Relacionados