Gemini 3.6 Flash vs 3.5 Flash: benchmarks, preços e quando migrar (2026)
O Gemini 3.6 Flash vence o 3.5 Flash em todos os benchmarks, corta 17% dos tokens de saída e ainda custa menos. Tabelas comparativas completas e playbook de migração.
Um raro upgrade “estritamente melhor”
A maioria das atualizações de modelo sacrifica alguma coisa — qualidade por velocidade, preço por capacidade. Gemini 3.6 Flash vs Gemini 3.5 Flash é o caso incomum em que o modelo mais novo vence em todos os eixos que o Google publicou em 21 de julho de 2026: pontuações de benchmark mais altas, menos tokens de saída, menos etapas de raciocínio e chamadas de ferramentas, e um preço por token mais baixo. Esta análise percorre os números e depois fica prática: quem deve migrar, quando e o que testar de novo.
Se você quiser primeiro o contexto completo do lançamento dos três modelos, comece pelo nosso panorama do anúncio.
Eficiência de tokens: a manchete que ninguém deveria pular
O número mais importante deste lançamento não é uma pontuação de benchmark. No Artificial Analysis Index, o 3.6 Flash consome 17% menos tokens de saída que o 3.5 Flash para o mesmo trabalho. No DeepSWE da Datacurve, o Google observou reduções de até 65%.

Por que isso importa mais do que parece:
- Os tokens de saída são os caros ($7.50/1M contra $1.50/1M de entrada). Cortá-los em 17–65% ataca o componente dominante do custo.
- Menos tokens = menos latência. Um agente que fala menos termina antes, e cadeias de várias etapas amplificam o efeito.
- Menos etapas de raciocínio e chamadas de ferramentas significam menos idas e voltas, menos pontos de falha e menos sobrecarga de orquestração por tarefa.
O Google publicou uma demonstração lado a lado disso em uma tarefa de uso de computador — veja o vídeo comparativo de eficiência de tokens.
Comparação completa de benchmarks
| Benchmark | O que mede | Gemini 3.6 Flash | Gemini 3.5 Flash | Diferença |
|---|---|---|---|---|
| DeepSWE | Engenharia de software agêntica | 49% | 37% | +12 pts |
| MLE Bench | Pesquisa e engenharia de ML | 63.9% | 49.7% | +14.2 pts |
| OSWorld-Verified | Uso de computador | 83.0% | 78.4% | +4.6 pts |
| GDPval-AA v2 | Trabalho de conhecimento no mundo real | 1421 | 1349 | +72 |

Três leituras da tabela:
- O salto no DeepSWE (37% → 49%) é o que deve interessar às equipes de código: o Google o atribui a maior precisão — menos edições indesejadas de código e menos loops de execução, e não apenas mais capacidade bruta.
- O MLE Bench (+14.2 pontos) é o maior ganho e sinaliza um avanço real em fluxos de trabalho de pesquisa em ML — estruturação de experimentos, análise de dados, depuração de loops de treinamento.
- O OSWorld-Verified em 83.0% importa porque o uso de computador agora é uma ferramenta client-side integrada na Gemini API e no Gemini Enterprise. O salto de capacidade e a mudança de empacotamento chegam juntos.
Preços: mais barato por token, mais barato por tarefa
| Gemini 3.6 Flash | Gemini 3.5 Flash | |
|---|---|---|
| Preço de entrada | $1.50 / 1M tokens | Mais alto |
| Preço de saída | $7.50 / 1M tokens | Mais alto |
| Tokens de saída por tarefa | ~17% a menos (até 65% no DeepSWE) | Linha de base |
| Custo efetivo por tarefa agêntica | Sensivelmente menor | Linha de base |
O ponto é a composição dos efeitos. Uma tarefa que antes emitia 100K tokens de saída agora emite ~83K, e cada um desses tokens custa menos. Para uma carga que executa milhões de tarefas agênticas por mês, a economia aparece na fatura sem mexer nos seus prompts.
Uso de computador: de complemento a recurso integrado
Com o 3.6 Flash, o uso de computador chega como ferramenta client-side integrada via Gemini API e Gemini Enterprise. Combinado com a melhoria no OSWorld-Verified (78.4% → 83.0%), equipes que constroem agentes de navegador, automações no estilo RPA ou bots de QA ganham tanto um modelo mais forte quanto menos código de integração. Se você mantinha uma estrutura própria de uso de computador em torno do 3.5 Flash, planeje apagar parte dela.
Postura de segurança
O 3.6 Flash chega com salvaguardas Frontier Safety aprimoradas nos domínios QBRN e de ciberofensiva, e o Google relata que ele é substancialmente mais resistente a jailbreaks que o 3.5 Flash. Igualmente relevante para equipes de produto: ele também foi treinado para reduzir recusas em solicitações legítimas. Se o 3.5 Flash às vezes recusava prompts legítimos ligados a segurança ou medicina no seu produto, teste esses fluxos novamente — a taxa de falsas recusas deve cair.
O que dizem os primeiros clientes
A lista de lançamento do Google — Figma, Harvey, Hebbia, JetBrains — merece ser decodificada:
- Figma e JetBrains são empresas de ferramentas com inferência de alto volume e sensível à latência: um endosso da história de velocidade e eficiência.
- Harvey (jurídico) e Hebbia (finanças) elogiaram especificamente o trabalho multimodal com documentos: análise de documentos, de gráficos e de dados, e redação de relatórios. Se a sua carga é trabalho de conhecimento intensivo em documentos, o ganho no GDPval-AA v2 (1349 → 1421) é o seu indicador relevante.
Playbook de migração: quando trocar
| Sua situação | Recomendação |
|---|---|
| Código agêntico (agentes SWE, bots de code review) | Migre agora — maiores ganhos de qualidade e eficiência de tokens (DeepSWE +12 pts, até 65% menos tokens) |
| Uso de computador / automação de navegador | Migre agora — pontuações melhores e ferramentas integradas substituem a estrutura própria |
| Análise de documentos / relatórios | Migre agora — validado pelos casos de uso da Harvey e da Hebbia |
| Tarefas simples de alto volume com latência crítica | Considere o 3.5 Flash-Lite — veja nosso guia do Flash-Lite |
| Prompts muito ajustados com parsing rígido do formato de saída | Migre com cautela — a eficiência de tokens muda a verbosidade; revalide parsers e exemplos few-shot |
| Sistemas de produção congelados por compliance | Agende a migração — nenhuma descontinuação forçada foi anunciada, mas preço e eficiência tornam caro ficar parado |
Checklist prático antes de trocar a string do modelo:
- Rode novamente sua suíte de avaliações — o estilo de saída está mais enxuto e curto; asserções sobre tamanho ou fraseado das respostas podem quebrar.
- Reconfira o parsing de saída estruturada — menos verbosidade costuma ser boa notícia para a confiabilidade do JSON, mas verifique.
- Reteste fluxos sensíveis a recusas — espere menos falsas recusas, mas confirme que seus filtros de segurança continuam alinhados.
- Meça de novo o custo por tarefa, não por token — a redução de 17–65% nos tokens faz comparações por token subestimarem a economia.
Veredito
O Gemini 3.6 Flash é o raro sucessor sem trade-offs publicados: melhor em código, pesquisa de ML, uso de computador e trabalho de conhecimento, emitindo menos tokens a preços menores. A menos que seu stack dependa de formatos de saída congelados, migrar do 3.5 Flash é menos uma questão de se e mais de em qual sprint.