Guia do Gemini 3.5 Flash-Lite: escalando fluxos de trabalho agênticos a 350 tokens/s (2026)
O Gemini 3.5 Flash-Lite roda a 350 tokens/s por $0.30/1M de entrada. Benchmarks vs 3.1 Flash-Lite e Gemini 3 Flash, níveis de raciocínio, custos e tabela de decisão.
A categoria de volume ficou séria
O Gemini 3.5 Flash-Lite, anunciado em 21 de julho de 2026, é o modelo mais rápido e econômico da classe 3.5 do Google: 350 tokens de saída por segundo (Artificial Analysis), custando $0.30 por 1M de tokens de entrada e $2.50 por 1M de tokens de saída. Historicamente, os níveis “Lite” eram onde a qualidade ia morrer — bons para classificação e boilerplate, arriscados para qualquer coisa agêntica. Este lançamento quebra esse padrão: em várias avaliações agênticas e de código, o 3.5 Flash-Lite vence o Gemini 3 Flash, que é maior, com folga.
Este guia cobre onde o Flash-Lite se encaixa na linha de modelos, como configurar seus níveis de raciocínio, quanto ele realmente custa em escala e qual modelo escolher para cada carga de trabalho. O contexto do lançamento está no nosso panorama do anúncio.
Salto geracional: vs 3.1 Flash-Lite
O salto em relação à geração Lite anterior é o maior da história da família:
| Benchmark | O que mede | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | Código e tarefas agênticas de terminal | 54% | 31% |
| GDM-MRCR v2 | Recuperação em contexto longo | 72.2% | 60.1% |
| GDPval-AA v2 | Execução de tarefas do mundo real | 1140 | 642 |

O número do GDPval-AA v2 quase dobrando (642 → 1140) é o que você deve internalizar: execução de tarefas do mundo real era exatamente onde os modelos Lite antigos desmoronavam em agentes de produção.
A zebra: vencer o Gemini 3 Flash
Mais surpreendente que o ganho geracional é o ganho entre categorias. Em várias avaliações agênticas e de código, o 3.5 Flash-Lite supera o Gemini 3 Flash — um modelo maior e mais caro:
| Benchmark | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | 54.2% | 49.6% |
| OSWorld-Verified | 74.0% | 65.1% |
Se hoje você mantém cargas no 2.5 Flash ou no 3 Flash porque não dava para confiar trabalho agêntico aos níveis Lite, essa premissa ficou obsoleta — o Flash-Lite é ao mesmo tempo mais rápido e mais capaz nessas tarefas.
Níveis de raciocínio: um modelo, dois modos de operação
O Flash-Lite vem com níveis de raciocínio configuráveis, o que na prática o transforma em dois produtos:
- Raciocínio minimal / low — prioriza latência e custo em tarefas de alto volume: busca agêntica, processamento de documentos, extração, classificação, roteamento. Este é o modo de 350 tokens/s.
- Níveis de raciocínio mais altos — acionam raciocínio mais profundo para cargas de subagentes com várias etapas, em que o Flash-Lite atua como trabalhador sob um modelo orquestrador.
Esse segundo modo corresponde ao padrão das demonstrações do próprio Google: 3.6 Flash como agente mestre, frotas de subagentes 3.5 Flash-Lite fazendo trabalho em paralelo (uma demo gera 25 conceitos de web design simultaneamente). O uso de computador também é uma ferramenta integrada no Flash-Lite, então os subagentes podem operar interfaces sem estrutura extra. Veja a demo de velocidade Flash-Lite vs 3.5 Flash (vídeo) para a diferença de latência em tarefas de alto volume.
Análise de custos: o que a escala realmente custa
Preços: $0.30/1M de entrada, $2.50/1M de saída. Eis uma carga de exemplo — um agente de processamento de documentos que lida com 1 milhão de documentos por mês, com média de 3K tokens de entrada e 500 tokens de saída por documento:
| Componente de custo | Cálculo | Custo mensal |
|---|---|---|
| Tokens de entrada | 1M docs × 3K tokens = 3B tokens × $0.30/1M | $900 |
| Tokens de saída | 1M docs × 500 tokens = 0.5B tokens × $2.50/1M | $1,250 |
| Total no 3.5 Flash-Lite | $2,150 | |
| Mesma carga no 3.6 Flash ($1.50 / $7.50) | $4,500 + $3,750 | $8,250 |
Cerca de 4× de diferença de custo para uma carga que o Lite dá conta bem — e, a 350 tokens/s, o resumo de 500 tokens de cada documento sai em streaming em menos de 1.5 segundo. A estratégia que se segue: encaminhe os 90% do volume que são rotina para o Flash-Lite e escale os 10% difíceis para o 3.6 Flash.
Tabela de decisão: qual modelo para qual carga de trabalho
| Carga de trabalho | Escolha | Por quê |
|---|---|---|
| Busca agêntica / RAG com QPS alto | 3.5 Flash-Lite (raciocínio minimal) | 350 tokens/s, menor custo por consulta |
| Processamento em massa de documentos / extração | 3.5 Flash-Lite | 4× mais barato que o 3.6 Flash; GDM-MRCR v2 72.2% em contexto longo |
| Classificação, roteamento, moderação | 3.5 Flash-Lite (raciocínio minimal) | Latência crítica, com folga de qualidade de sobra |
| Frotas de subagentes paralelos sob um orquestrador | 3.5 Flash-Lite (raciocínio mais alto) | Modo feito sob medida; uso de computador integrado |
| Código agêntico complexo (agentes SWE) | 3.6 Flash | DeepSWE 49%; mais precisão, menos edições ruins |
| Fluxos de trabalho de pesquisa em ML | 3.6 Flash | MLE Bench 63.9% contra 49.7% do 3.5 Flash |
| Agentes de uso de computador em tarefas difíceis | 3.6 Flash | OSWorld-Verified 83.0% (contra 74.0% do Lite) |
| Análise multimodal de documentos e redação de relatórios | 3.6 Flash | Validado pela Harvey / Hebbia no lançamento |
| Pipelines legados ainda no 3.5 Flash | Migre para cima ou para baixo | 3.6 Flash para qualidade, Flash-Lite para volume — veja o guia de migração |
| Detecção e correção de vulnerabilidades de segurança | 3.5 Flash Cyber | Apenas via piloto do CodeMender (governos e parceiros confiáveis) |
Regra prática: use o Flash-Lite por padrão e escale quando ele falhar, em vez de usar o modelo grande por padrão e otimizar depois. O modo de falha é visível (saídas ruins); o desperdício do superdimensionamento é silencioso.
Onde está disponível
O 3.5 Flash-Lite está no ar hoje na Gemini API (Google AI Studio, Android Studio), na Gemini Enterprise Agent Platform e no app do Gemini — e está sendo implantado dentro do Google Search, o que diz muito sobre a confiança do Google no perfil de custo dele em escala planetária. Entre os primeiros clientes estão Ashler, Palo Alto Networks e Ramp.
À parte: 3.5 Flash Cyber e CodeMender
O mesmo lançamento apresentou o Gemini 3.5 Flash Cyber — o 3.5 Flash ajustado para encontrar e corrigir vulnerabilidades de segurança. Dentro do CodeMender, vários agentes Flash Cyber trabalham em paralelo e mesclam suas descobertas em um único relatório combinado, alcançando desempenho competitivo com modelos de fronteira no CyberGym. Repare na arquitetura: é o mesmo padrão de “frota de especialistas eficientes” que este guia descreve, aplicado à segurança.
O acesso é deliberadamente restrito: um piloto de acesso limitado exclusivo para governos e parceiros confiáveis via CodeMender, refletindo o risco de uso dual da descoberta automatizada de vulnerabilidades. Detalhes no nosso panorama do anúncio.
Conclusão
O 3.5 Flash-Lite redesenha a fronteira de custo-desempenho para cargas agênticas: mais rápido que qualquer coisa na série 3.5, cerca de 4× mais barato que o 3.6 Flash e — pela primeira vez em um modelo Lite — genuinamente confiável em benchmarks agênticos. Monte seu roteamento com o Flash-Lite como padrão e o 3.6 Flash como caminho de escalonamento, e sua curva de custos vai agradecer.