Gemini Omni
Voltar para artigos
10 min de leitura

Guia do Gemini 3.5 Flash-Lite: escalando fluxos de trabalho agênticos a 350 tokens/s (2026)

O Gemini 3.5 Flash-Lite roda a 350 tokens/s por $0.30/1M de entrada. Benchmarks vs 3.1 Flash-Lite e Gemini 3 Flash, níveis de raciocínio, custos e tabela de decisão.

Gemini 3.5 Flash-LiteAgentic WorkflowsGuideBenchmarksPricing2026Português

A categoria de volume ficou séria

O Gemini 3.5 Flash-Lite, anunciado em 21 de julho de 2026, é o modelo mais rápido e econômico da classe 3.5 do Google: 350 tokens de saída por segundo (Artificial Analysis), custando $0.30 por 1M de tokens de entrada e $2.50 por 1M de tokens de saída. Historicamente, os níveis “Lite” eram onde a qualidade ia morrer — bons para classificação e boilerplate, arriscados para qualquer coisa agêntica. Este lançamento quebra esse padrão: em várias avaliações agênticas e de código, o 3.5 Flash-Lite vence o Gemini 3 Flash, que é maior, com folga.

Este guia cobre onde o Flash-Lite se encaixa na linha de modelos, como configurar seus níveis de raciocínio, quanto ele realmente custa em escala e qual modelo escolher para cada carga de trabalho. O contexto do lançamento está no nosso panorama do anúncio.

Salto geracional: vs 3.1 Flash-Lite

O salto em relação à geração Lite anterior é o maior da história da família:

BenchmarkO que medeGemini 3.5 Flash-LiteGemini 3.1 Flash-Lite
Terminal-Bench 2.1Código e tarefas agênticas de terminal54%31%
GDM-MRCR v2Recuperação em contexto longo72.2%60.1%
GDPval-AA v2Execução de tarefas do mundo real1140642

Comparação de benchmarks do Gemini 3.5 Flash-Lite com as gerações anteriores de Flash-Lite

O número do GDPval-AA v2 quase dobrando (642 → 1140) é o que você deve internalizar: execução de tarefas do mundo real era exatamente onde os modelos Lite antigos desmoronavam em agentes de produção.

A zebra: vencer o Gemini 3 Flash

Mais surpreendente que o ganho geracional é o ganho entre categorias. Em várias avaliações agênticas e de código, o 3.5 Flash-Lite supera o Gemini 3 Flash — um modelo maior e mais caro:

BenchmarkGemini 3.5 Flash-LiteGemini 3 Flash
SWE-Bench Pro54.2%49.6%
OSWorld-Verified74.0%65.1%

Se hoje você mantém cargas no 2.5 Flash ou no 3 Flash porque não dava para confiar trabalho agêntico aos níveis Lite, essa premissa ficou obsoleta — o Flash-Lite é ao mesmo tempo mais rápido e mais capaz nessas tarefas.

Níveis de raciocínio: um modelo, dois modos de operação

O Flash-Lite vem com níveis de raciocínio configuráveis, o que na prática o transforma em dois produtos:

  • Raciocínio minimal / low — prioriza latência e custo em tarefas de alto volume: busca agêntica, processamento de documentos, extração, classificação, roteamento. Este é o modo de 350 tokens/s.
  • Níveis de raciocínio mais altos — acionam raciocínio mais profundo para cargas de subagentes com várias etapas, em que o Flash-Lite atua como trabalhador sob um modelo orquestrador.

Esse segundo modo corresponde ao padrão das demonstrações do próprio Google: 3.6 Flash como agente mestre, frotas de subagentes 3.5 Flash-Lite fazendo trabalho em paralelo (uma demo gera 25 conceitos de web design simultaneamente). O uso de computador também é uma ferramenta integrada no Flash-Lite, então os subagentes podem operar interfaces sem estrutura extra. Veja a demo de velocidade Flash-Lite vs 3.5 Flash (vídeo) para a diferença de latência em tarefas de alto volume.

Análise de custos: o que a escala realmente custa

Preços: $0.30/1M de entrada, $2.50/1M de saída. Eis uma carga de exemplo — um agente de processamento de documentos que lida com 1 milhão de documentos por mês, com média de 3K tokens de entrada e 500 tokens de saída por documento:

Componente de custoCálculoCusto mensal
Tokens de entrada1M docs × 3K tokens = 3B tokens × $0.30/1M$900
Tokens de saída1M docs × 500 tokens = 0.5B tokens × $2.50/1M$1,250
Total no 3.5 Flash-Lite$2,150
Mesma carga no 3.6 Flash ($1.50 / $7.50)$4,500 + $3,750$8,250

Cerca de 4× de diferença de custo para uma carga que o Lite dá conta bem — e, a 350 tokens/s, o resumo de 500 tokens de cada documento sai em streaming em menos de 1.5 segundo. A estratégia que se segue: encaminhe os 90% do volume que são rotina para o Flash-Lite e escale os 10% difíceis para o 3.6 Flash.

Tabela de decisão: qual modelo para qual carga de trabalho

Carga de trabalhoEscolhaPor quê
Busca agêntica / RAG com QPS alto3.5 Flash-Lite (raciocínio minimal)350 tokens/s, menor custo por consulta
Processamento em massa de documentos / extração3.5 Flash-Lite4× mais barato que o 3.6 Flash; GDM-MRCR v2 72.2% em contexto longo
Classificação, roteamento, moderação3.5 Flash-Lite (raciocínio minimal)Latência crítica, com folga de qualidade de sobra
Frotas de subagentes paralelos sob um orquestrador3.5 Flash-Lite (raciocínio mais alto)Modo feito sob medida; uso de computador integrado
Código agêntico complexo (agentes SWE)3.6 FlashDeepSWE 49%; mais precisão, menos edições ruins
Fluxos de trabalho de pesquisa em ML3.6 FlashMLE Bench 63.9% contra 49.7% do 3.5 Flash
Agentes de uso de computador em tarefas difíceis3.6 FlashOSWorld-Verified 83.0% (contra 74.0% do Lite)
Análise multimodal de documentos e redação de relatórios3.6 FlashValidado pela Harvey / Hebbia no lançamento
Pipelines legados ainda no 3.5 FlashMigre para cima ou para baixo3.6 Flash para qualidade, Flash-Lite para volume — veja o guia de migração
Detecção e correção de vulnerabilidades de segurança3.5 Flash CyberApenas via piloto do CodeMender (governos e parceiros confiáveis)

Regra prática: use o Flash-Lite por padrão e escale quando ele falhar, em vez de usar o modelo grande por padrão e otimizar depois. O modo de falha é visível (saídas ruins); o desperdício do superdimensionamento é silencioso.

Onde está disponível

O 3.5 Flash-Lite está no ar hoje na Gemini API (Google AI Studio, Android Studio), na Gemini Enterprise Agent Platform e no app do Gemini — e está sendo implantado dentro do Google Search, o que diz muito sobre a confiança do Google no perfil de custo dele em escala planetária. Entre os primeiros clientes estão Ashler, Palo Alto Networks e Ramp.

À parte: 3.5 Flash Cyber e CodeMender

O mesmo lançamento apresentou o Gemini 3.5 Flash Cyber — o 3.5 Flash ajustado para encontrar e corrigir vulnerabilidades de segurança. Dentro do CodeMender, vários agentes Flash Cyber trabalham em paralelo e mesclam suas descobertas em um único relatório combinado, alcançando desempenho competitivo com modelos de fronteira no CyberGym. Repare na arquitetura: é o mesmo padrão de “frota de especialistas eficientes” que este guia descreve, aplicado à segurança.

O acesso é deliberadamente restrito: um piloto de acesso limitado exclusivo para governos e parceiros confiáveis via CodeMender, refletindo o risco de uso dual da descoberta automatizada de vulnerabilidades. Detalhes no nosso panorama do anúncio.

Conclusão

O 3.5 Flash-Lite redesenha a fronteira de custo-desempenho para cargas agênticas: mais rápido que qualquer coisa na série 3.5, cerca de 4× mais barato que o 3.6 Flash e — pela primeira vez em um modelo Lite — genuinamente confiável em benchmarks agênticos. Monte seu roteamento com o Flash-Lite como padrão e o 3.6 Flash como caminho de escalonamento, e sua curva de custos vai agradecer.

Relacionados