Gabay sa Gemini 3.5 Flash-Lite: Pagpapalawak ng Agentic Workflows sa 350 Tokens/s (2026)
Tumatakbo ang Gemini 3.5 Flash-Lite sa 350 tokens/s sa $0.30/1M input. Benchmarks vs 3.1 Flash-Lite at Gemini 3 Flash, thinking levels, cost math at decision table.
Sineryoso na ang volume tier
Ang Gemini 3.5 Flash-Lite, inanunsyo noong Hulyo 21, 2026, ang pinakamabilis at pinaka-cost-effective na 3.5-class na model ng Google: 350 output token bawat segundo (Artificial Analysis), sa presyong $0.30 bawat 1M input token at $2.50 bawat 1M output token. Noon, ang mga “Lite” tier ang pinaglilibingan ng kalidad — mahusay para sa classification at boilerplate, delikado para sa anumang agentic. Sinisira ng release na ito ang pattern na iyon: sa ilang agentic at coding eval, tahasang tinatalo ng 3.5 Flash-Lite ang mas malaking Gemini 3 Flash.
Saklaw ng gabay na ito kung saan nakaupo ang Flash-Lite sa lineup, paano i-configure ang thinking levels nito, magkano talaga ito sa scale, at aling model ang pipiliin para sa aling workload. Ang konteksto ng launch ay nasa aming overview ng anunsyo.
Henerasyonal na pagtalon: vs 3.1 Flash-Lite
Ang pagtalon mula sa nakaraang Lite na henerasyon ang pinakamalaki sa kasaysayan ng pamilya:
| Benchmark | Ano ang sinusukat | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | Coding at agentic na terminal na gawain | 54% | 31% |
| GDM-MRCR v2 | Long-context retrieval | 72.2% | 60.1% |
| GDPval-AA v2 | Real-world na pagsasagawa ng gawain | 1140 | 642 |

Ang halos pagdoble ng GDPval-AA v2 (642 → 1140) ang dapat tandaan: ang real-world na pagsasagawa ng gawain mismo ang lugar kung saan bumabagsak ang mga lumang Lite model sa mga production agent.
Ang sorpresa: pagtalo sa Gemini 3 Flash
Mas nakakagulat kaysa sa henerasyonal na pagsulong ang cross-tier na panalo. Sa ilang agentic at coding eval, nilalampasan ng 3.5 Flash-Lite ang Gemini 3 Flash — isang mas malaki at mas mahal na model:
| Benchmark | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | 54.2% | 49.6% |
| OSWorld-Verified | 74.0% | 65.1% |
Kung nagpapatakbo ka ngayon ng mga workload sa 2.5 Flash o 3 Flash dahil hindi mapagkakatiwalaan ang mga Lite tier sa agentic na trabaho, luma na ang palagay na iyon — ang Flash-Lite ay parehong mas mabilis at mas may kakayahan sa mga gawaing ito.
Thinking levels: isang model, dalawang operating mode
May kasamang configurable thinking levels ang Flash-Lite, na epektibong ginagawa itong dalawang produkto:
- Minimal / low thinking — unahin ang latency at gastos para sa high-volume na gawain: agentic search, document processing, extraction, classification, routing. Ito ang 350 tokens/s na mode.
- Mas matataas na thinking level — buksan ang mas malalim na reasoning para sa multi-step na subagent workload, kung saan gumaganap ang Flash-Lite bilang worker sa ilalim ng isang orchestrator na model.
Tumutugma ang pangalawang mode sa sariling demo pattern ng Google: 3.6 Flash bilang master agent, mga fleet ng 3.5 Flash-Lite subagent na sabay-sabay gumagawa (isang demo ang sabay na bumubuo ng 25 web-design concept). Built-in tool din ang computer use sa Flash-Lite, kaya nakakapag-operate ng UI ang mga subagent nang walang dagdag na scaffolding. Panoorin ang demo ng bilis: Flash-Lite vs 3.5 Flash (video) para sa pagkakaiba ng latency sa mga high-volume na gawain.
Cost analysis: magkano talaga ang scale
Mga presyo: $0.30/1M input, $2.50/1M output. Narito ang halimbawang workload — isang document-processing agent na humahawak ng 1 milyong dokumento kada buwan, na may average na 3K input token at 500 output token bawat dokumento:
| Bahagi ng gastos | Kalkulasyon | Buwanang gastos |
|---|---|---|
| Input tokens | 1M docs × 3K tokens = 3B tokens × $0.30/1M | $900 |
| Output tokens | 1M docs × 500 tokens = 0.5B tokens × $2.50/1M | $1,250 |
| Kabuuan sa 3.5 Flash-Lite | $2,150 | |
| Parehong workload sa 3.6 Flash ($1.50 / $7.50) | $4,500 + $3,750 | $8,250 |
Humigit-kumulang 4× na pagkakaiba sa gastos para sa workload na mahusay hawakan ng Lite — at sa 350 tokens/s, ang 500-token na buod ng bawat dokumento ay lumalabas sa loob ng wala pang 1.5 segundo. Ang estratehiyang sumusunod: i-route ang 90% ng volume na routine sa Flash-Lite, at i-escalate ang mahirap na 10% sa 3.6 Flash.
Decision table: aling model para sa aling workload
| Workload | Piliin | Bakit |
|---|---|---|
| Agentic search / RAG sa mataas na QPS | 3.5 Flash-Lite (minimal thinking) | 350 tokens/s, pinakamababang gastos bawat query |
| Bulk document processing / extraction | 3.5 Flash-Lite | 4× mas mura kaysa 3.6 Flash; GDM-MRCR v2 72.2% long-context |
| Classification, routing, moderation | 3.5 Flash-Lite (minimal thinking) | Latency-critical, may sobrang headroom sa kalidad |
| Mga parallel na subagent fleet sa ilalim ng orchestrator | 3.5 Flash-Lite (mas mataas na thinking) | Mode na sadyang ginawa para dito; built-in ang computer use |
| Kumplikadong agentic coding (SWE agents) | 3.6 Flash | DeepSWE 49%; mas mataas na precision, mas kaunting maling edit |
| Mga ML research workflow | 3.6 Flash | MLE Bench 63.9% vs 49.7% ng 3.5 Flash |
| Computer-use agents sa mahihirap na gawain | 3.6 Flash | OSWorld-Verified 83.0% (vs 74.0% ng Lite) |
| Multimodal na pagsusuri ng dokumento at pagbalangkas ng report | 3.6 Flash | Pinatunayan ng Harvey / Hebbia sa launch |
| Mga legacy pipeline na nasa 3.5 Flash pa rin | Mag-migrate pataas o pababa | 3.6 Flash para sa kalidad, Flash-Lite para sa volume — tingnan ang migration guide |
| Pagtuklas at pag-patch ng security vulnerability | 3.5 Flash Cyber | Sa pamamagitan lamang ng CodeMender pilot (mga gobyerno at pinagkakatiwalaang partner) |
Panuntunan: gawing default ang Flash-Lite at mag-escalate kapag pumalya, sa halip na mag-default sa malaking model at mag-optimize mamaya. Kitang-kita ang failure mode (masamang output); tahimik ang pag-aaksaya ng over-provisioning.
Saan ito available
Live na ang 3.5 Flash-Lite ngayon sa Gemini API (Google AI Studio, Android Studio), sa Gemini Enterprise Agent Platform, at sa Gemini app — at unti-unti itong inilalabas sa loob ng Google Search, na maraming sinasabi tungkol sa tiwala ng Google sa cost profile nito sa planetary scale. Kabilang sa mga maagang customer ang Ashler, Palo Alto Networks, at Ramp.
Sidebar: 3.5 Flash Cyber at CodeMender
Ipinakilala rin ng parehong launch ang Gemini 3.5 Flash Cyber — 3.5 Flash na fine-tuned para sa paghahanap at pag-aayos ng mga security vulnerability. Sa loob ng CodeMender, maraming Flash Cyber agent ang sabay-sabay na gumagawa at pinagsasama ang kanilang mga natuklasan sa iisang pinagsamang report, na umaabot sa competitive frontier performance sa CyberGym. Pansinin ang arkitektura: parehong “fleet ng mga episyenteng specialist” na pattern na inilalarawan ng gabay na ito, inilapat sa security.
Sadyang makitid ang access: isang limited-access pilot na eksklusibo para sa mga gobyerno at pinagkakatiwalaang partner sa pamamagitan ng CodeMender, na sumasalamin sa dual-use na panganib ng automated na pagtuklas ng vulnerability. Mga detalye sa aming overview ng anunsyo.
Ang buod
Muling iginuhit ng 3.5 Flash-Lite ang price-performance frontier para sa mga agentic workload: mas mabilis kaysa sa kahit ano sa 3.5 series, humigit-kumulang 4× na mas mura kaysa 3.6 Flash, at — sa unang pagkakataon sa isang Lite model — tunay na mapagkakatiwalaan sa mga agentic benchmark. Buuin ang routing mo nang Flash-Lite ang default at 3.6 Flash ang escalation path, at magpapasalamat sa iyo ang cost curve mo.