Gemini Omni
Bumalik sa lahat ng artikulo
10 min basa

Gabay sa Gemini 3.5 Flash-Lite: Pagpapalawak ng Agentic Workflows sa 350 Tokens/s (2026)

Tumatakbo ang Gemini 3.5 Flash-Lite sa 350 tokens/s sa $0.30/1M input. Benchmarks vs 3.1 Flash-Lite at Gemini 3 Flash, thinking levels, cost math at decision table.

Gemini 3.5 Flash-LiteAgentic WorkflowsGuideBenchmarksPricing2026Filipino

Sineryoso na ang volume tier

Ang Gemini 3.5 Flash-Lite, inanunsyo noong Hulyo 21, 2026, ang pinakamabilis at pinaka-cost-effective na 3.5-class na model ng Google: 350 output token bawat segundo (Artificial Analysis), sa presyong $0.30 bawat 1M input token at $2.50 bawat 1M output token. Noon, ang mga “Lite” tier ang pinaglilibingan ng kalidad — mahusay para sa classification at boilerplate, delikado para sa anumang agentic. Sinisira ng release na ito ang pattern na iyon: sa ilang agentic at coding eval, tahasang tinatalo ng 3.5 Flash-Lite ang mas malaking Gemini 3 Flash.

Saklaw ng gabay na ito kung saan nakaupo ang Flash-Lite sa lineup, paano i-configure ang thinking levels nito, magkano talaga ito sa scale, at aling model ang pipiliin para sa aling workload. Ang konteksto ng launch ay nasa aming overview ng anunsyo.

Henerasyonal na pagtalon: vs 3.1 Flash-Lite

Ang pagtalon mula sa nakaraang Lite na henerasyon ang pinakamalaki sa kasaysayan ng pamilya:

BenchmarkAno ang sinusukatGemini 3.5 Flash-LiteGemini 3.1 Flash-Lite
Terminal-Bench 2.1Coding at agentic na terminal na gawain54%31%
GDM-MRCR v2Long-context retrieval72.2%60.1%
GDPval-AA v2Real-world na pagsasagawa ng gawain1140642

Paghahambing ng benchmark ng Gemini 3.5 Flash-Lite laban sa mga nakaraang henerasyon ng Flash-Lite

Ang halos pagdoble ng GDPval-AA v2 (642 → 1140) ang dapat tandaan: ang real-world na pagsasagawa ng gawain mismo ang lugar kung saan bumabagsak ang mga lumang Lite model sa mga production agent.

Ang sorpresa: pagtalo sa Gemini 3 Flash

Mas nakakagulat kaysa sa henerasyonal na pagsulong ang cross-tier na panalo. Sa ilang agentic at coding eval, nilalampasan ng 3.5 Flash-Lite ang Gemini 3 Flash — isang mas malaki at mas mahal na model:

BenchmarkGemini 3.5 Flash-LiteGemini 3 Flash
SWE-Bench Pro54.2%49.6%
OSWorld-Verified74.0%65.1%

Kung nagpapatakbo ka ngayon ng mga workload sa 2.5 Flash o 3 Flash dahil hindi mapagkakatiwalaan ang mga Lite tier sa agentic na trabaho, luma na ang palagay na iyon — ang Flash-Lite ay parehong mas mabilis at mas may kakayahan sa mga gawaing ito.

Thinking levels: isang model, dalawang operating mode

May kasamang configurable thinking levels ang Flash-Lite, na epektibong ginagawa itong dalawang produkto:

  • Minimal / low thinking — unahin ang latency at gastos para sa high-volume na gawain: agentic search, document processing, extraction, classification, routing. Ito ang 350 tokens/s na mode.
  • Mas matataas na thinking level — buksan ang mas malalim na reasoning para sa multi-step na subagent workload, kung saan gumaganap ang Flash-Lite bilang worker sa ilalim ng isang orchestrator na model.

Tumutugma ang pangalawang mode sa sariling demo pattern ng Google: 3.6 Flash bilang master agent, mga fleet ng 3.5 Flash-Lite subagent na sabay-sabay gumagawa (isang demo ang sabay na bumubuo ng 25 web-design concept). Built-in tool din ang computer use sa Flash-Lite, kaya nakakapag-operate ng UI ang mga subagent nang walang dagdag na scaffolding. Panoorin ang demo ng bilis: Flash-Lite vs 3.5 Flash (video) para sa pagkakaiba ng latency sa mga high-volume na gawain.

Cost analysis: magkano talaga ang scale

Mga presyo: $0.30/1M input, $2.50/1M output. Narito ang halimbawang workload — isang document-processing agent na humahawak ng 1 milyong dokumento kada buwan, na may average na 3K input token at 500 output token bawat dokumento:

Bahagi ng gastosKalkulasyonBuwanang gastos
Input tokens1M docs × 3K tokens = 3B tokens × $0.30/1M$900
Output tokens1M docs × 500 tokens = 0.5B tokens × $2.50/1M$1,250
Kabuuan sa 3.5 Flash-Lite$2,150
Parehong workload sa 3.6 Flash ($1.50 / $7.50)$4,500 + $3,750$8,250

Humigit-kumulang 4× na pagkakaiba sa gastos para sa workload na mahusay hawakan ng Lite — at sa 350 tokens/s, ang 500-token na buod ng bawat dokumento ay lumalabas sa loob ng wala pang 1.5 segundo. Ang estratehiyang sumusunod: i-route ang 90% ng volume na routine sa Flash-Lite, at i-escalate ang mahirap na 10% sa 3.6 Flash.

Decision table: aling model para sa aling workload

WorkloadPiliinBakit
Agentic search / RAG sa mataas na QPS3.5 Flash-Lite (minimal thinking)350 tokens/s, pinakamababang gastos bawat query
Bulk document processing / extraction3.5 Flash-Lite4× mas mura kaysa 3.6 Flash; GDM-MRCR v2 72.2% long-context
Classification, routing, moderation3.5 Flash-Lite (minimal thinking)Latency-critical, may sobrang headroom sa kalidad
Mga parallel na subagent fleet sa ilalim ng orchestrator3.5 Flash-Lite (mas mataas na thinking)Mode na sadyang ginawa para dito; built-in ang computer use
Kumplikadong agentic coding (SWE agents)3.6 FlashDeepSWE 49%; mas mataas na precision, mas kaunting maling edit
Mga ML research workflow3.6 FlashMLE Bench 63.9% vs 49.7% ng 3.5 Flash
Computer-use agents sa mahihirap na gawain3.6 FlashOSWorld-Verified 83.0% (vs 74.0% ng Lite)
Multimodal na pagsusuri ng dokumento at pagbalangkas ng report3.6 FlashPinatunayan ng Harvey / Hebbia sa launch
Mga legacy pipeline na nasa 3.5 Flash pa rinMag-migrate pataas o pababa3.6 Flash para sa kalidad, Flash-Lite para sa volume — tingnan ang migration guide
Pagtuklas at pag-patch ng security vulnerability3.5 Flash CyberSa pamamagitan lamang ng CodeMender pilot (mga gobyerno at pinagkakatiwalaang partner)

Panuntunan: gawing default ang Flash-Lite at mag-escalate kapag pumalya, sa halip na mag-default sa malaking model at mag-optimize mamaya. Kitang-kita ang failure mode (masamang output); tahimik ang pag-aaksaya ng over-provisioning.

Saan ito available

Live na ang 3.5 Flash-Lite ngayon sa Gemini API (Google AI Studio, Android Studio), sa Gemini Enterprise Agent Platform, at sa Gemini app — at unti-unti itong inilalabas sa loob ng Google Search, na maraming sinasabi tungkol sa tiwala ng Google sa cost profile nito sa planetary scale. Kabilang sa mga maagang customer ang Ashler, Palo Alto Networks, at Ramp.

Ipinakilala rin ng parehong launch ang Gemini 3.5 Flash Cyber — 3.5 Flash na fine-tuned para sa paghahanap at pag-aayos ng mga security vulnerability. Sa loob ng CodeMender, maraming Flash Cyber agent ang sabay-sabay na gumagawa at pinagsasama ang kanilang mga natuklasan sa iisang pinagsamang report, na umaabot sa competitive frontier performance sa CyberGym. Pansinin ang arkitektura: parehong “fleet ng mga episyenteng specialist” na pattern na inilalarawan ng gabay na ito, inilapat sa security.

Sadyang makitid ang access: isang limited-access pilot na eksklusibo para sa mga gobyerno at pinagkakatiwalaang partner sa pamamagitan ng CodeMender, na sumasalamin sa dual-use na panganib ng automated na pagtuklas ng vulnerability. Mga detalye sa aming overview ng anunsyo.

Ang buod

Muling iginuhit ng 3.5 Flash-Lite ang price-performance frontier para sa mga agentic workload: mas mabilis kaysa sa kahit ano sa 3.5 series, humigit-kumulang 4× na mas mura kaysa 3.6 Flash, at — sa unang pagkakataon sa isang Lite model — tunay na mapagkakatiwalaan sa mga agentic benchmark. Buuin ang routing mo nang Flash-Lite ang default at 3.6 Flash ang escalation path, at magpapasalamat sa iyo ang cost curve mo.

Kaugnay