คู่มือ Gemini 3.5 Flash-Lite: สเกลเวิร์กโฟลว์แบบ Agent ที่ 350 โทเคน/วินาที (2026)
Gemini 3.5 Flash-Lite วิ่ง 350 โทเคน/วินาที ที่อินพุต $0.30/1M เบนช์มาร์กเทียบ 3.1 Flash-Lite และ Gemini 3 Flash ระดับการคิด การคำนวณต้นทุน และตารางเลือกโมเดล
ระดับงานปริมาณมากเอาจริงแล้ว
Gemini 3.5 Flash-Lite ประกาศเมื่อ 21 กรกฎาคม 2026 คือโมเดลคลาส 3.5 ที่เร็วที่สุดและคุ้มค่าที่สุดของ Google: 350 โทเคนเอาต์พุตต่อวินาที (Artificial Analysis) ราคา $0.30 ต่อ 1M โทเคนอินพุต และ $2.50 ต่อ 1M โทเคนเอาต์พุต ในอดีต ระดับ “Lite” คือที่ที่คุณภาพไปตาย — ดีสำหรับการจัดหมวดหมู่และงานสำเร็จรูป แต่เสี่ยงกับทุกอย่างที่เป็น agent การปล่อยรุ่นนี้ทำลายรูปแบบเดิม: ในการประเมิน agent และการเขียนโค้ดหลายรายการ 3.5 Flash-Lite เอาชนะ Gemini 3 Flash ที่ตัวใหญ่กว่าแบบตรง ๆ
คู่มือนี้ครอบคลุมตำแหน่งของ Flash-Lite ในไลน์อัป วิธีตั้งค่าระดับการคิด ต้นทุนจริงเมื่อสเกล และควรเลือกโมเดลไหนสำหรับงานแบบไหน บริบทการเปิดตัวอยู่ในบทสรุปประกาศของเรา
ก้าวกระโดดข้ามรุ่น: เทียบกับ 3.1 Flash-Lite
การกระโดดจากรุ่น Lite ก่อนหน้าคือครั้งใหญ่ที่สุดในประวัติศาสตร์ของตระกูลนี้:
| เบนช์มาร์ก | วัดอะไร | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | งานเทอร์มินัลเขียนโค้ดและ agent | 54% | 31% |
| GDM-MRCR v2 | การค้นคืนบริบทยาว | 72.2% | 60.1% |
| GDPval-AA v2 | การทำงานจริงในโลกจริง | 1140 | 642 |

ตัวเลข GDPval-AA v2 ที่เกือบเพิ่มเป็นสองเท่า (642 → 1140) คือสิ่งที่ต้องจดจำ: การทำงานจริงในโลกจริงคือจุดที่โมเดล Lite รุ่นเก่าพังทลายใน agent ระดับ production
เซอร์ไพรส์: เอาชนะ Gemini 3 Flash
ที่น่าประหลาดใจกว่ากำไรข้ามรุ่นคือการชนะข้ามระดับ ในการประเมิน agent และการเขียนโค้ดหลายรายการ 3.5 Flash-Lite ทำได้ดีกว่า Gemini 3 Flash — โมเดลที่ใหญ่กว่าและแพงกว่า:
| เบนช์มาร์ก | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | 54.2% | 49.6% |
| OSWorld-Verified | 74.0% | 65.1% |
ถ้าวันนี้คุณรันเวิร์กโหลดบน 2.5 Flash หรือ 3 Flash เพราะไว้ใจระดับ Lite กับงาน agent ไม่ได้ สมมติฐานนั้นล้าสมัยแล้ว — Flash-Lite ทั้งเร็วกว่า และ เก่งกว่าในงานเหล่านี้
ระดับการคิด: หนึ่งโมเดล สองโหมดการทำงาน
Flash-Lite มาพร้อม ระดับการคิดที่ปรับได้ ซึ่งทำให้มันกลายเป็นสองผลิตภัณฑ์ในทางปฏิบัติ:
- การคิดระดับ minimal / low — เน้นความหน่วงและต้นทุนสำหรับงานปริมาณสูง: การค้นหาแบบ agent การประมวลผลเอกสาร การสกัดข้อมูล การจัดหมวดหมู่ การจัดเส้นทาง นี่คือโหมด 350 โทเคน/วินาที
- ระดับการคิดที่สูงขึ้น — เปิดการใช้เหตุผลลึกขึ้นสำหรับ งาน subagent หลายขั้นตอน ที่ Flash-Lite ทำหน้าที่เป็นคนงานภายใต้โมเดล orchestrator
โหมดที่สองตรงกับรูปแบบเดโมของ Google เอง: 3.6 Flash เป็น agent หลัก กองทัพ subagent 3.5 Flash-Lite ทำงานขนานกัน (เดโมหนึ่งสร้างคอนเซปต์ดีไซน์เว็บ 25 แบบพร้อมกัน) การใช้คอมพิวเตอร์ก็เป็น เครื่องมือในตัว บน Flash-Lite เช่นกัน ดังนั้น subagent สามารถควบคุม UI ได้โดยไม่ต้องมีโครงสร้างเพิ่ม ดูเดโมความเร็ว Flash-Lite vs 3.5 Flash ของ Google (วิดีโอ)เพื่อเห็นความต่างด้านความหน่วงในงานปริมาณสูง
วิเคราะห์ต้นทุน: สเกลจริงแพงแค่ไหน
ราคา: $0.30/1M อินพุต, $2.50/1M เอาต์พุต ตัวอย่างเวิร์กโหลด — agent ประมวลผลเอกสารที่รับมือ 1 ล้านเอกสารต่อเดือน เฉลี่ยอินพุต 3K โทเคนและเอาต์พุต 500 โทเคนต่อเอกสาร:
| ส่วนของต้นทุน | การคำนวณ | ต้นทุนรายเดือน |
|---|---|---|
| โทเคนอินพุต | 1M เอกสาร × 3K โทเคน = 3B โทเคน × $0.30/1M | $900 |
| โทเคนเอาต์พุต | 1M เอกสาร × 500 โทเคน = 0.5B โทเคน × $2.50/1M | $1,250 |
| รวมบน 3.5 Flash-Lite | $2,150 | |
| เวิร์กโหลดเดียวกันบน 3.6 Flash ($1.50 / $7.50) | $4,500 + $3,750 | $8,250 |
ต่างกันราว 4 เท่า สำหรับเวิร์กโหลดที่ Lite รับมือได้ดี — และที่ 350 โทเคน/วินาที บทสรุป 500 โทเคนของแต่ละเอกสารสตรีมออกมาในเวลาไม่ถึง 1.5 วินาที กลยุทธ์ที่ตามมา: ส่ง 90% ของปริมาณที่เป็นงานประจำไป Flash-Lite แล้วยกระดับ 10% ที่ยากขึ้นไป 3.6 Flash
ตารางตัดสินใจ: โมเดลไหนสำหรับงานแบบไหน
| เวิร์กโหลด | เลือก | เหตุผล |
|---|---|---|
| การค้นหาแบบ agent / RAG ที่ QPS สูง | 3.5 Flash-Lite (คิดระดับ minimal) | 350 โทเคน/วินาที ต้นทุนต่อคิวรีต่ำสุด |
| ประมวลผล / สกัดเอกสารจำนวนมาก | 3.5 Flash-Lite | ถูกกว่า 3.6 Flash 4 เท่า; บริบทยาว GDM-MRCR v2 72.2% |
| จัดหมวดหมู่ จัดเส้นทาง กลั่นกรองเนื้อหา | 3.5 Flash-Lite (คิดระดับ minimal) | ความหน่วงสำคัญ คุณภาพมีเหลือเฟือ |
| กองทัพ subagent ขนานภายใต้ orchestrator | 3.5 Flash-Lite (คิดระดับสูงขึ้น) | โหมดที่สร้างมาเพื่อสิ่งนี้; การใช้คอมพิวเตอร์ในตัว |
| เขียนโค้ดแบบ agent ที่ซับซ้อน (agent SWE) | 3.6 Flash | DeepSWE 49%; แม่นยำขึ้น แก้ผิดน้อยลง |
| เวิร์กโฟลว์วิจัย ML | 3.6 Flash | MLE Bench 63.9% เทียบกับ 49.7% ของ 3.5 Flash |
| agent การใช้คอมพิวเตอร์บนงานยาก | 3.6 Flash | OSWorld-Verified 83.0% (เทียบกับ 74.0% ของ Lite) |
| วิเคราะห์เอกสารมัลติโมดัลและร่างรายงาน | 3.6 Flash | ยืนยันโดย Harvey / Hebbia ตั้งแต่วันเปิดตัว |
| ไปป์ไลน์เก่าที่ยังใช้ 3.5 Flash | ย้ายขึ้นหรือลง | 3.6 Flash เพื่อคุณภาพ Flash-Lite เพื่อปริมาณ — ดูคู่มือการย้าย |
| ตรวจจับและแพตช์ช่องโหว่ความปลอดภัย | 3.5 Flash Cyber | เฉพาะผ่านนำร่อง CodeMender (รัฐบาลและพาร์ตเนอร์ที่ไว้ใจได้) |
หลักง่าย ๆ: ตั้ง Flash-Lite เป็นค่าเริ่มต้นแล้วยกระดับเมื่อพลาด แทนที่จะเริ่มด้วยโมเดลใหญ่แล้วค่อยมาปรับทีหลัง โหมดล้มเหลวมองเห็นได้ (เอาต์พุตแย่) ส่วนความสิ้นเปลืองจากการจัดสรรเกินนั้นเงียบกริบ
ใช้ที่ไหนได้บ้าง
3.5 Flash-Lite ใช้งานได้แล้ววันนี้ใน Gemini API (Google AI Studio, Android Studio), Gemini Enterprise Agent Platform และ แอป Gemini — พร้อมกำลัง ทยอยเปิดใน Google Search ซึ่งบอกอะไรมากมายเกี่ยวกับความมั่นใจของ Google ต่อโปรไฟล์ต้นทุนของมันในสเกลระดับโลก ลูกค้ากลุ่มแรกมี Ashler, Palo Alto Networks และ Ramp
เกร็ดข้างเคียง: 3.5 Flash Cyber และ CodeMender
การเปิดตัวเดียวกันยังแนะนำ Gemini 3.5 Flash Cyber — 3.5 Flash ที่ fine-tune มาเพื่อค้นหาและแก้ช่องโหว่ความปลอดภัย ภายใน CodeMender agent Flash Cyber หลายตัวทำงานขนานกันและรวมสิ่งที่พบเป็นรายงานฉบับเดียว บรรลุประสิทธิภาพระดับแข่งกับโมเดล frontier บน CyberGym สังเกตสถาปัตยกรรม: มันคือรูปแบบ “กองทัพผู้เชี่ยวชาญที่มีประสิทธิภาพ” แบบเดียวกับที่คู่มือนี้อธิบาย เพียงแต่นำมาใช้กับความปลอดภัย
การเข้าถึงถูกจำกัดอย่างตั้งใจ: โครงการนำร่องแบบจำกัดสิทธิ์เฉพาะรัฐบาลและพาร์ตเนอร์ที่ไว้ใจได้ ผ่าน CodeMender สะท้อนความเสี่ยงสองทางของการค้นหาช่องโหว่อัตโนมัติ รายละเอียดในบทสรุปประกาศของเรา
สรุป
3.5 Flash-Lite วาดเส้นราคา-ประสิทธิภาพใหม่สำหรับเวิร์กโหลดแบบ agent: เร็วกว่าทุกอย่างในซีรีส์ 3.5 ถูกกว่า 3.6 Flash ราว 4 เท่า และ — เป็นครั้งแรกของโมเดล Lite — เชื่อถือได้จริงบนเบนช์มาร์กแบบ agent สร้างระบบจัดเส้นทางให้ Flash-Lite เป็นค่าเริ่มต้นและ 3.6 Flash เป็นเส้นทางยกระดับ แล้วเส้นโค้งต้นทุนของคุณจะขอบคุณคุณ