Gemini Omni
กลับไปดูทุกบทความ
10 นาทีอ่าน

คู่มือ Gemini 3.5 Flash-Lite: สเกลเวิร์กโฟลว์แบบ Agent ที่ 350 โทเคน/วินาที (2026)

Gemini 3.5 Flash-Lite วิ่ง 350 โทเคน/วินาที ที่อินพุต $0.30/1M เบนช์มาร์กเทียบ 3.1 Flash-Lite และ Gemini 3 Flash ระดับการคิด การคำนวณต้นทุน และตารางเลือกโมเดล

Gemini 3.5 Flash-LiteAgentic WorkflowsGuideBenchmarksPricing2026ไทย

ระดับงานปริมาณมากเอาจริงแล้ว

Gemini 3.5 Flash-Lite ประกาศเมื่อ 21 กรกฎาคม 2026 คือโมเดลคลาส 3.5 ที่เร็วที่สุดและคุ้มค่าที่สุดของ Google: 350 โทเคนเอาต์พุตต่อวินาที (Artificial Analysis) ราคา $0.30 ต่อ 1M โทเคนอินพุต และ $2.50 ต่อ 1M โทเคนเอาต์พุต ในอดีต ระดับ “Lite” คือที่ที่คุณภาพไปตาย — ดีสำหรับการจัดหมวดหมู่และงานสำเร็จรูป แต่เสี่ยงกับทุกอย่างที่เป็น agent การปล่อยรุ่นนี้ทำลายรูปแบบเดิม: ในการประเมิน agent และการเขียนโค้ดหลายรายการ 3.5 Flash-Lite เอาชนะ Gemini 3 Flash ที่ตัวใหญ่กว่าแบบตรง ๆ

คู่มือนี้ครอบคลุมตำแหน่งของ Flash-Lite ในไลน์อัป วิธีตั้งค่าระดับการคิด ต้นทุนจริงเมื่อสเกล และควรเลือกโมเดลไหนสำหรับงานแบบไหน บริบทการเปิดตัวอยู่ในบทสรุปประกาศของเรา

ก้าวกระโดดข้ามรุ่น: เทียบกับ 3.1 Flash-Lite

การกระโดดจากรุ่น Lite ก่อนหน้าคือครั้งใหญ่ที่สุดในประวัติศาสตร์ของตระกูลนี้:

เบนช์มาร์กวัดอะไรGemini 3.5 Flash-LiteGemini 3.1 Flash-Lite
Terminal-Bench 2.1งานเทอร์มินัลเขียนโค้ดและ agent54%31%
GDM-MRCR v2การค้นคืนบริบทยาว72.2%60.1%
GDPval-AA v2การทำงานจริงในโลกจริง1140642

การเปรียบเทียบเบนช์มาร์กของ Gemini 3.5 Flash-Lite กับรุ่น Flash-Lite ก่อนหน้า

ตัวเลข GDPval-AA v2 ที่เกือบเพิ่มเป็นสองเท่า (642 → 1140) คือสิ่งที่ต้องจดจำ: การทำงานจริงในโลกจริงคือจุดที่โมเดล Lite รุ่นเก่าพังทลายใน agent ระดับ production

เซอร์ไพรส์: เอาชนะ Gemini 3 Flash

ที่น่าประหลาดใจกว่ากำไรข้ามรุ่นคือการชนะข้ามระดับ ในการประเมิน agent และการเขียนโค้ดหลายรายการ 3.5 Flash-Lite ทำได้ดีกว่า Gemini 3 Flash — โมเดลที่ใหญ่กว่าและแพงกว่า:

เบนช์มาร์กGemini 3.5 Flash-LiteGemini 3 Flash
SWE-Bench Pro54.2%49.6%
OSWorld-Verified74.0%65.1%

ถ้าวันนี้คุณรันเวิร์กโหลดบน 2.5 Flash หรือ 3 Flash เพราะไว้ใจระดับ Lite กับงาน agent ไม่ได้ สมมติฐานนั้นล้าสมัยแล้ว — Flash-Lite ทั้งเร็วกว่า และ เก่งกว่าในงานเหล่านี้

ระดับการคิด: หนึ่งโมเดล สองโหมดการทำงาน

Flash-Lite มาพร้อม ระดับการคิดที่ปรับได้ ซึ่งทำให้มันกลายเป็นสองผลิตภัณฑ์ในทางปฏิบัติ:

  • การคิดระดับ minimal / low — เน้นความหน่วงและต้นทุนสำหรับงานปริมาณสูง: การค้นหาแบบ agent การประมวลผลเอกสาร การสกัดข้อมูล การจัดหมวดหมู่ การจัดเส้นทาง นี่คือโหมด 350 โทเคน/วินาที
  • ระดับการคิดที่สูงขึ้น — เปิดการใช้เหตุผลลึกขึ้นสำหรับ งาน subagent หลายขั้นตอน ที่ Flash-Lite ทำหน้าที่เป็นคนงานภายใต้โมเดล orchestrator

โหมดที่สองตรงกับรูปแบบเดโมของ Google เอง: 3.6 Flash เป็น agent หลัก กองทัพ subagent 3.5 Flash-Lite ทำงานขนานกัน (เดโมหนึ่งสร้างคอนเซปต์ดีไซน์เว็บ 25 แบบพร้อมกัน) การใช้คอมพิวเตอร์ก็เป็น เครื่องมือในตัว บน Flash-Lite เช่นกัน ดังนั้น subagent สามารถควบคุม UI ได้โดยไม่ต้องมีโครงสร้างเพิ่ม ดูเดโมความเร็ว Flash-Lite vs 3.5 Flash ของ Google (วิดีโอ)เพื่อเห็นความต่างด้านความหน่วงในงานปริมาณสูง

วิเคราะห์ต้นทุน: สเกลจริงแพงแค่ไหน

ราคา: $0.30/1M อินพุต, $2.50/1M เอาต์พุต ตัวอย่างเวิร์กโหลด — agent ประมวลผลเอกสารที่รับมือ 1 ล้านเอกสารต่อเดือน เฉลี่ยอินพุต 3K โทเคนและเอาต์พุต 500 โทเคนต่อเอกสาร:

ส่วนของต้นทุนการคำนวณต้นทุนรายเดือน
โทเคนอินพุต1M เอกสาร × 3K โทเคน = 3B โทเคน × $0.30/1M$900
โทเคนเอาต์พุต1M เอกสาร × 500 โทเคน = 0.5B โทเคน × $2.50/1M$1,250
รวมบน 3.5 Flash-Lite$2,150
เวิร์กโหลดเดียวกันบน 3.6 Flash ($1.50 / $7.50)$4,500 + $3,750$8,250

ต่างกันราว 4 เท่า สำหรับเวิร์กโหลดที่ Lite รับมือได้ดี — และที่ 350 โทเคน/วินาที บทสรุป 500 โทเคนของแต่ละเอกสารสตรีมออกมาในเวลาไม่ถึง 1.5 วินาที กลยุทธ์ที่ตามมา: ส่ง 90% ของปริมาณที่เป็นงานประจำไป Flash-Lite แล้วยกระดับ 10% ที่ยากขึ้นไป 3.6 Flash

ตารางตัดสินใจ: โมเดลไหนสำหรับงานแบบไหน

เวิร์กโหลดเลือกเหตุผล
การค้นหาแบบ agent / RAG ที่ QPS สูง3.5 Flash-Lite (คิดระดับ minimal)350 โทเคน/วินาที ต้นทุนต่อคิวรีต่ำสุด
ประมวลผล / สกัดเอกสารจำนวนมาก3.5 Flash-Liteถูกกว่า 3.6 Flash 4 เท่า; บริบทยาว GDM-MRCR v2 72.2%
จัดหมวดหมู่ จัดเส้นทาง กลั่นกรองเนื้อหา3.5 Flash-Lite (คิดระดับ minimal)ความหน่วงสำคัญ คุณภาพมีเหลือเฟือ
กองทัพ subagent ขนานภายใต้ orchestrator3.5 Flash-Lite (คิดระดับสูงขึ้น)โหมดที่สร้างมาเพื่อสิ่งนี้; การใช้คอมพิวเตอร์ในตัว
เขียนโค้ดแบบ agent ที่ซับซ้อน (agent SWE)3.6 FlashDeepSWE 49%; แม่นยำขึ้น แก้ผิดน้อยลง
เวิร์กโฟลว์วิจัย ML3.6 FlashMLE Bench 63.9% เทียบกับ 49.7% ของ 3.5 Flash
agent การใช้คอมพิวเตอร์บนงานยาก3.6 FlashOSWorld-Verified 83.0% (เทียบกับ 74.0% ของ Lite)
วิเคราะห์เอกสารมัลติโมดัลและร่างรายงาน3.6 Flashยืนยันโดย Harvey / Hebbia ตั้งแต่วันเปิดตัว
ไปป์ไลน์เก่าที่ยังใช้ 3.5 Flashย้ายขึ้นหรือลง3.6 Flash เพื่อคุณภาพ Flash-Lite เพื่อปริมาณ — ดูคู่มือการย้าย
ตรวจจับและแพตช์ช่องโหว่ความปลอดภัย3.5 Flash Cyberเฉพาะผ่านนำร่อง CodeMender (รัฐบาลและพาร์ตเนอร์ที่ไว้ใจได้)

หลักง่าย ๆ: ตั้ง Flash-Lite เป็นค่าเริ่มต้นแล้วยกระดับเมื่อพลาด แทนที่จะเริ่มด้วยโมเดลใหญ่แล้วค่อยมาปรับทีหลัง โหมดล้มเหลวมองเห็นได้ (เอาต์พุตแย่) ส่วนความสิ้นเปลืองจากการจัดสรรเกินนั้นเงียบกริบ

ใช้ที่ไหนได้บ้าง

3.5 Flash-Lite ใช้งานได้แล้ววันนี้ใน Gemini API (Google AI Studio, Android Studio), Gemini Enterprise Agent Platform และ แอป Gemini — พร้อมกำลัง ทยอยเปิดใน Google Search ซึ่งบอกอะไรมากมายเกี่ยวกับความมั่นใจของ Google ต่อโปรไฟล์ต้นทุนของมันในสเกลระดับโลก ลูกค้ากลุ่มแรกมี Ashler, Palo Alto Networks และ Ramp

เกร็ดข้างเคียง: 3.5 Flash Cyber และ CodeMender

การเปิดตัวเดียวกันยังแนะนำ Gemini 3.5 Flash Cyber — 3.5 Flash ที่ fine-tune มาเพื่อค้นหาและแก้ช่องโหว่ความปลอดภัย ภายใน CodeMender agent Flash Cyber หลายตัวทำงานขนานกันและรวมสิ่งที่พบเป็นรายงานฉบับเดียว บรรลุประสิทธิภาพระดับแข่งกับโมเดล frontier บน CyberGym สังเกตสถาปัตยกรรม: มันคือรูปแบบ “กองทัพผู้เชี่ยวชาญที่มีประสิทธิภาพ” แบบเดียวกับที่คู่มือนี้อธิบาย เพียงแต่นำมาใช้กับความปลอดภัย

การเข้าถึงถูกจำกัดอย่างตั้งใจ: โครงการนำร่องแบบจำกัดสิทธิ์เฉพาะรัฐบาลและพาร์ตเนอร์ที่ไว้ใจได้ ผ่าน CodeMender สะท้อนความเสี่ยงสองทางของการค้นหาช่องโหว่อัตโนมัติ รายละเอียดในบทสรุปประกาศของเรา

สรุป

3.5 Flash-Lite วาดเส้นราคา-ประสิทธิภาพใหม่สำหรับเวิร์กโหลดแบบ agent: เร็วกว่าทุกอย่างในซีรีส์ 3.5 ถูกกว่า 3.6 Flash ราว 4 เท่า และ — เป็นครั้งแรกของโมเดล Lite — เชื่อถือได้จริงบนเบนช์มาร์กแบบ agent สร้างระบบจัดเส้นทางให้ Flash-Lite เป็นค่าเริ่มต้นและ 3.6 Flash เป็นเส้นทางยกระดับ แล้วเส้นโค้งต้นทุนของคุณจะขอบคุณคุณ

บทความที่เกี่ยวข้อง