Gemini Omni
Wróć do listy
10 min czytania

Przewodnik po Gemini 3.5 Flash-Lite: skalowanie agentowych przepływów pracy przy 350 tokenach/s (2026)

Gemini 3.5 Flash-Lite działa z prędkością 350 tokenów/s przy $0.30/1M wejścia. Benchmarki vs 3.1 Flash-Lite i Gemini 3 Flash, poziomy myślenia, koszty i tabela decyzyjna.

Gemini 3.5 Flash-LiteAgentic WorkflowsGuideBenchmarksPricing2026Polski

Segment wolumenowy zaczął grać na poważnie

Gemini 3.5 Flash-Lite, ogłoszony 21 lipca 2026, to najszybszy i najbardziej opłacalny model Google klasy 3.5: 350 tokenów wyjściowych na sekundę (Artificial Analysis), w cenie $0.30 za 1M tokenów wejściowych i $2.50 za 1M tokenów wyjściowych. Historycznie poziomy “Lite” były miejscem, gdzie jakość umierała — dobre do klasyfikacji i boilerplate’u, ryzykowne do czegokolwiek agentowego. To wydanie łamie ten schemat: w kilku ewaluacjach agentowych i kodowych 3.5 Flash-Lite wprost pokonuje większy Gemini 3 Flash.

Ten przewodnik omawia, gdzie Flash-Lite plasuje się w ofercie, jak konfigurować jego poziomy myślenia, ile naprawdę kosztuje w dużej skali i który model wybrać do którego obciążenia. Kontekst premiery znajdziesz w naszym omówieniu ogłoszenia.

Skok generacyjny: vs 3.1 Flash-Lite

Skok względem poprzedniej generacji Lite jest największy w historii tej rodziny:

BenchmarkCo mierzyGemini 3.5 Flash-LiteGemini 3.1 Flash-Lite
Terminal-Bench 2.1Kodowanie i agentowe zadania terminalowe54%31%
GDM-MRCR v2Wyszukiwanie w długim kontekście72.2%60.1%
GDPval-AA v2Wykonywanie zadań w realnym świecie1140642

Porównanie benchmarków Gemini 3.5 Flash-Lite z poprzednimi generacjami Flash-Lite

Niemal podwojony wynik GDPval-AA v2 (642 → 1140) to liczba, którą trzeba zapamiętać: wykonywanie realnych zadań było dokładnie tym, na czym stare modele Lite wykładały się w produkcyjnych agentach.

Niespodzianka: pokonanie Gemini 3 Flash

Bardziej zaskakujący niż zysk generacyjny jest ten międzypoziomowy. W kilku ewaluacjach agentowych i kodowych 3.5 Flash-Lite przewyższa Gemini 3 Flash — większy, droższy model:

BenchmarkGemini 3.5 Flash-LiteGemini 3 Flash
SWE-Bench Pro54.2%49.6%
OSWorld-Verified74.0%65.1%

Jeśli dziś trzymasz obciążenia na 2.5 Flash lub 3 Flash, bo poziomom Lite nie można było ufać w pracy agentowej, to założenie jest już nieaktualne — Flash-Lite jest w tych zadaniach zarówno szybszy, jak i bardziej zdolny.

Poziomy myślenia: jeden model, dwa tryby pracy

Flash-Lite ma konfigurowalne poziomy myślenia, które w praktyce czynią z niego dwa produkty:

  • Myślenie minimal / low — priorytet dla opóźnień i kosztów przy zadaniach o wysokim wolumenie: wyszukiwanie agentowe, przetwarzanie dokumentów, ekstrakcja, klasyfikacja, routing. To tryb 350 tokenów/s.
  • Wyższe poziomy myślenia — włączają głębsze rozumowanie dla wieloetapowych obciążeń z subagentami, gdzie Flash-Lite działa jako worker pod modelem-orkiestratorem.

Ten drugi tryb odpowiada wzorcowi z demo samego Google: 3.6 Flash jako agent nadrzędny, floty subagentów 3.5 Flash-Lite pracujących równolegle (jedno demo generuje 25 koncepcji web designu jednocześnie). Obsługa komputera jest też na Flash-Lite narzędziem wbudowanym, więc subagenty mogą operować interfejsami bez dodatkowego rusztowania. Zobacz demo szybkości Flash-Lite vs 3.5 Flash (wideo), by porównać opóźnienia przy zadaniach o wysokim wolumenie.

Analiza kosztów: ile naprawdę kosztuje skala

Ceny: $0.30/1M wejścia, $2.50/1M wyjścia. Oto przykładowe obciążenie — agent przetwarzający dokumenty, obsługujący 1 milion dokumentów miesięcznie, średnio 3K tokenów wejściowych i 500 tokenów wyjściowych na dokument:

Składnik kosztuObliczenieKoszt miesięczny
Tokeny wejściowe1M dok. × 3K tokenów = 3B tokenów × $0.30/1M$900
Tokeny wyjściowe1M dok. × 500 tokenów = 0.5B tokenów × $2.50/1M$1,250
Łącznie na 3.5 Flash-Lite$2,150
To samo obciążenie na 3.6 Flash ($1.50 / $7.50)$4,500 + $3,750$8,250

Z grubsza 4× różnica kosztów dla obciążenia, z którym Lite radzi sobie dobrze — a przy 350 tokenach/s 500-tokenowe streszczenie każdego dokumentu wypływa strumieniem w niecałe 1.5 sekundy. Strategia, która z tego wynika: kieruj 90% rutynowego wolumenu do Flash-Lite, a trudne 10% eskaluj do 3.6 Flash.

Tabela decyzyjna: który model do którego obciążenia

ObciążenieWybórDlaczego
Wyszukiwanie agentowe / RAG przy wysokim QPS3.5 Flash-Lite (myślenie minimal)350 tokenów/s, najniższy koszt zapytania
Masowe przetwarzanie dokumentów / ekstrakcja3.5 Flash-Lite4× taniej niż 3.6 Flash; GDM-MRCR v2 72.2% w długim kontekście
Klasyfikacja, routing, moderacja3.5 Flash-Lite (myślenie minimal)Krytyczne opóźnienia, zapas jakości na plus
Równoległe floty subagentów pod orkiestratorem3.5 Flash-Lite (wyższe myślenie)Tryb zbudowany specjalnie do tego; wbudowana obsługa komputera
Złożone kodowanie agentowe (agenty SWE)3.6 FlashDeepSWE 49%; wyższa precyzja, mniej złych edycji
Przepływy pracy badań ML3.6 FlashMLE Bench 63.9% wobec 49.7% dla 3.5 Flash
Agenty obsługi komputera przy trudnych zadaniach3.6 FlashOSWorld-Verified 83.0% (wobec 74.0% Lite)
Multimodalna analiza dokumentów i przygotowywanie raportów3.6 FlashZwalidowane przez Harvey / Hebbia na starcie
Potoki legacy wciąż na 3.5 FlashMigruj w górę lub w dół3.6 Flash dla jakości, Flash-Lite dla wolumenu — zobacz przewodnik migracji
Wykrywanie i łatanie podatności bezpieczeństwa3.5 Flash CyberTylko przez pilotaż CodeMender (rządy i zaufani partnerzy)

Zasada kciuka: domyślnie używaj Flash-Lite i eskaluj przy porażce, zamiast domyślnie brać duży model i optymalizować później. Tryb porażki jest widoczny (złe wyniki); marnotrawstwo nadmiarowego zaopatrzenia jest ciche.

Gdzie jest dostępny

3.5 Flash-Lite działa od dziś w Gemini API (Google AI Studio, Android Studio), na Gemini Enterprise Agent Platform i w aplikacji Gemini — a do tego wdrażany jest w Google Search, co wiele mówi o zaufaniu Google do jego profilu kosztowego w planetarnej skali. Wśród pierwszych klientów są Ashler, Palo Alto Networks i Ramp.

Na marginesie: 3.5 Flash Cyber i CodeMender

Ta sama premiera wprowadziła Gemini 3.5 Flash Cyber — 3.5 Flash dostrojony do wyszukiwania i naprawiania podatności bezpieczeństwa. Wewnątrz CodeMender wiele agentów Flash Cyber pracuje równolegle i scala swoje ustalenia w jeden zbiorczy raport, osiągając wyniki konkurencyjne wobec modeli frontier na CyberGym. Zwróć uwagę na architekturę: to ten sam wzorzec “floty efektywnych specjalistów”, który opisuje ten przewodnik, zastosowany do bezpieczeństwa.

Dostęp jest celowo wąski: pilotaż z ograniczonym dostępem wyłącznie dla rządów i zaufanych partnerów przez CodeMender, odzwierciedlający ryzyko podwójnego zastosowania zautomatyzowanego wykrywania podatności. Szczegóły w naszym omówieniu ogłoszenia.

Podsumowanie

3.5 Flash-Lite na nowo wytycza granicę ceny do wydajności dla obciążeń agentowych: szybszy niż cokolwiek w serii 3.5, około 4× tańszy niż 3.6 Flash i — po raz pierwszy w modelu Lite — naprawdę godny zaufania w benchmarkach agentowych. Zbuduj routing tak, by Flash-Lite był domyślny, a 3.6 Flash ścieżką eskalacji, a twoja krzywa kosztów ci podziękuje.

Powiązane