Przewodnik po Gemini 3.5 Flash-Lite: skalowanie agentowych przepływów pracy przy 350 tokenach/s (2026)
Gemini 3.5 Flash-Lite działa z prędkością 350 tokenów/s przy $0.30/1M wejścia. Benchmarki vs 3.1 Flash-Lite i Gemini 3 Flash, poziomy myślenia, koszty i tabela decyzyjna.
Segment wolumenowy zaczął grać na poważnie
Gemini 3.5 Flash-Lite, ogłoszony 21 lipca 2026, to najszybszy i najbardziej opłacalny model Google klasy 3.5: 350 tokenów wyjściowych na sekundę (Artificial Analysis), w cenie $0.30 za 1M tokenów wejściowych i $2.50 za 1M tokenów wyjściowych. Historycznie poziomy “Lite” były miejscem, gdzie jakość umierała — dobre do klasyfikacji i boilerplate’u, ryzykowne do czegokolwiek agentowego. To wydanie łamie ten schemat: w kilku ewaluacjach agentowych i kodowych 3.5 Flash-Lite wprost pokonuje większy Gemini 3 Flash.
Ten przewodnik omawia, gdzie Flash-Lite plasuje się w ofercie, jak konfigurować jego poziomy myślenia, ile naprawdę kosztuje w dużej skali i który model wybrać do którego obciążenia. Kontekst premiery znajdziesz w naszym omówieniu ogłoszenia.
Skok generacyjny: vs 3.1 Flash-Lite
Skok względem poprzedniej generacji Lite jest największy w historii tej rodziny:
| Benchmark | Co mierzy | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | Kodowanie i agentowe zadania terminalowe | 54% | 31% |
| GDM-MRCR v2 | Wyszukiwanie w długim kontekście | 72.2% | 60.1% |
| GDPval-AA v2 | Wykonywanie zadań w realnym świecie | 1140 | 642 |

Niemal podwojony wynik GDPval-AA v2 (642 → 1140) to liczba, którą trzeba zapamiętać: wykonywanie realnych zadań było dokładnie tym, na czym stare modele Lite wykładały się w produkcyjnych agentach.
Niespodzianka: pokonanie Gemini 3 Flash
Bardziej zaskakujący niż zysk generacyjny jest ten międzypoziomowy. W kilku ewaluacjach agentowych i kodowych 3.5 Flash-Lite przewyższa Gemini 3 Flash — większy, droższy model:
| Benchmark | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | 54.2% | 49.6% |
| OSWorld-Verified | 74.0% | 65.1% |
Jeśli dziś trzymasz obciążenia na 2.5 Flash lub 3 Flash, bo poziomom Lite nie można było ufać w pracy agentowej, to założenie jest już nieaktualne — Flash-Lite jest w tych zadaniach zarówno szybszy, jak i bardziej zdolny.
Poziomy myślenia: jeden model, dwa tryby pracy
Flash-Lite ma konfigurowalne poziomy myślenia, które w praktyce czynią z niego dwa produkty:
- Myślenie minimal / low — priorytet dla opóźnień i kosztów przy zadaniach o wysokim wolumenie: wyszukiwanie agentowe, przetwarzanie dokumentów, ekstrakcja, klasyfikacja, routing. To tryb 350 tokenów/s.
- Wyższe poziomy myślenia — włączają głębsze rozumowanie dla wieloetapowych obciążeń z subagentami, gdzie Flash-Lite działa jako worker pod modelem-orkiestratorem.
Ten drugi tryb odpowiada wzorcowi z demo samego Google: 3.6 Flash jako agent nadrzędny, floty subagentów 3.5 Flash-Lite pracujących równolegle (jedno demo generuje 25 koncepcji web designu jednocześnie). Obsługa komputera jest też na Flash-Lite narzędziem wbudowanym, więc subagenty mogą operować interfejsami bez dodatkowego rusztowania. Zobacz demo szybkości Flash-Lite vs 3.5 Flash (wideo), by porównać opóźnienia przy zadaniach o wysokim wolumenie.
Analiza kosztów: ile naprawdę kosztuje skala
Ceny: $0.30/1M wejścia, $2.50/1M wyjścia. Oto przykładowe obciążenie — agent przetwarzający dokumenty, obsługujący 1 milion dokumentów miesięcznie, średnio 3K tokenów wejściowych i 500 tokenów wyjściowych na dokument:
| Składnik kosztu | Obliczenie | Koszt miesięczny |
|---|---|---|
| Tokeny wejściowe | 1M dok. × 3K tokenów = 3B tokenów × $0.30/1M | $900 |
| Tokeny wyjściowe | 1M dok. × 500 tokenów = 0.5B tokenów × $2.50/1M | $1,250 |
| Łącznie na 3.5 Flash-Lite | $2,150 | |
| To samo obciążenie na 3.6 Flash ($1.50 / $7.50) | $4,500 + $3,750 | $8,250 |
Z grubsza 4× różnica kosztów dla obciążenia, z którym Lite radzi sobie dobrze — a przy 350 tokenach/s 500-tokenowe streszczenie każdego dokumentu wypływa strumieniem w niecałe 1.5 sekundy. Strategia, która z tego wynika: kieruj 90% rutynowego wolumenu do Flash-Lite, a trudne 10% eskaluj do 3.6 Flash.
Tabela decyzyjna: który model do którego obciążenia
| Obciążenie | Wybór | Dlaczego |
|---|---|---|
| Wyszukiwanie agentowe / RAG przy wysokim QPS | 3.5 Flash-Lite (myślenie minimal) | 350 tokenów/s, najniższy koszt zapytania |
| Masowe przetwarzanie dokumentów / ekstrakcja | 3.5 Flash-Lite | 4× taniej niż 3.6 Flash; GDM-MRCR v2 72.2% w długim kontekście |
| Klasyfikacja, routing, moderacja | 3.5 Flash-Lite (myślenie minimal) | Krytyczne opóźnienia, zapas jakości na plus |
| Równoległe floty subagentów pod orkiestratorem | 3.5 Flash-Lite (wyższe myślenie) | Tryb zbudowany specjalnie do tego; wbudowana obsługa komputera |
| Złożone kodowanie agentowe (agenty SWE) | 3.6 Flash | DeepSWE 49%; wyższa precyzja, mniej złych edycji |
| Przepływy pracy badań ML | 3.6 Flash | MLE Bench 63.9% wobec 49.7% dla 3.5 Flash |
| Agenty obsługi komputera przy trudnych zadaniach | 3.6 Flash | OSWorld-Verified 83.0% (wobec 74.0% Lite) |
| Multimodalna analiza dokumentów i przygotowywanie raportów | 3.6 Flash | Zwalidowane przez Harvey / Hebbia na starcie |
| Potoki legacy wciąż na 3.5 Flash | Migruj w górę lub w dół | 3.6 Flash dla jakości, Flash-Lite dla wolumenu — zobacz przewodnik migracji |
| Wykrywanie i łatanie podatności bezpieczeństwa | 3.5 Flash Cyber | Tylko przez pilotaż CodeMender (rządy i zaufani partnerzy) |
Zasada kciuka: domyślnie używaj Flash-Lite i eskaluj przy porażce, zamiast domyślnie brać duży model i optymalizować później. Tryb porażki jest widoczny (złe wyniki); marnotrawstwo nadmiarowego zaopatrzenia jest ciche.
Gdzie jest dostępny
3.5 Flash-Lite działa od dziś w Gemini API (Google AI Studio, Android Studio), na Gemini Enterprise Agent Platform i w aplikacji Gemini — a do tego wdrażany jest w Google Search, co wiele mówi o zaufaniu Google do jego profilu kosztowego w planetarnej skali. Wśród pierwszych klientów są Ashler, Palo Alto Networks i Ramp.
Na marginesie: 3.5 Flash Cyber i CodeMender
Ta sama premiera wprowadziła Gemini 3.5 Flash Cyber — 3.5 Flash dostrojony do wyszukiwania i naprawiania podatności bezpieczeństwa. Wewnątrz CodeMender wiele agentów Flash Cyber pracuje równolegle i scala swoje ustalenia w jeden zbiorczy raport, osiągając wyniki konkurencyjne wobec modeli frontier na CyberGym. Zwróć uwagę na architekturę: to ten sam wzorzec “floty efektywnych specjalistów”, który opisuje ten przewodnik, zastosowany do bezpieczeństwa.
Dostęp jest celowo wąski: pilotaż z ograniczonym dostępem wyłącznie dla rządów i zaufanych partnerów przez CodeMender, odzwierciedlający ryzyko podwójnego zastosowania zautomatyzowanego wykrywania podatności. Szczegóły w naszym omówieniu ogłoszenia.
Podsumowanie
3.5 Flash-Lite na nowo wytycza granicę ceny do wydajności dla obciążeń agentowych: szybszy niż cokolwiek w serii 3.5, około 4× tańszy niż 3.6 Flash i — po raz pierwszy w modelu Lite — naprawdę godny zaufania w benchmarkach agentowych. Zbuduj routing tak, by Flash-Lite był domyślny, a 3.6 Flash ścieżką eskalacji, a twoja krzywa kosztów ci podziękuje.