Gemini 3.1 Flash Live API: голосовые агенты с камерой и трансляцией экрана
Мультимодальные агенты с низкой задержкой на Gemini 3.1 Flash Live — WebSocket, нативное аудио, камера/экран 1 FPS, вызов инструментов и эфемерные токены.
Почему Gemini 3.1 Flash Live важен в августе 2026
Google запустил Gemini 3.1 Flash Live через Gemini Live API в марте 2026 — к августу это рекомендуемая модель для продакшн-агентов голос+видение. Live держит постоянную WebSocket-сессию — слушает, видит и говорит без отдельного STT/TTS.
Август 2026: 2.5 Flash Live снят; зрелая экосистема; Live + Gemini 3.7 Flash (анонс 3.7 Flash).
Architecture: WebSocket sessions
The Live API is stateful — persistent WSS streams audio, video frames (≤1 FPS JPEG/PNG), and text bidirectionally. Setup via BidiGenerateContentSetup, then BidiGenerateContentRealtimeInput.
| Layer | Role |
|---|---|
| Transport | Stateful WSS |
| Input | PCM16 @ 16 kHz, video ≤1 FPS, text |
| Output | PCM @ 24 kHz, transcripts, tool calls |
Deploy server-to-server (proxy + logging) or client-to-server (lower latency; use ephemeral tokens).
Native end-to-end audio
Input: 16-bit PCM LE mono 16 kHz. Output: 24 kHz PCM. Convert browser float32 capture to PCM16. VAD handles turns; push-to-talk uses manual activityStart/activityEnd.
Camera and screen share
Stream JPEG/PNG at 1 FPS max — camera Q&A, screen-share code review (Stitch demo), accessibility. Default TURN_INCLUDES_AUDIO_ACTIVITY_AND_ALL_VIDEO bills all frames in a turn; send video only during speech to save cost.
Session limits: 15 min audio-only, 2 min audio+video — extend via session resumption and context compression.
Tool calling
Synchronous function calling + Google Search grounding. 3.1 Flash Live does not support NON_BLOCKING async tools from 2.5.
thinkingLevel and 90+ languages
Use thinkingLevel: minimal (default, lowest latency) through high. Supports 90+ languages with improved tone and pace recognition vs 2.5 Native Audio.
Security
Never ship API keys in clients — mint ephemeral tokens on your backend. For WebRTC scale, use partner integrations (Fishjam, Stream Vision Agents, Voximplant).
Migrate from 2.5 Flash Live
Replace deprecated models with gemini-3.1-flash-live-preview. Switch thinkingBudget → thinkingLevel; use send_realtime_input for mid-session text; handle multi-part server events; review turnCoverage.
3.1 Live vs 3.7 Flash REST
| 3.1 Live | 3.7 REST | |
|---|---|---|
| Protocol | WebSocket | HTTP |
| Latency | Sub-second audio | 85ms+ first token |
| Context | 128K session | 2.5M tokens |
| Best for | Voice agents, screen assist | Coding agents, RAG |
Get started
- Google AI Studio → Stream
pip install google-genaiornpm install @google/genai- Capabilities guide