Gemini 3.5 Flash-Lite 가이드: 초당 350 토큰으로 에이전트 워크플로 확장하기(2026)
Gemini 3.5 Flash-Lite는 초당 350 토큰, 입력 $0.30/100만. 3.1 Flash-Lite·Gemini 3 Flash 대비 벤치마크, 사고 수준, 비용 계산, 모델 선택표까지 정리.
대용량 등급이 진지해졌다
2026년 7월 21일 발표된 Gemini 3.5 Flash-Lite는 Google의 3.5급에서 가장 빠르고 비용 효율적인 모델입니다: 초당 350 출력 토큰(Artificial Analysis), 요금은 입력 100만 토큰당 $0.30, 출력 100만 토큰당 $2.50. 역사적으로 “Lite” 등급은 품질이 죽으러 가는 곳이었습니다 —— 분류나 보일러플레이트에는 괜찮아도, 에이전트 작업에는 위험했죠. 이번 릴리스는 그 패턴을 깹니다: 여러 에이전트·코딩 평가에서 3.5 Flash-Lite가 더 큰 Gemini 3 Flash를 정면으로 이깁니다.
이 가이드는 Flash-Lite의 라인업 내 위치, 사고 수준 설정법, 규모 확장 시 실제 비용, 워크로드별 모델 선택을 다룹니다. 출시 맥락은 발표 총정리에 있습니다.
세대 도약: vs 3.1 Flash-Lite
이전 Lite 세대에서의 도약은 이 제품군 역사상 최대입니다:
| 벤치마크 | 측정 대상 | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | 코딩·에이전트 터미널 작업 | 54% | 31% |
| GDM-MRCR v2 | 장문 컨텍스트 검색 | 72.2% | 60.1% |
| GDPval-AA v2 | 실무 작업 수행 | 1140 | 642 |

새겨야 할 수치는 거의 두 배가 된 GDPval-AA v2(642 → 1140)입니다. 실무 작업 수행이야말로 예전 Lite 모델들이 프로덕션 에이전트에서 무너지던 바로 그 지점이기 때문입니다.
이변: Gemini 3 Flash를 꺾다
세대 간 상승보다 놀라운 것은 등급을 넘어선 역전입니다. 여러 에이전트·코딩 평가에서 3.5 Flash-Lite는 더 크고 비싼 모델인 Gemini 3 Flash를 앞섭니다:
| 벤치마크 | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | 54.2% | 49.6% |
| OSWorld-Verified | 74.0% | 65.1% |
“Lite 등급에는 에이전트 작업을 맡길 수 없다”는 이유로 지금 2.5 Flash나 3 Flash에 워크로드를 올려두고 있다면, 그 전제는 이제 낡았습니다 —— Flash-Lite는 이런 작업에서 더 빠르고 동시에 더 유능합니다.
사고 수준: 하나의 모델, 두 가지 작동 모드
Flash-Lite는 **설정 가능한 사고 수준(thinking levels)**을 탑재해 사실상 두 개의 제품처럼 작동합니다:
- Minimal / low 사고 —— 대용량 작업에서 지연과 비용을 우선: 에이전트 검색, 문서 처리, 추출, 분류, 라우팅. 이것이 초당 350 토큰 모드입니다.
- 높은 사고 수준 —— 멀티스텝 서브에이전트 워크로드를 위한 깊은 추론을 활성화. Flash-Lite가 오케스트레이터 모델 아래에서 워커로 일하는 형태입니다.
두 번째 모드는 Google 자체 데모 패턴과 일치합니다: 3.6 Flash가 마스터 에이전트, 3.5 Flash-Lite 서브에이전트 함대가 병렬 작업(한 데모에서는 웹 디자인 시안 25개를 동시 생성). Flash-Lite에도 컴퓨터 사용이 내장 도구로 들어 있어, 서브에이전트가 별도 스캐폴딩 없이 UI를 조작할 수 있습니다. 대용량 작업에서의 지연 차이는 Google의 Flash-Lite vs 3.5 Flash 속도 데모(영상)에서 확인하세요.
비용 분석: 규모의 실제 비용
가격: 입력 $0.30/100만, 출력 $2.50/100만. 예시 워크로드 —— 월 100만 건의 문서를 처리하는 문서 처리 에이전트, 문서당 평균 입력 3K 토큰·출력 500 토큰:
| 비용 항목 | 계산 | 월 비용 |
|---|---|---|
| 입력 토큰 | 100만 건 × 3K 토큰 = 30억 토큰 × $0.30/100만 | $900 |
| 출력 토큰 | 100만 건 × 500 토큰 = 5억 토큰 × $2.50/100만 | $1,250 |
| 3.5 Flash-Lite 합계 | $2,150 | |
| 같은 워크로드를 3.6 Flash($1.50 / $7.50)로 | $4,500 + $3,750 | $8,250 |
Lite가 잘 다루는 워크로드에서 대략 4배의 비용 차이입니다 —— 게다가 초당 350 토큰이면 문서마다 500 토큰짜리 요약이 1.5초 안에 스트리밍됩니다. 따라오는 전략은 이렇습니다: 정형적인 90%의 트래픽은 Flash-Lite로 보내고, 어려운 10%는 3.6 Flash로 에스컬레이션하세요.
선택표: 어떤 워크로드에 어떤 모델인가
| 워크로드 | 선택 | 이유 |
|---|---|---|
| 고 QPS 에이전트 검색/RAG | 3.5 Flash-Lite(minimal 사고) | 초당 350 토큰, 쿼리당 최저 비용 |
| 대량 문서 처리/추출 | 3.5 Flash-Lite | 3.6 Flash 대비 4배 저렴. GDM-MRCR v2 72.2% 장문 컨텍스트 |
| 분류, 라우팅, 모더레이션 | 3.5 Flash-Lite(minimal 사고) | 지연이 관건, 품질 여유도 충분 |
| 오케스트레이터 아래 병렬 서브에이전트 함대 | 3.5 Flash-Lite(높은 사고) | 전용 설계 모드. 컴퓨터 사용 내장 |
| 복잡한 에이전트 코딩(SWE 에이전트) | 3.6 Flash | DeepSWE 49%. 높은 정밀도, 불량 수정 감소 |
| ML 연구 워크플로 | 3.6 Flash | MLE Bench 63.9%(3.5 Flash는 49.7%) |
| 어려운 작업의 컴퓨터 사용 에이전트 | 3.6 Flash | OSWorld-Verified 83.0%(Lite는 74.0%) |
| 멀티모달 문서 분석·보고서 작성 | 3.6 Flash | Harvey / Hebbia가 출시 시점에 검증 |
| 아직 3.5 Flash인 레거시 파이프라인 | 위나 아래로 이전 | 품질은 3.6 Flash, 대용량은 Flash-Lite —— 마이그레이션 가이드 참고 |
| 보안 취약점 탐지·패치 | 3.5 Flash Cyber | CodeMender 파일럿을 통해서만(정부 기관·신뢰할 수 있는 파트너) |
경험칙: 큰 모델을 기본값으로 두고 나중에 최적화하기보다, Flash-Lite를 기본값으로 두고 실패 시 에스컬레이션하세요. 실패 모드는 눈에 보이지만(나쁜 출력), 과잉 프로비저닝의 낭비는 소리 없이 쌓입니다.
제공되는 곳
3.5 Flash-Lite는 오늘부터 Gemini API(Google AI Studio, Android Studio), Gemini Enterprise Agent Platform, Gemini 앱에서 사용할 수 있으며 —— Google 검색 내부에도 순차 적용 중입니다. 이는 행성 규모에서의 비용 프로필에 대한 Google의 자신감을 잘 보여줍니다. 초기 고객에는 Ashler, Palo Alto Networks, Ramp가 포함됩니다.
사이드바: 3.5 Flash Cyber와 CodeMender
같은 발표에서 Gemini 3.5 Flash Cyber도 소개됐습니다 —— 보안 취약점을 찾고 고치도록 파인튜닝된 3.5 Flash입니다. CodeMender 안에서 여러 Flash Cyber 에이전트가 병렬로 작동해 발견 사항을 하나의 통합 보고서로 합치며, CyberGym에서 프런티어급 경쟁력에 도달했습니다. 아키텍처에 주목하세요: 이 가이드가 설명한 “효율적인 스페셜리스트 함대” 패턴 그대로를 보안에 적용한 것입니다.
접근은 의도적으로 좁습니다: 자동화된 취약점 발견의 이중 용도 위험을 반영해, CodeMender를 통한 정부 기관과 신뢰할 수 있는 파트너 전용 제한 접근 파일럿입니다. 자세한 내용은 발표 총정리에서 확인하세요.
결론
3.5 Flash-Lite는 에이전트 워크로드의 가격 대비 성능 지형을 다시 그립니다: 3.5 시리즈의 어떤 모델보다 빠르고, 3.6 Flash보다 약 4배 저렴하며 —— Lite 모델로는 처음으로 —— 에이전트 벤치마크에서 진정으로 신뢰할 만합니다. Flash-Lite를 기본값으로, 3.6 Flash를 에스컬레이션 경로로 라우팅을 설계하면 비용 곡선이 보답할 것입니다.