Google, Gemini 3.7 Flash 출시: 코딩·에이전트·지식 업무를 위한 하이브리드 추론 플래그십
Gemini 3.7 Flash가 2026년 8월 13일 출시되었습니다. 네이티브 하이브리드 추론, 제어 가능한 thinking budget, 프론티어 코딩 벤치마크, 12월까지 50% 출시 할인 가격을 제공합니다.
하이브리드 추론의 새로운 플래그십
2026년 8월 13일, Google은 Gemini 3.7 Flash를 공개했습니다. 코딩, 에이전트, 복잡한 지식 업무를 위해 설계된 플래그십 하이브리드 추론 모델입니다. 속도를 위해 깊이를 포기하던 이전 Flash 세대와 달리, 3.7 Flash는 API에 네이티브 제어형 추론을 내장했습니다. 요청마다 사고 깊이를 조절할 수 있으며, 별도의 「추론 모델」로 전환할 필요가 없습니다.
이번 출시는 세 가지 대상을 동시에 겨냥합니다: 프로덕션 에이전트를 구축하는 개발자, 장기 코딩 작업을 수행하는 팀, 방대한 문서 세트에 대한 신뢰할 수 있는 멀티모달 분석이 필요한 기업. Google은 3.7 Flash를 100ms 미만 채팅 응답과 수 분 규모의 심층 리서치를 모두 처리하는 단일 엔드포인트로 포지셔닝합니다.
네이티브 하이브리드 추론과 thinking budget
핵심은 thinking_config.thinking_budget —— 답변 전에 모델이 사용할 수 있는 내부 추론 토큰 수를 제어하는 정수입니다.
thinking_budget | 동작 | 최적 용도 |
|---|---|---|
| 0 | 초저지연 고속 모드(첫 토큰 85ms 미만) | 실시간 채팅, 자동완성, 고 QPS 라우팅 |
| 256–1024 | 경량 다단계 계획 | 도구 라우팅, 단순 리팩터, RAG 종합 |
| 4096–16384 | 심층 다단계 추론 | 에이전트 루프, 복잡한 디버깅, 조사 보고서 |
| 32768–65536 | 최대 깊이 | 장기 코딩, 다중 파일 아키텍처 변경 |
Gemini API 설정 예시:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="이 React 컴포넌트를 hooks로 리팩터하고 에러 바운더리를 추가하세요.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=8192 # 0 = 고속 모드; 최대 65536은 심층 추론
)
),
)
print(response.text)
추론이 네이티브로 내장되어 있어 지연이 부드럽게 스케일됩니다. thinking_budget이 0이면 기존 Flash 모델처럼 동작하고, 값을 높이면 모델 ID를 바꾸지 않고 chain-of-thought 품질을 확보할 수 있습니다. 과금은 가시적 출력 토큰과 내부 사고 토큰을 분리하므로, 요청한 깊이만큼만 비용을 지불합니다.
벤치마크 하이라이트
Google은 Gemini 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra와의 정면 비교 수치를 공개했습니다. 3.7 Flash는 아래 모든 평가에서 1위입니다:
| 벤치마크 | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 | 43.6% | 34.4% | 39.1% | 37.8% |
| DeepSWE v1.1 | 65.3% | 49.0% | 56.2% | 53.4% |
| WebDev Arena (Elo) | 1588 | 1538 | 1552 | 1544 |
| GDP.pdf | 34.0% | 22.0% | 28.5% | 26.8% |
| AutomationBench | 30.4% | 17.0% | 23.1% | 21.5% |
| GDM-MRCR v2 | 97.0% | 91.2% | 94.5% | 93.1% |
| HLE-Verified | 53.6% | 44.8% | 48.2% | 46.7% |
개발자에게 특히 눈에 띄는 두 수치:
- DeepSWE v1.1 65.3% —— 3.6 Flash 대비 16%p 상승. 에이전트형 코딩이 주요 학습 목표임을 시사.
- GDM-MRCR v2 97.0% —— 250만 토큰 윈도우에서 거의 완벽한 장문맥 검색. 문서 중심 워크플로에 필수.
이전 세대 맥락은 Gemini 3.6 Flash vs 3.5 Flash 비교를 참고하세요.
가격 및 50% 출시 할인
Google은 공격적인 출시 프로모션을 진행 중입니다:
| 출시가(2026년 12월 31일까지) | 표준가(2027년 1월 1일~) | |
|---|---|---|
| 입력 | $0.75 / 100만 토큰 | $1.50 / 100만 토큰 |
| 출력 | $3.75 / 100만 토큰 | $7.50 / 100만 토큰 |
| 컨텍스트 캐싱 | $0.075 / 100만 토큰 | $0.075 / 100만 토큰 |
2026년 말까지 입력·출력 모두 50% 할인입니다. 대규모 시스템 프롬프트나 문서 코퍼스를 재사용하는 컨텍스트 캐싱은 프로모 기간과 무관하게 100만 토큰당 $0.075입니다.
높은 thinking budget으로 도구 호출 왕복이 줄어들면, 완료된 에이전트 작업당 실효 비용은 토큰 단가보다 훨씬 낮아질 수 있습니다. API 비용 추정 가이드에서 일반적인 워크로드 계산을 확인하세요.
멀티모달, 웹 개발 및 에이전트 기능
벤치마크 외에도 실제 배포에서 중요한 프로덕션급 기능:
- 250만 토큰 컨텍스트 윈도우 —— 전체 코드베이스, 계약서 묶음, 연구 코퍼스를 한 번에 투입.
- 출력 245 토큰/초 —— UI 코드와 긴 보고서를 UX 저하 없이 스트리밍.
- JSON 도구 실행 정밀도 99.7% —— 에이전트 도구 체인을 위한 신뢰할 수 있는 구조화 출력.
- Computer Use —— 브라우저·데스크톱 워크플로를 위한 내장 클라이언트 자동화.
- UI 생성 충실도 —— WebDev Arena 1588 Elo는 더 정확한 생성 프론트엔드를 의미.
이 기능들은 Gemini API, Google AI Studio, Gemini Enterprise, Google Antigravity에서 오늘부터 이용 가능합니다.
개발자 가이드 및 마이그레이션 팁
3.6 Flash 또는 3.5 Flash-Lite에서 업그레이드한다면 다음 패턴부터 시작하세요:
- 모델 ID 교체 ——
gemini-3.6-flash를gemini-3.7-flash로. API 표면은 하위 호환. - 작업 유형별 thinking budget 설정 —— 사용자 채팅은
0, RAG Q&A는1024, 코딩 에이전트는8192+, 지연 무관한 야간 배치만32768. - 컨텍스트 캐싱 활성화 —— 32K 토큰 초과 시스템 프롬프트나 문서 세트가 요청 간 반복되면 입력 비용 90% 절감.
- 도구 스키마 튜닝 —— 99.7% JSON 정밀도는 엄격한 스키마를 보상. 느슨한 정의는 앱 계층에서 실패.
- 사고 토큰 사용량 모니터링 ——
usage_metadata를 로깅해 심층 추론이 실제로 필요한 단계를 파악.
에이전트 워크플로 패턴은 3.5 Flash-Lite 에이전트 워크플로 가이드를 참고 —— thinking budget 개념은 3.7 Flash에서 더 세밀하게 확장됩니다.
결론
Gemini 3.7 Flash는 속도와 깊이가 상호 배타적이지 않은 최초의 Flash급 모델입니다. 제어 가능한 thinking_budget으로 지연 민감 채팅과 심층 에이전트 코딩을 하나의 모델로 처리할 수 있으며, 출시 가격으로 2026년 말까지 실험 비용을 크게 낮출 수 있습니다.