Gemini 3.7 Flash는 Google의 Flash 계열에서 추론 강도를 high·medium·low로 선택할 수 있게 한 모델이다. 독립 벤치마크인 Artificial Analysis는 high 설정이 지능 지수 56점, 평균 작업 시간 1.7분으로 지능-작업시간 파레토 전선에 놓인다고 평가했다. 핵심은 한 모델을 모든 요청에 최고 추론으로 쓰는 대신, 작업의 난도에 맞춰 시간을 배분하는 데 있다.
세 추론 수준을 고르는 법
| 수준 | Artificial Analysis 지능 지수 | 적합한 작업 |
|---|---|---|
| high | 56 | 코드 변경 계획·복잡한 문서 분석·여러 도구를 쓰는 에이전트 작업 |
| medium | 53 | 품질과 비용을 함께 봐야 하는 일반 지식 작업 |
| low | 51 | 분류·추출·짧은 질의처럼 높은 숙고가 불필요한 대량 작업 |
이 수치는 특정 벤치마크의 상대 평가이지 실제 제품 품질을 보장하지는 않는다. 따라서 먼저 low 또는 medium으로 대표 업무를 측정하고, 실패 비용이 큰 단계만 high로 승격하는 모델 라우팅이 현실적이다.
속도·비용과 멀티모달 입력
평가 자료에 따르면 high 설정은 약 340 출력 토큰/초를 기록했고, 표준 가격은 입력·출력 100만 토큰당 각각 $1.50·$7.50이다. 2026년 말까지는 $0.75·$3.75의 할인 가격이 안내되어 있다. 컨텍스트 창은 100만 토큰이며 텍스트·이미지·영상·음성 입력과 텍스트 출력을 지원한다.
가격이나 제공 조건은 바뀔 수 있으므로 배포 전에는 Google의 현재 API 문서를 다시 확인해야 한다. 특히 비용은 토큰 단가보다 추론 수준별 출력 길이와 도구 재시도 횟수의 영향을 함께 받는다.
누구에게 적합한가
- 에이전트 운영자: 실패하기 쉬운 판단 단계에만 high를 배정하고 싶을 때
- 문서 자동화 팀: 긴 컨텍스트와 멀티모달 입력을 한 모델에서 처리할 때
- 모델 라우팅 개발자: 품질·지연·비용을 요청별로 최적화할 때
관련 문서
- gemini — Google의 멀티모달 AI 모델과 서비스 생태계
- gemini-3-6-flash — 이전 Flash 계열의 에이전트 워크플로 포지션
- model-routing — 품질·비용·지연으로 모델을 선택하는 운영 계층
참고 자료
- Gemini 3.7 Flash: On the Intelligence vs. Time per Task Pareto frontier — Artificial Analysis (2026-08-13)