Google · 모델

Gemini 3.7 Flash

API출시 2026년 8월 13일Google/gemini-3.7-flash공식 문서 ↗
종합 레이팅1369 · 22위레이팅 벤치 33개
컨텍스트 창1.0M최대 출력 66K
가격 (입력 / 출력, 1M 토큰)$0.500 / $3.00혼합 $1.13
파라미터—
라이선스commercial API
벤치 점수38개코딩·에이전트·추론·지식·멀티모달·과학·보안·속도·비용

AI AI 해설

2026년 10월 9일 생성

빠른 출력과 넓은 컨텍스트를 갖춘 코딩 중심 상용 API 모델

포지션

종합 레이팅 1195(12위), 가중 비교 10.4다. 분야 레이팅은 코딩 1180(6위), 추론·지식 1108(11위), 멀티모달 1066, 과학·보안 1035, 에이전트 967이다.

주요 평가

Google 공개 평가에서 Code Arena 1,588(1/4), FrontierCode 1.1 43.6%(1/4)다. Terminal-Bench 2.1은 85.8%(2/4), DeepSWE v1.1은 65.3%(2/4), Terminal-Bench 3.0은 14.9%(2/4)다. 서로 다른 프로필의 점수는 직접 비교할 수 없다.

속도와 사양

Artificial Analysis 측정 출력 속도는 324 tok/s(미검증), 첫 청크 시간은 9.06초(미검증)다. 컨텍스트 1.0M, 최대 출력 66K이며, 1M 토큰당 입력/출력 가격은 $0.500/$3.00이다.

선정 시 확인점

상용 API와 commercial API 라이선스를 제공한다. 같은 공급사에는 Gemini 3.8 Flash 등 최신 모델이 있어 함께 검토할 수 있다. 다수 Artificial Analysis 결과와 일부 집계치는 미검증이므로 공개 평가 결과와 구분해 판단해야 한다.

수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.

분야레이팅분야 순위벤치 수
코딩12341312
에이전트1015575
추론·지식12383111
멀티모달1148123
과학·보안1152152
차트를 불러오는 중입니다…

분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.

벤치마크 점수

38개 · 프로필별 순위

코딩

벤치프로필점수순위백분위출처
Terminal-Bench 2.1Artificial Analysis78.3%25 / 9774확인됨 ↗
SciCodeArtificial Analysis59.8%6 / 8494확인됨 ↗
SWE-bench ProPublic 73160.4%22 / 6366확인됨 ↗
Terminal-Bench 2.1LLM Stats 집계85.8%12 / 4374자기보고 ↗
DeepSWE 1.1LLM Stats 집계65.3%20 / 3950자기보고 ↗
FrontierCode 1.1LLM Stats 집계43.6%10 / 2257자기보고 ↗
Terminal-Bench 2.1Google 공개 평가85.8%2 / 467확인됨 ↗
FrontierCode 1.1Google 공개 평가43.6%1 / 4100확인됨 ↗
Terminal-Bench 3.0Google 공개 평가14.9%2 / 467확인됨 ↗
DeepSWE v1.1Google 공개 평가65.3%2 / 467확인됨 ↗
Code ArenaGoogle 공개 평가1,5881 / 4100확인됨 ↗
Terminal-Bench 3.0LLM Stats 집계14.9%3 / 30자기보고 ↗

에이전트

벤치프로필점수순위백분위출처
GDPval-AAArtificial Analysis43.0%34 / 10468확인됨 ↗
AutomationBenchLLM Stats 집계30.4%15 / 2439자기보고 ↗
Agents' Last ExamLLM Stats 집계26.3%17 / 2118자기보고 ↗
OSWorld 2.0LLM Stats 집계47.9%11 / 1423자기보고 ↗
GDPval-AALLM Stats 집계1,5258 / 1130자기보고 ↗

추론·지식

벤치프로필점수순위백분위출처
Humanity's Last ExamArtificial Analysis39.0%40 / 14172확인됨 ↗
Intelligence IndexArtificial Analysis39.624 / 14184확인됨 ↗
AA-LCRArtificial Analysis83%13 / 13989확인됨 ↗
CritPTArtificial Analysis9.4%47 / 13967확인됨 ↗
GPQA DiamondArtificial Analysis92.1%21 / 13085확인됨 ↗
LVBenchLLM Stats 집계85.4%2 / 2896자기보고 ↗
MRCR v2 (8-needle)LLM Stats 집계97%2 / 2295자기보고 ↗
Artificial AnalysisLLM Stats 집계56%3 / 767자기보고 ↗
BioMysteryBenchLLM Stats 집계43.5%7 / 70자기보고 ↗
AA Intelligence IndexGoogle 공개 평가56.02 / 467확인됨 ↗
HLE-VerifiedLLM Stats 집계53.6%2 / 350자기보고 ↗
LABBench2LLM Stats 집계82.1%2 / 20자기보고 ↗
Harvey LAB-AALLM Stats 집계90.7%1 / 150자기보고 ↗
WebDev ArenaLLM Stats 집계1,5881 / 150자기보고 ↗

멀티모달

벤치프로필점수순위백분위출처
MMMU-ProArtificial Analysis84.7%6 / 6993확인됨 ↗
CharXiv-RLLM Stats 집계88.7%10 / 4881자기보고 ↗
gdp.pdfLLM Stats 집계34%3 / 871자기보고 ↗

과학·보안

벤치프로필점수순위백분위출처
AA-Omniscience AccuracyArtificial Analysis54%12 / 13992확인됨 ↗
AA-Omniscience IndexArtificial Analysis23.717 / 13988확인됨 ↗

속도·비용

벤치프로필점수순위백분위출처
Artificial Analysis Output SpeedArtificial Analysis271 tok/s6 / 10895확인됨 ↗
Artificial Analysis Time to First ChunkArtificial Analysis6.51초72 / 10834확인됨 ↗

순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.

레이팅이 비슷한 모델

Google의 다른 모델

공급사 →