Google · 모델

Gemini 3.1 Pro Preview

API출시 2026년 2월 19일Google/gemini-3.1-pro-preview공식 문서 ↗
종합 레이팅1227 · 45위레이팅 벤치 28개
컨텍스트 창1.0M최대 출력 66K
가격 (입력 / 출력, 1M 토큰)$2.00 / $12.0혼합 $4.50
파라미터—
라이선스commercial API
벤치 점수30개코딩·에이전트·추론·지식·멀티모달·과학·보안·속도·비용

AI AI 해설

2026년 10월 9일 생성

긴 컨텍스트와 높은 분야 레이팅을 갖춘 상용 API 프리뷰 모델

모델 성격

Google의 상용 API 모델로, 컨텍스트 1.0M과 최대 출력 66K를 지원한다. 가격은 1M 토큰당 입력 $2.00, 출력 $12.0이며 라이선스는 commercial API다.

레이팅 해석

종합 레이팅은 867(52위), 가중 비교는 6.9다. 분야 레이팅은 추론·지식 960, 과학·보안 923, 멀티모달 915, 코딩 897, 에이전트 863(20위)다. 레이팅은 같은 벤치 비교로 만든 상대 지표다.

벤치 근거

SWE-bench Pro는 Public 731 프로필에서 54.2%, 43/63이다. OpenAI 공개 평가에서는 GPQA Diamond 94.3%, BrowseComp 85.9%, MMMU-Pro 80.5% 등이 보고됐지만 모두 미검증이다. 프로필이 다른 점수끼리는 직접 비교할 수 없다.

선택 시 확인점

프리뷰 모델이며, 같은 공급사에 Gemini 3.8 Flash와 Gemini 3.7 Flash 등 더 최근 모델이 있다. 업무 도입 전 미검증 벤치의 재현성과 비용, 긴 컨텍스트·출력 한도의 실제 활용성을 확인할 필요가 있다. 입력에 없는 분야는 자료 없음이다.

수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.

분야레이팅분야 순위벤치 수
코딩1080586
에이전트929846
추론·지식12392910
멀티모달1021383
과학·보안1115253
차트를 불러오는 중입니다…

분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.

벤치마크 점수

30개 · 프로필별 순위

코딩

벤치프로필점수순위백분위출처
Terminal-Bench 2.1Artificial Analysis73.8%31 / 9769확인됨 ↗
Terminal-Bench HardArtificial Analysis53.8%7 / 9393확인됨 ↗
SciCodeArtificial Analysis58.7%11 / 8488확인됨 ↗
SWE-bench ProPublic 73154.2%43 / 6331확인됨 ↗
Terminal-Bench 2.1OpenAI 공개 평가70.7%8 / 80인용 ↗
DeepSWE v1.1OpenAI 공개 평가11.8%7 / 70인용 ↗

에이전트

벤치프로필점수순위백분위출처
GDPval-AAArtificial Analysis14.7%69 / 10434확인됨 ↗
APEX AgentsArtificial Analysis32.0%9 / 2262확인됨 ↗
ToolathlonOpenAI 공개 평가48.8%9 / 90인용 ↗
BrowseCompOpenAI 공개 평가85.9%5 / 843인용 ↗
GDPval-AA v2OpenAI 공개 평가9628 / 80인용 ↗
Agents' Last ExamOpenAI 공개 평가32.1%7 / 70인용 ↗

추론·지식

벤치프로필점수순위백분위출처
Humanity's Last ExamArtificial Analysis47.0%14 / 14191확인됨 ↗
Intelligence IndexArtificial Analysis29.746 / 14168확인됨 ↗
AA-LCRArtificial Analysis82%24 / 13983확인됨 ↗
CritPTArtificial Analysis17.7%26 / 13981확인됨 ↗
GPQA DiamondArtificial Analysis94.1%3 / 13098확인됨 ↗
IFBenchArtificial Analysis77.1%8 / 9793확인됨 ↗
τ²-Bench TelecomArtificial Analysis95.6%11 / 9689확인됨 ↗
GPQA DiamondOpenAI 공개 평가94.3%3 / 975인용 ↗
FrontierMath Tier 1-3 v2OpenAI 공개 평가59.6%7 / 70인용 ↗
ARC-AGI-3OpenAI 공개 평가0.4%5 / 620인용 ↗

멀티모달

벤치프로필점수순위백분위출처
MMMU-ProArtificial Analysis82.4%12 / 6984확인됨 ↗
gdp.pdfOpenAI 공개 평가16.7%7 / 70인용 ↗
MMMU-Pro · no toolsOpenAI 공개 평가80.5%4 / 525인용 ↗

과학·보안

벤치프로필점수순위백분위출처
AA-Omniscience AccuracyArtificial Analysis54.9%9 / 13994확인됨 ↗
AA-Omniscience IndexArtificial Analysis31.98 / 13995확인됨 ↗
GeneBench ProOpenAI 공개 평가3.1%7 / 70인용 ↗

속도·비용

벤치프로필점수순위백분위출처
Artificial Analysis Output SpeedArtificial Analysis115 tok/s37 / 10866확인됨 ↗
Artificial Analysis Time to First ChunkArtificial Analysis23.96초83 / 10823확인됨 ↗

순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.

레이팅이 비슷한 모델

Google의 다른 모델

공급사 →