AI AI 해설
2026년 10월 9일 생성Gemini 3 Pro는 멀티모달과 추론·지식이 상대적으로 돋보이는 상용 API 모델
종합 평가
종합 레이팅은 1063(68위), 가중 비교는 10이다. 레이팅은 같은 벤치 비교를 바탕으로 한 상대 지표다. 분야별로 추론·지식 1074(52위), 멀티모달 1057(17위), 코딩 994를 기록했다.
벤치마크 특징
LLM Stats 집계 프로필에서 AIME 2025는 100%(1/40), VideoMMMU는 87.6%(1/23), SimpleQA는 72.1%(1/12)다. SWE-bench Verified는 76.2%(32/58), MMMU-Pro는 81%(10/61)다. 모든 점수는 미검증이다.
적용 전 확인사항
에이전트와 과학·보안은 자료 없음이다. 컨텍스트, 최대 출력, 입력·출력 가격, 라이선스도 자료가 없다. 업무 도입 전 API 한도와 비용 조건을 별도로 확인해야 한다.
공급사 모델 흐름
Google의 같은 공급사 최신 모델로 DiarizationLM-Gemma-4-E4B-v1, Gemini 3.8 Flash, Gemini 3.7 Flash, Gemini 3.5 Flash-Lite가 제시돼 있다. 본 모델의 출시는 2025-11-18이며 접근 방식은 상용 API다.
수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.
분야별 레이팅
비슷한 모델과 비교 →| 분야 | 레이팅 | 분야 순위 | 벤치 수 |
|---|---|---|---|
| 코딩 | 86 | 3 | |
| 에이전트 | — | — | — |
| 추론·지식 | 76 | 12 | |
| 멀티모달 | 32 | 5 | |
| 과학·보안 | — | — | — |
분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.
벤치마크 점수
21개 · 프로필별 순위코딩
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| SWE-bench Verified | LLM Stats 집계 | 76.2% | 32 / 58 | 46 | 자기보고 ↗ |
| Terminal-Bench 2.0 | LLM Stats 집계 | 54.2% | 27 / 40 | 33 | 자기보고 ↗ |
| LiveCodeBench Pro | LLM Stats 집계 | 2,439 | 2 / 5 | 75 | 자기보고 ↗ |
추론·지식
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| GPQA Diamond | LLM Stats 집계 | 91.9% | 17 / 90 | 82 | 자기보고 ↗ |
| Humanity's Last Exam | LLM Stats 집계 | 45.8% | 28 / 64 | 57 | 자기보고 ↗ |
| AIME 2025 | LLM Stats 집계 | 100% | 1 / 40 | 97 | 자기보고 ↗ |
| MMMLU | LLM Stats 집계 | 91.8% | 4 / 30 | 91 | 자기보고 ↗ |
| LiveBench | LLM Stats 집계 | 73.4% | 14 / 23 | 41 | 인용 ↗ |
| MRCR v2 (8-needle) | LLM Stats 집계 | 26.3% | 17 / 22 | 21 | 자기보고 ↗ |
| t2-bench | LLM Stats 집계 | 85.4% | 7 / 19 | 67 | 자기보고 ↗ |
| Global PIQA | LLM Stats 집계 | 93.4% | 1 / 15 | 100 | 자기보고 ↗ |
| ARC-AGI v2 | LLM Stats 집계 | 31.1% | 13 / 14 | 8 | 자기보고 ↗ |
| SimpleQA | LLM Stats 집계 | 72.1% | 1 / 12 | 100 | 자기보고 ↗ |
| MathArena Apex | LLM Stats 집계 | 23.4% | 10 / 11 | 10 | 자기보고 ↗ |
| Vending-Bench 2 | LLM Stats 집계 | 547,816% | 3 / 4 | 33 | 자기보고 ↗ |
| FACTS Grounding | LLM Stats 집계 | 70.5% | 1 / 2 | 100 | 자기보고 ↗ |
멀티모달
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| MMMU-Pro | LLM Stats 집계 | 81% | 10 / 61 | 85 | 자기보고 ↗ |
| CharXiv-R | LLM Stats 집계 | 81.4% | 23 / 48 | 53 | 자기보고 ↗ |
| ScreenSpot-Pro | LLM Stats 집계 | 72.7% | 8 / 26 | 72 | 자기보고 ↗ |
| VideoMMMU | LLM Stats 집계 | 87.6% | 1 / 23 | 100 | 자기보고 ↗ |
| OmniDocBench 1.5 | LLM Stats 집계 | 11.5% | 18 / 20 | 11 | 자기보고 ↗ |
순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.
레이팅이 비슷한 모델
- MiMo-V2.5-Pro 78위 · 1098 비교
- Nex-N2-Pro 79위 · 1094 비교
- DeepSeek-V4-Flash-Max 80위 · 1087 비교
- Ornith-1.5-35B-A3B 82위 · 1081 비교
- GLM-5 83위 · 1081 비교
- DeepSeek-V4-Flash 84위 · 1077 비교
Google의 다른 모델
공급사 →- DiarizationLM-Gemma-4-E4B-v1 2026-10-04
- Gemini 3.8 Flash 2026-09-02 · 1432
- Gemini 3.7 Flash 2026-08-13 · 1369
- Gemini 3.5 Flash-Lite 2026-07-21 · 983
- Gemini 3.6 Flash 2026-07-21 · 1208
- DiffusionGemma 26B-A4B 2026-06-10 · 705
- Gemma 4 12B 2026-05-23 · 781
- Gemini 3.5 Flash 2026-05-19 · 1227