AI AI 해설
2026년 10월 9일 생성멀티모달 레이팅 1023, 코딩·에이전트는 자료 없음
종합 평가
종합 레이팅은 933(99위), 가중 비교는 4.5다. 추론·지식은 960, 멀티모달은 1023, 과학·보안은 853(9위)다. 레이팅은 같은 벤치 비교로 만든 상대 지표다.
벤치마크 근거
LLM Stats 집계에서 GPQA Diamond 85.6%, MMMU-Pro 76%, CharXiv-R 81.6%, AIME 2025 81.2%, OmniDocBench 1.5 87.5%다. 모두 미검증 점수이므로 해석에 주의해야 한다.
업무 적용 공백
코딩과 에이전트 레이팅은 자료 없음이다. HealthBench Professional 38.4%, HealthBench 51.4%, Hard 22.9%, Consensus 94.7%이며 모두 LLM Stats 집계·미검증 결과다.
도입 조건
상용 API 모델로 컨텍스트는 400K다. 1M 토큰당 입력 가격은 $5.00, 출력 가격은 $30.0이다. 최대 출력과 라이선스는 자료 없음이다. 같은 공급사에는 GPT-6.1 Sol, GPT-6 Luna, GPT-6 Sol, GPT-6 Astra가 더 최근 모델로 제시됐다.
수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.
분야별 레이팅
비슷한 모델과 비교 →| 분야 | 레이팅 | 분야 순위 | 벤치 수 |
|---|---|---|---|
| 코딩 | 92 | 2 | |
| 에이전트 | — | 1 | |
| 추론·지식 | 130 | 7 | |
| 멀티모달 | 39 | 3 | |
| 과학·보안 | 64 | 6 |
분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.
벤치마크 점수
21개 · 프로필별 순위코딩
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | Artificial Analysis | 34.8% | 71 / 97 | 27 | 확인됨 ↗ |
| SciCode | Artificial Analysis | 52.5% | 30 / 84 | 65 | 확인됨 ↗ |
에이전트
추론·지식
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Humanity's Last Exam | Artificial Analysis | 19.9% | 90 / 141 | 36 | 확인됨 ↗ |
| Intelligence Index | Artificial Analysis | 26.0 | 57 / 141 | 60 | 확인됨 ↗ |
| AA-LCR | Artificial Analysis | 70% | 85 / 139 | 39 | 확인됨 ↗ |
| CritPT | Artificial Analysis | 0% | 116 / 139 | 12 | 확인됨 ↗ |
| GPQA Diamond | Artificial Analysis | 82.3% | 77 / 130 | 41 | 확인됨 ↗ |
| GPQA Diamond | LLM Stats 집계 | 85.6% | 47 / 90 | 48 | 자기보고 ↗ |
| AIME 2025 | LLM Stats 집계 | 81.2% | 29 / 40 | 28 | 자기보고 ↗ |
멀티모달
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| MMMU-Pro | LLM Stats 집계 | 76% | 25 / 61 | 60 | 자기보고 ↗ |
| CharXiv-R | LLM Stats 집계 | 81.6% | 21 / 48 | 57 | 자기보고 ↗ |
| OmniDocBench 1.5 | LLM Stats 집계 | 87.5% | 11 / 20 | 47 | 자기보고 ↗ |
과학·보안
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| AA-Omniscience Accuracy | Artificial Analysis | 44.4% | 30 / 139 | 79 | 확인됨 ↗ |
| AA-Omniscience Index | Artificial Analysis | 3.7 | 41 / 139 | 71 | 확인됨 ↗ |
| HealthBench Professional | LLM Stats 집계 | 38.4% | 13 / 14 | 8 | 자기보고 ↗ |
| HealthBench | LLM Stats 집계 | 51.4% | 9 / 10 | 11 | 자기보고 ↗ |
| HealthBench Hard | LLM Stats 집계 | 22.9% | 5 / 6 | 20 | 자기보고 ↗ |
| HealthBench Consensus | LLM Stats 집계 | 94.7% | 4 / 4 | 0 | 자기보고 ↗ |
속도·비용
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Artificial Analysis Output Speed | Artificial Analysis | 136 tok/s | 30 / 108 | 73 | 확인됨 ↗ |
| Artificial Analysis Time to First Chunk | Artificial Analysis | 0.95초 | 7 / 108 | 94 | 확인됨 ↗ |
순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.
레이팅이 비슷한 모델
- DeepSeek-V4-Flash-0423 112위 · 982 비교
- Qwen3.5-122B-A10B 113위 · 980 비교
- Seed 1.8 114위 · 979 비교
- Ring-2.6-1T 116위 · 975 비교
- Kimi-K2-Thinking 117위 · 975 비교
- Muse-Glimmer-30B 118위 · 971 비교
OpenAI의 다른 모델
공급사 →- GPT-6.1 Sol 2026-09-29 · 1445
- GPT-6 Luna 2026-09-22 · 1275
- GPT-6 Sol 2026-09-22 · 1449
- GPT-6 Astra 2026-09-03 · 1681
- GPT-5.6 Luna 2026-07-09 · 1194
- GPT-5.6 Sol 2026-07-09 · 1590
- GPT-5.6 Terra 2026-07-09 · 1387
- GPT-5.5 2026-04-23 · 1312