종합 레이팅1357 · 11위가중 비교 9.5
컨텍스트 창—
가격 (입력 / 출력, 1M 토큰)—
파라미터—
라이선스commercial API
벤치 점수22개코딩·에이전트·추론·지식·멀티모달·과학·보안
분야별 레이팅
비슷한 모델과 비교 →| 분야 | 레이팅 | 분야 순위 | 비교 수 |
|---|---|---|---|
| 코딩 | 12 | 2.5 | |
| 에이전트 | 24 | 2.5 | |
| 추론·지식 | 12 | 2.5 | |
| 멀티모달 | — | 1 | |
| 과학·보안 | — | 1 |
차트를 불러오는 중입니다…
분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.
벤치마크 점수
22개 · 프로필별 순위코딩
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| SWE-bench Pro | Public 731 | 77.8% | 5 / 63 | 94 | 인용 ↗ |
| SWE-bench Verified | LLM Stats 집계 | 93.9% | 2 / 58 | 98 | 자기보고 ↗ |
| SWE-bench Pro | LLM Stats 집계 | 77.8% | 4 / 55 | 94 | 자기보고 ↗ |
| Terminal-Bench 2.0 | LLM Stats 집계 | 82% | 2 / 40 | 97 | 자기보고 ↗ |
| SWE-bench Multilingual | LLM Stats 집계 | 87.3% | 3 / 35 | 94 | 자기보고 ↗ |
에이전트
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| BrowseComp | LLM Stats 집계 | 86.9% | 7 / 47 | 87 | 자기보고 ↗ |
| OSWorld-Verified | LLM Stats 집계 | 79.6% | 10 / 26 | 64 | 자기보고 ↗ |
| Toolathlon | OpenAI 공개 평가 | 61.1% | 3 / 9 | 75 | 인용 ↗ |
| BrowseComp | OpenAI 공개 평가 | 87.9% | 3 / 8 | 71 | 인용 ↗ |
| BenchCAD | OpenAI 공개 평가 | 35.5% | 6 / 7 | 17 | 인용 ↗ |
추론·지식
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| GPQA Diamond | LLM Stats 집계 | 94.6% | 2 / 90 | 98 | 자기보고 ↗ |
| Humanity's Last Exam | LLM Stats 집계 | 64.7% | 2 / 64 | 98 | 자기보고 ↗ |
| MMMLU | LLM Stats 집계 | 92.7% | 1 / 30 | 100 | 자기보고 ↗ |
| Graphwalks BFS >128k | LLM Stats 집계 | 80% | 5 / 12 | 64 | 자기보고 ↗ |
| GPQA Diamond | OpenAI 공개 평가 | 94.6% | 1 / 9 | 94 | 인용 ↗ |
| CyBench | LLM Stats 집계 | 100% | 1 / 2 | 100 | 자기보고 ↗ |
| FigQA | LLM Stats 집계 | 89% | 1 / 2 | 100 | 자기보고 ↗ |
| USAMO25 | LLM Stats 집계 | 97.6% | 1 / 1 | 50 | 자기보고 ↗ |
멀티모달
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| CharXiv-R | LLM Stats 집계 | 93.2% | 1 / 48 | 100 | 자기보고 ↗ |
| SWE-Bench Multimodal | LLM Stats 집계 | 59% | 2 / 7 | 83 | 자기보고 ↗ |
과학·보안
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| CyberGym | LLM Stats 집계 | 83.1% | 8 / 19 | 61 | 자기보고 ↗ |
| ExploitBench | OpenAI 공개 평가 | 74.2% | 2 / 7 | 83 | 인용 ↗ |
순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.
레이팅이 비슷한 모델
- GLM-5.3 8위 · 1390 비교
- Muse Spark 1.3 9위 · 1385 비교
- Kimi-K3 10위 · 1369 비교
- Qwen3.8 Max 12위 · 1353 비교
- DeepSeek-V4.1-Flash 13위 · 1346 비교
- Ling 3.1 Flash 14위 · 1333 비교
Anthropic의 다른 모델
공급사 →- Claude Haiku 5.5 2026-10-07 · 1221
- Claude Sonnet 5.5 2026-09-28 · 1527
- Claude Opus 5.5 2026-09-22 · 1615
- Claude Fable 5.1 2026-09-01 · 1409
- Claude Opus 5 2026-07-24 · 1395
- Claude Sonnet 5 2026-06-30 · 1135
- Claude Fable 5 2026-06-12 · 1410
- Claude Mythos 5 2026-06-12