AI AI 해설
2026년 10월 9일 생성코딩 벤치가 두드러지지만, 사양·가격과 일부 분야 자료는 없다
종합 평가
종합 레이팅은 1078(61위), 가중 비교는 5다. 분야 레이팅은 추론·지식 1092(45위), 코딩 1047, 에이전트 985다. 멀티모달과 과학·보안은 자료 없음이다.
벤치마크
SWE-bench Verified 80.9%(7/58), Terminal-Bench 2.0 59.3%(18/40), GPQA Diamond 87%(42/90)다. Tau2 Telecom은 98.2%(4/20), Tau2 Retail은 88.9%(3/10)다. 모두 LLM Stats 집계의 미검증 점수다.
도입 정보
Anthropic의 상용 API 모델이며 2025-11-24 출시됐다. 컨텍스트, 최대 출력, 입력·출력 가격, 라이선스는 자료 없음이므로 실제 도입 전 별도 확인이 필요하다.
비교와 최신성
비슷한 종합 레이팅 모델은 Inkling 1091(59위), DeepSeek-V4-Flash-0731 1082(60위), Inkling-Small 1074(62위), DeepSeek-V4-Flash 1070(63위)다. 같은 공급사에는 더 최신 모델이 제시돼 있다.
수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.
분야별 레이팅
비슷한 모델과 비교 →| 분야 | 레이팅 | 분야 순위 | 벤치 수 |
|---|---|---|---|
| 코딩 | 54 | 3 | |
| 에이전트 | 62 | 2 | |
| 추론·지식 | 75 | 13 | |
| 멀티모달 | — | 1 | |
| 과학·보안 | 23 | 2 |
분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.
벤치마크 점수
24개 · 프로필별 순위코딩
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Terminal-Bench Hard | Artificial Analysis | 47.0% | 14 / 93 | 85 | 확인됨 ↗ |
| SWE-bench Verified | LLM Stats 집계 | 80.9% | 7 / 58 | 89 | 자기보고 ↗ |
| Terminal-Bench 2.0 | LLM Stats 집계 | 59.3% | 18 / 40 | 55 | 자기보고 ↗ |
에이전트
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| MCP Atlas · Public | LLM Stats 집계 | 62.3% | 30 / 36 | 17 | 자기보고 ↗ |
| OSWorld | LLM Stats 집계 | 66.3% | 6 / 18 | 71 | 자기보고 ↗ |
추론·지식
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Humanity's Last Exam | Artificial Analysis | 30.1% | 60 / 141 | 58 | 확인됨 ↗ |
| Intelligence Index | Artificial Analysis | 29.1 | 49 / 141 | 66 | 확인됨 ↗ |
| AA-LCR | Artificial Analysis | 77.3% | 58 / 139 | 58 | 확인됨 ↗ |
| CritPT | Artificial Analysis | 4.6% | 59 / 139 | 57 | 확인됨 ↗ |
| GPQA Diamond | Artificial Analysis | 86.6% | 55 / 130 | 58 | 확인됨 ↗ |
| IFBench | Artificial Analysis | 58.0% | 56 / 97 | 42 | 확인됨 ↗ |
| τ²-Bench Telecom | Artificial Analysis | 89.5% | 34 / 96 | 65 | 확인됨 ↗ |
| GPQA Diamond | LLM Stats 집계 | 87% | 42 / 90 | 53 | 자기보고 ↗ |
| MMMLU | LLM Stats 집계 | 90.8% | 7 / 30 | 79 | 자기보고 ↗ |
| LiveBench | LLM Stats 집계 | 76.0% | 8 / 23 | 68 | 인용 ↗ |
| Tau2 Telecom | LLM Stats 집계 | 98.2% | 4 / 20 | 84 | 자기보고 ↗ |
| ARC-AGI v2 | LLM Stats 집계 | 37.6% | 11 / 14 | 23 | 자기보고 ↗ |
| Tau2 Retail | LLM Stats 집계 | 88.9% | 3 / 10 | 78 | 자기보고 ↗ |
멀티모달
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| MMMU-Pro | Artificial Analysis | 74.0% | 40 / 69 | 42 | 확인됨 ↗ |
| MMMU (validation) | LLM Stats 집계 | 80.7% | 1 / 1 | 50 | 자기보고 ↗ |
과학·보안
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| AA-Omniscience Accuracy | Artificial Analysis | 46.6% | 27 / 139 | 81 | 확인됨 ↗ |
| AA-Omniscience Index | Artificial Analysis | 14.0 | 25 / 139 | 83 | 확인됨 ↗ |
속도·비용
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Artificial Analysis Output Speed | Artificial Analysis | 45 tok/s | 92 / 108 | 15 | 확인됨 ↗ |
| Artificial Analysis Time to First Chunk | Artificial Analysis | 14.14초 | 78 / 108 | 28 | 확인됨 ↗ |
순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.
레이팅이 비슷한 모델
- Claude Sonnet 4.6 69위 · 1144 비교
- Kimi-K2.7-Code 70위 · 1142 비교
- Qwen3.6 Plus 71위 · 1127 비교
- Inkling 73위 · 1114 비교
- Nex-N2.5-Pro 74위 · 1114 비교
- Sakana Namazu 75위 · 1114 비교
Anthropic의 다른 모델
공급사 →- Claude Haiku 5.5 2026-10-07 · 1356
- Claude Sonnet 5.5 2026-09-28 · 1662
- Claude Opus 5.5 2026-09-22 · 1766
- Claude Fable 5.1 2026-09-01 · 1637
- Claude Opus 5 2026-07-24 · 1550
- Claude Sonnet 5 2026-06-30 · 1283
- Claude Fable 5 2026-06-12 · 1522
- Claude Mythos 5 2026-06-12 · 1393