AI AI 해설
2026년 10월 9일 생성1M 컨텍스트와 128K 출력을 갖춘 상용 API 모델
포지션
종합 레이팅은 985(38위), 가중 비교는 10이다. 레이팅은 같은 벤치 비교로 만든 상대 지표다. 비슷한 모델로 Step-3.5-Flash 990(36위), MiniMax-M2.7 989(37위), NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4 983(39위)가 제시됐다.
업무별 지표
분야 레이팅은 코딩 996(37위), 에이전트 1066, 추론·지식 894(45위), 멀티모달 934, 과학·보안 928이다. 실제 선택에서는 업무 분야와 평가 기준이 맞는지 함께 확인해야 한다.
벤치 해석
SWE-bench Pro는 Public 731에서 63.2%(미검증)·13/63, Anthropic 482에서 77.4%·3/3이다. 출처·하네스가 달라 두 점수를 직접 비교할 수 없다. 나머지 벤치도 대부분 미검증이므로 순위와 점수를 참고 지표로 봐야 한다.
도입 조건
컨텍스트 1M, 최대 출력 128K이며 가격은 1M 토큰당 입력 $3.00, 출력 $15.0이다. commercial API 라이선스로 제공된다. 같은 공급사의 최신 모델 목록에는 Claude Haiku 5.5, Claude Sonnet 5.5, Claude Opus 5.5, Claude Fable 5.1이 있다.
수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.
분야별 레이팅
비슷한 모델과 비교 →| 분야 | 레이팅 | 분야 순위 | 비교 수 |
|---|---|---|---|
| 코딩 | 39 | 8.5 | |
| 에이전트 | 34 | 4 | |
| 추론·지식 | 72 | 4.5 | |
| 멀티모달 | 25 | 2 | |
| 과학·보안 | — | 1.5 |
분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.
벤치마크 점수
43개 · 프로필별 순위코딩
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| SWE-bench Pro | Public 731 | 63.2% | 13 / 63 | 81 | 인용 ↗ |
| SWE-bench Verified | LLM Stats 집계 | 85.2% | 6 / 58 | 91 | 자기보고 ↗ |
| SWE-bench Pro | LLM Stats 집계 | 63.2% | 13 / 55 | 78 | 자기보고 ↗ |
| Terminal-Bench 2.0 | LLM Stats 집계 | 80.4% | 3 / 40 | 95 | 자기보고 ↗ |
| DeepSWE 1.1 | LLM Stats 집계 | 54% | 28 / 39 | 28 | 인용 ↗ |
| SWE-bench Multilingual | LLM Stats 집계 | 78.3% | 10 / 35 | 72 | 자기보고 ↗ |
| FrontierCode 1.1 | LLM Stats 집계 | 42.7% | 12 / 22 | 48 | 인용 ↗ |
| Terminal-Bench 4.0 | LLM Stats 집계 | 12.4% | 19 / 21 | 8 | 인용 ↗ |
| Terminal-Bench 2.1 | Google 공개 평가 | 80.4% | 3 / 4 | 33 | 인용 ↗ |
| SciCode | Artificial Analysis | 53.6% | 3 / 4 | 33 | 인용 ↗ |
| FrontierCode 1.1 | Google 공개 평가 | 42.7% | 2 / 4 | 67 | 인용 ↗ |
| Terminal-Bench 3.0 | Google 공개 평가 | 14.6% | 3 / 4 | 33 | 인용 ↗ |
| DeepSWE v1.1 | Google 공개 평가 | 53.8% | 3 / 4 | 33 | 인용 ↗ |
| Code Arena | Google 공개 평가 | 1,541 | 2 / 4 | 67 | 인용 ↗ |
| SWE-bench Pro | Anthropic 482 | 77.4% | 3 / 3 | 0 | 확인됨 ↗ |
| FrontierCode | LLM Stats 집계 | 38.8% | 3 / 3 | 0 | 자기보고 ↗ |
에이전트
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| BrowseComp | LLM Stats 집계 | 84.7% | 12 / 47 | 76 | 자기보고 ↗ |
| Toolathlon | LLM Stats 집계 | 54.3% | 17 / 38 | 57 | 자기보고 ↗ |
| OSWorld-Verified | LLM Stats 집계 | 81.2% | 7 / 26 | 76 | 자기보고 ↗ |
| AutomationBench | LLM Stats 집계 | 13.5% | 24 / 24 | 0 | 자기보고 ↗ |
| Legal Agent Benchmark | LLM Stats 집계 | 5.8% | 6 / 14 | 62 | 자기보고 ↗ |
| BenchCAD | LLM Stats 집계 | 37.3% | 7 / 7 | 0 | 자기보고 ↗ |
| AA-Briefcase Elo | Artificial Analysis | 1,377 | 2 / 4 | 67 | 인용 ↗ |
| AA-Briefcase Rubric Pass Rate | Artificial Analysis | 42.3% | 2 / 4 | 67 | 인용 ↗ |
추론·지식
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Humanity's Last Exam | LLM Stats 집계 | 57.4% | 10 / 64 | 86 | 자기보고 ↗ |
| OfficeQA Pro | LLM Stats 집계 | 59.4% | 10 / 12 | 18 | 자기보고 ↗ |
| ArXivMath | LLM Stats 집계 | 72.2% | 3 / 5 | 50 | 자기보고 ↗ |
| GPQA Diamond | Artificial Analysis | 91.1% | 4 / 4 | 0 | 인용 ↗ |
| Humanity's Last Exam | Artificial Analysis | 41.3% | 4 / 4 | 0 | 인용 ↗ |
| AA-LCR | Artificial Analysis | 77% | 3 / 4 | 33 | 인용 ↗ |
| AA Intelligence Index | Google 공개 평가 | 55.0 | 3 / 4 | 33 | 인용 ↗ |
| Intelligence Index v4.1.1 | Artificial Analysis | 55.3 | 3 / 4 | 33 | 인용 ↗ |
| USAMO 2026 | LLM Stats 집계 | 33.4 | 2 / 3 | 50 | 자기보고 ↗ |
| ChartMuseum | LLM Stats 집계 | 86.7% | 1 / 1 | 50 | 자기보고 ↗ |
멀티모달
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| CharXiv-R | LLM Stats 집계 | 88.3% | 12 / 48 | 77 | 자기보고 ↗ |
| gdp.pdf | LLM Stats 집계 | 81.6% | 1 / 8 | 100 | 자기보고 ↗ |
| SWE-Bench Multimodal | LLM Stats 집계 | 28.1% | 7 / 7 | 0 | 자기보고 ↗ |
| MMMU-Pro | Artificial Analysis | 77.3% | 4 / 4 | 0 | 인용 ↗ |
과학·보안
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| HealthBench Professional | LLM Stats 집계 | 57.8% | 9 / 14 | 38 | 자기보고 ↗ |
| AA-Omniscience Index | Artificial Analysis | 16.5 | 3 / 4 | 33 | 인용 ↗ |
| AA-Omniscience Accuracy | Artificial Analysis | 40.1% | 4 / 4 | 0 | 인용 ↗ |
속도·비용
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Artificial Analysis Output Speed | Artificial Analysis | 86 tok/s | 3 / 4 | 33 | 인용 ↗ |
| Artificial Analysis Time to First Chunk | Artificial Analysis | 230.25초 | 4 / 4 | 0 | 인용 ↗ |
순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.
레이팅이 비슷한 모델
- Qwen3.7-Plus 44위 · 1151 비교
- MiniMax-M3 45위 · 1145 비교
- Seed 2.1 Turbo 46위 · 1138 비교
- MiMo-V2.6-Flash 48위 · 1133 비교
- dots3-note-prev 49위 · 1129 비교
- Hy3 50위 · 1126 비교
Anthropic의 다른 모델
공급사 →- Claude Haiku 5.5 2026-10-07 · 1221
- Claude Sonnet 5.5 2026-09-28 · 1527
- Claude Opus 5.5 2026-09-22 · 1615
- Claude Fable 5.1 2026-09-01 · 1409
- Claude Opus 5 2026-07-24 · 1395
- Claude Fable 5 2026-06-12 · 1410
- Claude Mythos 5 2026-06-12
- Claude Mythos Preview 2026-05-28 · 1357