AI AI 해설
2026년 10월 9일 생성종합 1293(3위), 긴 컨텍스트와 일부 도구·개발 벤치가 강점
종합 평가
종합 레이팅은 1293(3위), 가중 비교는 11.4다. 유사 레이팅 모델로 GLM-5.3 1309(2위), Hy4-preview 1291(4위), DeepSeek-V4.1-Flash 1285(5위)가 있다. 레이팅은 같은 벤치 비교를 바탕으로 한 상대 지표다.
업무별 적합성
분야 레이팅은 코딩 1172(7위), 에이전트 1072(7위), 추론·지식 1112(10위), 멀티모달 1045, 과학·보안 1147이다. SWE-bench Pro Public 731에서는 80%, 3/63을 기록했다.
벤치 해석
OpenAI 공개 평가에서 Toolathlon 61.7%와 GDPval-AA v2 1,760은 1위다. Z.ai 공개 평가에서는 ExploitBench 78%, PostTrainBench 41.8%, ProgramBench 33%, FrontierSWE 88.2%가 1위다. 이 점수들은 미검증이며 프로필이 다른 결과끼리는 직접 비교하면 안 된다.
도입 조건
컨텍스트 1M, 최대 출력 128K를 지원한다. 가격은 1M 토큰당 입력 $10.0, 출력 $50.0이며 commercial API다. 같은 공급사에는 Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5, Claude Haiku 5.5도 있어 최신 계열과 함께 검토할 필요가 있다.
수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.
분야별 레이팅
비슷한 모델과 비교 →| 분야 | 레이팅 | 분야 순위 | 비교 수 |
|---|---|---|---|
| 코딩 | 4 | 7.9 | |
| 에이전트 | 13 | 5.5 | |
| 추론·지식 | 18 | 3.5 | |
| 멀티모달 | — | 1 | |
| 과학·보안 | 3 | 2.5 |
분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.
벤치마크 점수
41개 · 프로필별 순위코딩
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| SWE-bench Pro | Public 731 | 80% | 3 / 63 | 97 | 확인됨 ↗ |
| SWE-bench Verified | LLM Stats 집계 | 95% | 1 / 58 | 100 | 자기보고 ↗ |
| SWE-bench Pro | LLM Stats 집계 | 80% | 3 / 55 | 96 | 자기보고 ↗ |
| Terminal-Bench 2.1 | LLM Stats 집계 | 84.3% | 15 / 43 | 65 | 자기보고 ↗ |
| DeepSWE 1.1 | LLM Stats 집계 | 70% | 10 / 39 | 75 | 인용 ↗ |
| FrontierCode 1.1 | LLM Stats 집계 | 53.5% | 2 / 22 | 95 | 인용 ↗ |
| Terminal-Bench 4.0 | LLM Stats 집계 | 44.5% | 6 / 21 | 75 | 인용 ↗ |
| FrontierSWE | LLM Stats 집계 | 90% | 1 / 17 | 100 | 인용 ↗ |
| Terminal-Bench 2.1 | OpenAI 공개 평가 | 83.1% | 6 / 8 | 29 | 인용 ↗ |
| DeepSWE v1.1 | OpenAI 공개 평가 | 69.7% | 2 / 7 | 83 | 인용 ↗ |
| Terminal-Bench 3.0 | Z.ai 공개 평가 | 33.7% | 2 / 6 | 80 | 인용 ↗ |
| PostTrainBench | Z.ai 공개 평가 | 41.8% | 1 / 6 | 100 | 인용 ↗ |
| SWE-Marathon 1.1 | Z.ai 공개 평가 | 33.1% | 5 / 6 | 20 | 인용 ↗ |
| FrontierSWE | Z.ai 공개 평가 | 88.2% | 1 / 4 | 100 | 인용 ↗ |
| FrontierCode | LLM Stats 집계 | 46.3% | 2 / 3 | 50 | 자기보고 ↗ |
에이전트
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| OSWorld-Verified | LLM Stats 집계 | 85% | 2 / 26 | 96 | 자기보고 ↗ |
| AutomationBench | LLM Stats 집계 | 17.4% | 21 / 24 | 13 | 자기보고 ↗ |
| Finance Agent v2 | LLM Stats 집계 | 56.3% | 4 / 21 | 85 | 인용 ↗ |
| Legal Agent Benchmark | LLM Stats 집계 | 13.3% | 1 / 14 | 100 | 자기보고 ↗ |
| Toolathlon | OpenAI 공개 평가 | 61.7% | 1 / 9 | 94 | 인용 ↗ |
| GDPval-AA v2 | OpenAI 공개 평가 | 1,760 | 1 / 8 | 100 | 인용 ↗ |
| Agents' Last Exam | OpenAI 공개 평가 | 40.5% | 6 / 7 | 17 | 인용 ↗ |
| GDPval-AA v2 | Z.ai 공개 평가 | 1,743 | 2 / 7 | 83 | 인용 ↗ |
| Agents' Last Exam · CLI | Z.ai 공개 평가 | 23.8% | 6 / 7 | 8 | 인용 ↗ |
| AutomationBench 1.0.6 | Z.ai 공개 평가 | 46.2% | 3 / 7 | 67 | 인용 ↗ |
| Toolathlon Verified | Z.ai 공개 평가 | 74.7% | 4 / 7 | 50 | 인용 ↗ |
추론·지식
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Humanity's Last Exam | LLM Stats 집계 | 64.5% | 4 / 64 | 95 | 자기보고 ↗ |
| LiveBench | LLM Stats 집계 | 78.3% | 4 / 23 | 86 | 인용 ↗ |
| GPQA Diamond | OpenAI 공개 평가 | 92.6% | 7 / 9 | 25 | 인용 ↗ |
| BioMysteryBench | LLM Stats 집계 | 46.1% | 6 / 7 | 17 | 자기보고 ↗ |
| FrontierMath Tier 1-3 v2 | OpenAI 공개 평가 | 87% | 2 / 7 | 83 | 인용 ↗ |
| HLE · with tools | Z.ai 공개 평가 | 63.9% | 2 / 7 | 83 | 인용 ↗ |
| ProgramBench · Almost Solved | Z.ai 공개 평가 | 33% | 1 / 6 | 100 | 인용 ↗ |
| Blueprint-Bench 2 | LLM Stats 집계 | 38.6% | 1 / 2 | 100 | 자기보고 ↗ |
멀티모달
과학·보안
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| HealthBench Professional | LLM Stats 집계 | 66% | 2 / 14 | 92 | 자기보고 ↗ |
| ExploitBench | LLM Stats 집계 | 78% | 2 / 8 | 86 | 자기보고 ↗ |
| CyberGym | Z.ai 공개 평가 | 83.8% | 2 / 7 | 83 | 인용 ↗ |
| HealthBench Professional | OpenAI 공개 평가 | 60.9% | 1 / 6 | 100 | 인용 ↗ |
| ExploitBench | Z.ai 공개 평가 | 78% | 1 / 6 | 100 | 인용 ↗ |
순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.
레이팅이 비슷한 모델
- GPT-6 Astra 2위 · 1572 비교
- Claude Sonnet 5.5 3위 · 1527 비교
- GPT-5.6 Sol 4위 · 1485 비교
- Claude Fable 5.1 6위 · 1409 비교
- Claude Opus 5 7위 · 1395 비교
- GLM-5.3 8위 · 1390 비교
Anthropic의 다른 모델
공급사 →- Claude Haiku 5.5 2026-10-07 · 1221
- Claude Sonnet 5.5 2026-09-28 · 1527
- Claude Opus 5.5 2026-09-22 · 1615
- Claude Fable 5.1 2026-09-01 · 1409
- Claude Opus 5 2026-07-24 · 1395
- Claude Sonnet 5 2026-06-30 · 1135
- Claude Mythos 5 2026-06-12
- Claude Mythos Preview 2026-05-28 · 1357