AI AI 해설
2026년 10월 9일 생성코딩 레이팅 1052가 강점이며, 에이전트 평가는 벤치별 편차가 있다
종합 평가
종합 레이팅은 989(37위), 가중 비교는 4.2다. 비슷한 레이팅의 모델은 Step-3.5-Flash 990(36위), Claude Sonnet 5 985(38위) 등이다. 레이팅은 같은 벤치 비교로 만든 상대 지표다.
코딩 성능
코딩 레이팅은 1052(25위)다. HF 리더보드에서 SWE-bench Multilingual 76.5%(6/26), Terminal-Bench 2.0 57%(9/32)를 기록했다. SWE-bench Pro는 Public 731 프로필에서 56.2%(36/63)다.
에이전트 평가
에이전트 레이팅은 864다. HF 리더보드의 WildClawBench 33.8%(19/22), Claw-Eval 49.7%(20/21), SkillsBench 34.9%(11/11)는 모두 미검증 점수이므로 해석에 주의가 필요하다.
도입 전 확인
오픈 웨이트이며 라이선스는 other다. 컨텍스트, 최대 출력, 입력·출력 가격은 자료 없음이다. 추론·지식, 멀티모달, 과학·보안도 자료 없음이므로 해당 업무 적합성은 이 입력만으로 판단하기 어렵다.
수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.
분야별 레이팅
비슷한 모델과 비교 →| 분야 | 레이팅 | 분야 순위 | 벤치 수 |
|---|---|---|---|
| 코딩 | 67 | 6 | |
| 에이전트 | 106 | 5 | |
| 추론·지식 | 91 | 7 | |
| 멀티모달 | — | — | — |
| 과학·보안 | 51 | 2 |
분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.
벤치마크 점수
22개 · 프로필별 순위코딩
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | Artificial Analysis | 55.4% | 49 / 97 | 51 | 확인됨 ↗ |
| Terminal-Bench Hard | Artificial Analysis | 39.4% | 30 / 93 | 69 | 확인됨 ↗ |
| SciCode | Artificial Analysis | 50.1% | 43 / 84 | 50 | 확인됨 ↗ |
| SWE-bench Pro | Public 731 | 56.2% | 36 / 63 | 44 | 확인됨 ↗ |
| Terminal-Bench 2.0 | HF 리더보드 | 57% | 9 / 32 | 74 | 확인됨 ↗ |
| SWE-bench Multilingual | HF 리더보드 | 76.5% | 6 / 26 | 80 | 확인됨 ↗ |
에이전트
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| GDPval-AA | Artificial Analysis | 25.7% | 56 / 104 | 47 | 확인됨 ↗ |
| APEX Agents | Artificial Analysis | 10.6% | 20 / 22 | 10 | 확인됨 ↗ |
| WildClawBench | HF 리더보드 | 33.8% | 19 / 22 | 14 | 인용 ↗ |
| Claw-Eval | HF 리더보드 | 49.7% | 20 / 21 | 5 | 인용 ↗ |
| SkillsBench | HF 리더보드 | 34.9% | 11 / 11 | 0 | 인용 ↗ |
추론·지식
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Humanity's Last Exam | Artificial Analysis | 29.6% | 62 / 141 | 56 | 확인됨 ↗ |
| Intelligence Index | Artificial Analysis | 22.8 | 72 / 141 | 49 | 확인됨 ↗ |
| AA-LCR | Artificial Analysis | 78.3% | 50 / 139 | 64 | 확인됨 ↗ |
| CritPT | Artificial Analysis | 0.6% | 95 / 139 | 32 | 확인됨 ↗ |
| GPQA Diamond | Artificial Analysis | 87.4% | 49 / 130 | 63 | 확인됨 ↗ |
| IFBench | Artificial Analysis | 75.7% | 14 / 97 | 86 | 확인됨 ↗ |
| τ²-Bench Telecom | Artificial Analysis | 84.8% | 47 / 96 | 52 | 확인됨 ↗ |
과학·보안
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| AA-Omniscience Accuracy | Artificial Analysis | 26.8% | 66 / 139 | 53 | 확인됨 ↗ |
| AA-Omniscience Index | Artificial Analysis | 0.8 | 50 / 139 | 64 | 확인됨 ↗ |
속도·비용
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Artificial Analysis Output Speed | Artificial Analysis | 58 tok/s | 75 / 108 | 31 | 확인됨 ↗ |
| Artificial Analysis Time to First Chunk | Artificial Analysis | 1.42초 | 17 / 108 | 85 | 확인됨 ↗ |
순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.
Hugging Face 다운로드 추이
30일 변화 -530.4K (-36.0%)Hugging Face가 제공하는 최근 30일 다운로드 집계를 매일 기록한 값입니다(누적 다운로드가 아님).
레이팅이 비슷한 모델
- Gemini 3 Flash 91위 · 1049 비교
- Solar Pro 4 92위 · 1044 비교
- Nemotron 3 Ultra (550B A55B) 93위 · 1043 비교
- Solar Mini 4 95위 · 1042 비교
- MiMo-V2.5 96위 · 1031 비교
- Qwen3.5-397B-A17B 97위 · 1024 비교
MiniMax의 다른 모델
공급사 →- MiniMax-M3 2026-06-02 · 1187
- MiniMax-M2.5 2026-02-12 · 965
- MiniMax-M2.1 2025-12-20 · 923
- MiniMax-M2 2025-10-22 · 821