AI AI 해설
2026년 10월 9일 생성코딩·에이전트 중심의 오픈 웨이트 모델, 종합 레이팅 910
종합 평가
MiniMax-M2.5의 종합 레이팅은 910(49위), 가중 비교는 4.7이다. 비슷한 모델로 GPT-5.3-Codex 922(47위), MiniMax-M2.1 914(48위), Ornith-1.5-9B 887(50위), Gemini 3.6 Flash 872(51위)가 있다.
분야별 성능
분야 레이팅은 코딩 986, 추론·지식 927(40위), 에이전트 917이다. 멀티모달과 과학·보안은 자료 없음이다.
벤치 결과
GPQA Diamond 85.2%(41/70), SWE-bench Pro 55.4%(40/63), Humanity's Last Exam 19.4%(38/48)다. MMLU-Pro 80.1%, SWE-bench Verified 75.8%, WildClawBench 27.1%, APEX Agents 6.2%는 미검증이다.
도입 시 확인사항
오픈 웨이트이며 라이선스는 other다. 컨텍스트, 최대 출력, 입력·출력 가격은 자료 없음이다. 같은 공급사의 최신 모델로 MiniMax-M3(2026-06-02), MiniMax-M2.7(2026-04-09)이 제시돼 있다.
수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.
분야별 레이팅
비슷한 모델과 비교 →| 분야 | 레이팅 | 분야 순위 | 벤치 수 |
|---|---|---|---|
| 코딩 | 87 | 3 | |
| 에이전트 | 91 | 2 | |
| 추론·지식 | 115 | 10 | |
| 멀티모달 | — | — | — |
| 과학·보안 | 87 | 2 |
분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.
벤치마크 점수
19개 · 프로필별 순위코딩
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Terminal-Bench Hard | Artificial Analysis | 34.8% | 37 / 93 | 60 | 확인됨 ↗ |
| SWE-bench Pro | Public 731 | 55.4% | 40 / 63 | 38 | 확인됨 ↗ |
| SWE-bench Verified | HF 리더보드 | 75.8% | 20 / 53 | 63 | 인용 ↗ |
에이전트
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| WildClawBench | HF 리더보드 | 27.1% | 21 / 22 | 5 | 인용 ↗ |
| APEX Agents | HF 리더보드 | 6.2% | 10 / 13 | 25 | 인용 ↗ |
추론·지식
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Humanity's Last Exam | Artificial Analysis | 20.5% | 89 / 141 | 37 | 확인됨 ↗ |
| Intelligence Index | Artificial Analysis | 22.8 | 71 / 141 | 50 | 확인됨 ↗ |
| AA-LCR | Artificial Analysis | 73.3% | 75 / 139 | 47 | 확인됨 ↗ |
| CritPT | Artificial Analysis | 1.1% | 85 / 139 | 39 | 확인됨 ↗ |
| GPQA Diamond | Artificial Analysis | 84.8% | 67 / 130 | 49 | 확인됨 ↗ |
| IFBench | Artificial Analysis | 71.6% | 31 / 97 | 69 | 확인됨 ↗ |
| τ²-Bench Telecom | Artificial Analysis | 95.3% | 13 / 96 | 87 | 확인됨 ↗ |
| GPQA Diamond | HF 리더보드 | 85.2% | 41 / 70 | 42 | 확인됨 ↗ |
| MMLU-Pro | HF 리더보드 | 80.1% | 36 / 53 | 33 | 인용 ↗ |
| Humanity's Last Exam | HF 리더보드 | 19.4% | 38 / 48 | 21 | 확인됨 ↗ |
과학·보안
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| AA-Omniscience Accuracy | Artificial Analysis | 26.2% | 70 / 139 | 50 | 확인됨 ↗ |
| AA-Omniscience Index | Artificial Analysis | -38.9 | 100 / 139 | 28 | 확인됨 ↗ |
속도·비용
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Artificial Analysis Output Speed | Artificial Analysis | 91 tok/s | 50 / 108 | 54 | 확인됨 ↗ |
| Artificial Analysis Time to First Chunk | Artificial Analysis | 1.42초 | 16 / 108 | 86 | 확인됨 ↗ |
순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.
Hugging Face 다운로드 추이
30일 변화 +179.2K (+50.7%)Hugging Face가 제공하는 최근 30일 다운로드 집계를 매일 기록한 값입니다(누적 다운로드가 아님).
레이팅이 비슷한 모델
- GPT-5.4 nano 120위 · 969 비교
- Laguna-M.1 121위 · 968 비교
- Seed 2.0 Lite 122위 · 968 비교
- LongCat-2.0 124위 · 962 비교
- Gemma 4 31B 125위 · 958 비교
- Step-3.5-Flash 126위 · 951 비교
MiniMax의 다른 모델
공급사 →- MiniMax-M3 2026-06-02 · 1187
- MiniMax-M2.7 2026-04-09 · 1042
- MiniMax-M2.1 2025-12-20 · 923
- MiniMax-M2 2025-10-22 · 821