AI AI 해설
2026년 10월 9일 생성추론·지식에 강점이 보이지만 사양·멀티모달 자료는 제한적
종합 평가
종합 레이팅 1058(25위), 가중 비교 7.7이다. 비슷한 모델은 GLM-5.1 1078(23위), Claude Opus 4.8 1076(24위), GLM-5 1055(26위), Ornith-1.5-35B-A3B 1054(27위)다.
분야별 특성
추론·지식은 1107(12위), 코딩은 1026(31위), 에이전트는 927이다. 멀티모달과 과학·보안은 자료 없음이다. 레이팅은 같은 벤치 비교로 만든 상대 지표다.
벤치 결과
HF 리더보드에서 GPQA Diamond 88.1%, MMLU-Pro 86.4%, SWE-bench Verified 79%, Terminal-Bench 2.0 56.9%, SWE-bench Multilingual 73.3%다. SWE-bench Pro는 Public 731 프로필에서 52.6%로, 다른 프로필 점수와 직접 비교할 수 없다.
도입 전 확인점
컨텍스트, 최대 출력, 입력·출력 가격은 자료 없음이다. 라이선스는 mit이며 오픈 웨이트다. Claw-Eval 57.8%, SkillsBench 44.7%, Long-Horizon Terminal Bench 2.0은 미검증 결과이므로 해석에 주의가 필요하다.
수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.
분야별 레이팅
비슷한 모델과 비교 →| 분야 | 레이팅 | 분야 순위 | 벤치 수 |
|---|---|---|---|
| 코딩 | 76 | 5 | |
| 에이전트 | 86 | 2 | |
| 추론·지식 | 66 | 3 | |
| 멀티모달 | — | — | — |
| 과학·보안 | — | — | — |
분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.
벤치마크 점수
10개 · 프로필별 순위코딩
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| SWE-bench Pro | Public 731 | 52.6% | 46 / 63 | 27 | 확인됨 ↗ |
| SWE-bench Verified | HF 리더보드 | 79% | 9 / 53 | 84 | 확인됨 ↗ |
| Terminal-Bench 2.0 | HF 리더보드 | 56.9% | 10 / 32 | 71 | 확인됨 ↗ |
| SWE-bench Multilingual | HF 리더보드 | 73.3% | 10 / 26 | 62 | 확인됨 ↗ |
| Long-Horizon Terminal Bench | HF 리더보드 | 2.0 | 5 / 9 | 44 | 인용 ↗ |
에이전트
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Claw-Eval | HF 리더보드 | 57.8% | 17 / 21 | 18 | 인용 ↗ |
| SkillsBench | HF 리더보드 | 44.7% | 9 / 11 | 20 | 인용 ↗ |
추론·지식
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| GPQA Diamond | HF 리더보드 | 88.1% | 22 / 70 | 70 | 확인됨 ↗ |
| MMLU-Pro | HF 리더보드 | 86.4% | 10 / 53 | 83 | 확인됨 ↗ |
| Humanity's Last Exam | HF 리더보드 | 34.8% | 11 / 48 | 79 | 확인됨 ↗ |
순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.
Hugging Face 다운로드 추이
30일 변화 -734.6K (-43.2%)Hugging Face가 제공하는 최근 30일 다운로드 집계를 매일 기록한 값입니다(누적 다운로드가 아님).
레이팅이 비슷한 모델
- Gemini 3 Pro 81위 · 1085 비교
- Ornith-1.5-35B-A3B 82위 · 1081 비교
- GLM-5 83위 · 1081 비교
- Laguna-S-2.1 85위 · 1073 비교
- GPT-5.4 mini 86위 · 1072 비교
- Kimi-K2.5 87위 · 1062 비교
DeepSeek의 다른 모델
공급사 →- DeepSeek-V4.1-Flash 2026-09-10 · 1386
- DeepSeek-V4-Flash-Vision-Exp 2026-08-31 · 1218
- DeepSeek-V4-Pro-0813 2026-08-13 · 1357
- DeepSeek-V4-Flash-0731 2026-07-31 · 1190
- DeepSeek-V4-Flash-DSpark 2026-06-27
- DeepSeek-V4-Flash-0423 2026-04-23 · 982
- DeepSeek-V4-Flash-Max 2026-04-23 · 1087
- DeepSeek-V4-Pro-Max 2026-04-23 · 1210