AI AI 해설
2026년 10월 9일 생성종합 1170의 오픈 웨이트 모델, 에이전트 평가는 신중한 해석 필요
종합 평가
종합 레이팅은 1170(13위), 가중 비교는 5다. 비슷한 모델로 Claude Opus 5 1206(11위), Gemini 3.7 Flash 1195(12위), Qwen3.8-27B 1162(14위), MiniMax-M3 1161(15위)가 제시됐다.
분야별 특성
코딩 1130, 에이전트 990(12위), 추론·지식 1055, 과학·보안 1007이다. 멀티모달은 자료 없음으로, 관련 업무 적합성을 이 입력만으로 판단하기 어렵다.
벤치 근거
Terminal-Bench 2.1은 LLM Stats 집계에서 87.9%(미검증)·6/37, HF 리더보드에서 87.9%·4/28이다. 프로필이 달라 순위를 직접 비교하면 안 된다. NL2Repo는 61.1%(미검증)·2/5이며, 나머지 Z.ai 공개 평가는 모두 미검증이다.
도입 전 확인
오픈 웨이트이며 라이선스는 mit다. 컨텍스트, 최대 출력, 입력·출력 가격은 자료 없음이다. 같은 공급사의 최신 모델로 DeepSeek-V4.1-Flash와 DeepSeek-V4-Flash-Vision-Exp가 제시돼 함께 검토할 수 있다.
수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.
분야별 레이팅
비슷한 모델과 비교 →| 분야 | 레이팅 | 분야 순위 | 벤치 수 |
|---|---|---|---|
| 코딩 | 29 | 5 | |
| 에이전트 | 34 | 8 | |
| 추론·지식 | 12 | 12 | |
| 멀티모달 | — | — | — |
| 과학·보안 | 27 | 4 |
분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.
벤치마크 점수
32개 · 프로필별 순위코딩
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | Artificial Analysis | 78.7% | 24 / 97 | 77 | 확인됨 ↗ |
| SciCode | Artificial Analysis | 51.0% | 38 / 84 | 55 | 확인됨 ↗ |
| Terminal-Bench 2.1 | LLM Stats 집계 | 87.9% | 8 / 43 | 83 | 자기보고 ↗ |
| Terminal-Bench 2.1 | HF 리더보드 | 87.9% | 4 / 28 | 89 | 확인됨 ↗ |
| DeepSWE | LLM Stats 집계 | 62.7% | 6 / 13 | 58 | 자기보고 ↗ |
에이전트
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| GDPval-AA | Artificial Analysis | 47.7% | 26 / 104 | 76 | 확인됨 ↗ |
| Toolathlon | LLM Stats 집계 | 74.1% | 3 / 38 | 93 | 자기보고 ↗ |
| AutomationBench | LLM Stats 집계 | 31.8% | 12 / 24 | 52 | 자기보고 ↗ |
| Agents' Last Exam | LLM Stats 집계 | 25.7% | 19 / 21 | 10 | 자기보고 ↗ |
| GDPval-AA v2 | Z.ai 공개 평가 | 1,590 | 5 / 7 | 33 | 인용 ↗ |
| Agents' Last Exam · CLI | Z.ai 공개 평가 | 25.7% | 5 / 7 | 42 | 인용 ↗ |
| AutomationBench 1.0.6 | Z.ai 공개 평가 | 43.2% | 5 / 7 | 33 | 인용 ↗ |
| Toolathlon Verified | Z.ai 공개 평가 | 74.1% | 5 / 7 | 33 | 인용 ↗ |
추론·지식
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Humanity's Last Exam | Artificial Analysis | 41.0% | 31 / 141 | 79 | 확인됨 ↗ |
| Intelligence Index | Artificial Analysis | 36.0 | 34 / 141 | 76 | 확인됨 ↗ |
| AA-LCR | Artificial Analysis | 80.3% | 31 / 139 | 78 | 확인됨 ↗ |
| CritPT | Artificial Analysis | 18% | 24 / 139 | 83 | 확인됨 ↗ |
| GPQA Diamond | Artificial Analysis | 92.8% | 13 / 130 | 90 | 확인됨 ↗ |
| Humanity's Last Exam | LLM Stats 집계 | 60% | 7 / 64 | 90 | 자기보고 ↗ |
| NL2Repo | LLM Stats 집계 | 61.5% | 2 / 22 | 95 | 자기보고 ↗ |
| Humanity's Last Exam (no tools, text-only) | LLM Stats 집계 | 42.7% | 6 / 11 | 50 | 자기보고 ↗ |
| Humanity's Last Exam (with tools, text-only) | LLM Stats 집계 | 60% | 2 / 10 | 89 | 자기보고 ↗ |
| HLE · with tools | Z.ai 공개 평가 | 60% | 4 / 7 | 50 | 인용 ↗ |
| NL2Repo | Z.ai 공개 평가 | 61.1% | 2 / 5 | 75 | 인용 ↗ |
| DSBench-Hard | LLM Stats 집계 | 67.2% | 1 / 3 | 100 | 자기보고 ↗ |
| DSBench-FullStack | LLM Stats 집계 | 71.1% | 1 / 2 | 100 | 자기보고 ↗ |
과학·보안
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| AA-Omniscience Accuracy | Artificial Analysis | 49.1% | 21 / 139 | 86 | 확인됨 ↗ |
| AA-Omniscience Index | Artificial Analysis | 0.8 | 49 / 139 | 65 | 확인됨 ↗ |
| CyberGym | LLM Stats 집계 | 83.3% | 7 / 19 | 67 | 자기보고 ↗ |
| CyberGym | Z.ai 공개 평가 | 83.3% | 4 / 7 | 50 | 인용 ↗ |
속도·비용
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Artificial Analysis Output Speed | Artificial Analysis | 94 tok/s | 45 / 108 | 59 | 확인됨 ↗ |
| Artificial Analysis Time to First Chunk | Artificial Analysis | 1.66초 | 21 / 108 | 81 | 확인됨 ↗ |
순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.
Hugging Face 다운로드 추이
30일 변화 -76.6K (-46.6%)Hugging Face가 제공하는 최근 30일 다운로드 집계를 매일 기록한 값입니다(누적 다운로드가 아님).
레이팅이 비슷한 모델
- DeepSeek-V4.1-Flash 20위 · 1386 비교
- Ling 3.1 Flash 21위 · 1385 비교
- Gemini 3.7 Flash 22위 · 1369 비교
- Claude Haiku 5.5 24위 · 1356 비교
- Atria Dawn Preview 25위 · 1348 비교
- Qwen3.8-2.4T-A95B 26위 · 1338 비교
DeepSeek의 다른 모델
공급사 →- DeepSeek-V4.1-Flash 2026-09-10 · 1386
- DeepSeek-V4-Flash-Vision-Exp 2026-08-31 · 1218
- DeepSeek-V4-Flash-0731 2026-07-31 · 1190
- DeepSeek-V4-Flash-DSpark 2026-06-27
- DeepSeek-V4-Flash-0423 2026-04-23 · 982
- DeepSeek-V4-Flash-Max 2026-04-23 · 1087
- DeepSeek-V4-Pro-Max 2026-04-23 · 1210
- DeepSeek-V4-Pro 2026-04-22 · 1162