Kimi-K3
AI AI 해설
2026년 10월 9일 생성에이전트 경쟁력이 돋보이지만, 다수 벤치의 미검증 표시에 유의
종합 평가
종합 레이팅은 1259(7위), 가중 비교는 12.5다. 레이팅은 같은 벤치 비교로 만든 상대 지표다. 유사 레이팅 모델은 DeepSeek-V4.1-Flash 1285(5위), Darwin-180B-RSI 1279(6위), Ornith-1.5-397B 1255(8위), Qwen3.8-Flash-Next 1224(9위)다.
분야별 특성
에이전트 레이팅이 1206(2위)로 가장 높은 순위를 기록했다. 코딩은 1137(10위), 추론·지식은 1128(9위)다. 멀티모달은 1003, 과학·보안은 959이며 두 분야의 순위 자료는 없다.
주요 벤치 결과
HF 리더보드에서 GPQA Diamond 93.5%(2/70), Humanity's Last Exam 56%(1/48), DeepSWE 67.5%(5/21), APEX Agents 41%(1/13), RedlineBench 49.3%(1/2)를 기록했다. 출처·하네스가 다른 점수끼리는 직접 비교할 수 없다.
도입 전 확인사항
Terminal-Bench 2.1 88.3%(4/37), MCP Atlas 84.2%(2/33), Toolathlon Verified 76.5%(1/7) 등 다수 결과가 미검증이다. 컨텍스트, 최대 출력, 입력·출력 가격은 자료 없음이다. 오픈 웨이트이며 라이선스는 other로 표시됐다.
수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.
분야별 레이팅
비슷한 모델과 비교 →| 분야 | 레이팅 | 분야 순위 | 비교 수 |
|---|---|---|---|
| 코딩 | 10 | 6 | |
| 에이전트 | 1 | 6.7 | |
| 추론·지식 | 13 | 7.3 | |
| 멀티모달 | 6 | 3 | |
| 과학·보안 | — | 1 |
분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.
벤치마크 점수
51개 · 프로필별 순위코딩
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | LLM Stats 집계 | 88.3% | 6 / 43 | 88 | 자기보고 ↗ |
| DeepSWE 1.1 | LLM Stats 집계 | 69% | 12 / 39 | 71 | 인용 ↗ |
| DeepSWE | HF 리더보드 | 67.5% | 5 / 21 | 80 | 확인됨 ↗ |
| FrontierSWE | LLM Stats 집계 | 81.2% | 2 / 17 | 94 | 자기보고 ↗ |
| DeepSWE | LLM Stats 집계 | 67.5% | 3 / 13 | 83 | 자기보고 ↗ |
| Long-Horizon Terminal Bench | HF 리더보드 | 6.0 | 1 / 9 | 100 | 인용 ↗ |
| PostTrainBench | LLM Stats 집계 | 36.6% | 3 / 7 | 67 | 자기보고 ↗ |
| Terminal-Bench 3.0 | Z.ai 공개 평가 | 17.4% | 5 / 6 | 20 | 인용 ↗ |
| PostTrainBench | Z.ai 공개 평가 | 32% | 5 / 6 | 20 | 인용 ↗ |
| SWE-Marathon 1.1 | Z.ai 공개 평가 | 48.1% | 2 / 6 | 80 | 인용 ↗ |
| SWE-Marathon | LLM Stats 집계 | 42% | 2 / 5 | 75 | 자기보고 ↗ |
| Kimi Code Bench v2 | LLM Stats 집계 | 72.9% | 1 / 2 | 100 | 자기보고 ↗ |
| RedlineBench | HF 리더보드 | 49.3% | 1 / 2 | 100 | 확인됨 ↗ |
에이전트
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| BrowseComp | LLM Stats 집계 | 91.2% | 3 / 47 | 96 | 자기보고 ↗ |
| Toolathlon | LLM Stats 집계 | 73.2% | 7 / 38 | 84 | 자기보고 ↗ |
| MCP Atlas · Public | LLM Stats 집계 | 84.2% | 2 / 36 | 97 | 자기보고 ↗ |
| AutomationBench | LLM Stats 집계 | 30.8% | 14 / 24 | 43 | 자기보고 ↗ |
| WildClawBench | HF 리더보드 | 54.5% | 3 / 22 | 90 | 인용 ↗ |
| APEX Agents | HF 리더보드 | 41% | 1 / 13 | 100 | 확인됨 ↗ |
| DeepSearch QA | LLM Stats 집계 | 95% | 2 / 11 | 90 | 자기보고 ↗ |
| APEX-Agents | LLM Stats 집계 | 37.6% | 1 / 8 | 100 | 자기보고 ↗ |
| GDPval-AA v2 | Z.ai 공개 평가 | 1,682 | 4 / 7 | 50 | 인용 ↗ |
| Agents' Last Exam · CLI | Z.ai 공개 평가 | 27.6% | 3 / 7 | 67 | 인용 ↗ |
| AutomationBench 1.0.6 | Z.ai 공개 평가 | 46.7% | 2 / 7 | 83 | 인용 ↗ |
| Toolathlon Verified | Z.ai 공개 평가 | 76.5% | 1 / 7 | 100 | 인용 ↗ |
| AA-Briefcase | LLM Stats 집계 | 1,548 | 1 / 3 | 100 | 인용 ↗ |
추론·지식
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| GPQA Diamond | LLM Stats 집계 | 93.5% | 8 / 90 | 92 | 자기보고 ↗ |
| GPQA Diamond | HF 리더보드 | 93.5% | 2 / 70 | 99 | 확인됨 ↗ |
| Humanity's Last Exam | LLM Stats 집계 | 56% | 11 / 64 | 84 | 자기보고 ↗ |
| Humanity's Last Exam | HF 리더보드 | 56% | 1 / 48 | 100 | 확인됨 ↗ |
| Program Bench | LLM Stats 집계 | 77.8% | 4 / 13 | 75 | 자기보고 ↗ |
| ZEROBench | LLM Stats 집계 | 0.4 | 3 / 13 | 83 | 자기보고 ↗ |
| OfficeQA Pro | LLM Stats 집계 | 63.3% | 7 / 12 | 45 | 자기보고 ↗ |
| Job Bench | LLM Stats 집계 | 52.9% | 7 / 8 | 14 | 자기보고 ↗ |
| HLE · with tools | Z.ai 공개 평가 | 59.8% | 5 / 7 | 33 | 인용 ↗ |
| ProgramBench · Almost Solved | Z.ai 공개 평가 | 17.5% | 4 / 6 | 40 | 인용 ↗ |
| WorldVQA | LLM Stats 집계 | 51% | 3 / 6 | 60 | 자기보고 ↗ |
| NL2Repo | Z.ai 공개 평가 | 58% | 4 / 5 | 38 | 인용 ↗ |
| MLS-Bench Lite | LLM Stats 집계 | 48.3% | 1 / 3 | 100 | 자기보고 ↗ |
| PerceptionBench | LLM Stats 집계 | 58.5% | 2 / 2 | 0 | 자기보고 ↗ |
| DECK-Bench | LLM Stats 집계 | 73.5% | 1 / 1 | 50 | 자기보고 ↗ |
| SpreadsheetBench 2 | LLM Stats 집계 | 34.8% | 1 / 1 | 50 | 자기보고 ↗ |
멀티모달
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| MMMU-Pro | LLM Stats 집계 | 81.6% | 7 / 61 | 90 | 자기보고 ↗ |
| CharXiv-R | LLM Stats 집계 | 91.3% | 2 / 48 | 98 | 자기보고 ↗ |
| MathVision | LLM Stats 집계 | 97.8% | 1 / 34 | 100 | 자기보고 ↗ |
| BabyVision | LLM Stats 집계 | 85.7% | 2 / 13 | 92 | 자기보고 ↗ |
| ExtractBench | HF 리더보드 | 83.2% | 6 / 11 | 50 | 인용 ↗ |
| MMMU-Pro (with tools) | LLM Stats 집계 | 83.4% | 2 / 4 | 67 | 자기보고 ↗ |
| OmniDocBench | LLM Stats 집계 | 91.1% | 1 / 1 | 50 | 자기보고 ↗ |
과학·보안
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| CyberGym | Z.ai 공개 평가 | 80% | 5 / 7 | 33 | 인용 ↗ |
| ExploitBench | Z.ai 공개 평가 | 32.2% | 5 / 6 | 20 | 인용 ↗ |
순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.
Hugging Face 다운로드 추이
30일 변화 -975.2K (-44.1%)Hugging Face가 제공하는 최근 30일 다운로드 집계를 매일 기록한 값입니다(누적 다운로드가 아님).
레이팅이 비슷한 모델
- Claude Opus 5 7위 · 1395 비교
- GLM-5.3 8위 · 1390 비교
- Muse Spark 1.3 9위 · 1385 비교
- Claude Mythos Preview 11위 · 1357 비교
- Qwen3.8 Max 12위 · 1353 비교
- DeepSeek-V4.1-Flash 13위 · 1346 비교
Moonshot AI (Kimi)의 다른 모델
공급사 →- Kimi-K2.7-Code 2026-06-11 · 1095
- Kimi-K2.6 2026-04-14 · 1175
- Kimi-K2.5 2026-01-01 · 1045
- Kimi-K2-Thinking 2025-11-04
- Kimi K2-Thinking-0905 2025-09-05 · 993
- Kimi-K2-Instruct 2025-07-11