Moonshot AI (Kimi) · 모델

Kimi-K3

오픈이미지 입력출시 2026년 6월 13일moonshotai/Kimi-K3Hugging Face ↗
종합 레이팅1369 · 10위가중 비교 24
컨텍스트 창—
가격 (입력 / 출력, 1M 토큰)오픈 웨이트
파라미터2.8TKimiK3ForConditionalGeneration
라이선스other
최근 30일 다운로드1.2M좋아요 11.6K · 7일 -39.8K
벤치 점수51개코딩·에이전트·추론·지식·멀티모달·과학·보안

AI AI 해설

2026년 10월 9일 생성

에이전트 경쟁력이 돋보이지만, 다수 벤치의 미검증 표시에 유의

종합 평가

종합 레이팅은 1259(7위), 가중 비교는 12.5다. 레이팅은 같은 벤치 비교로 만든 상대 지표다. 유사 레이팅 모델은 DeepSeek-V4.1-Flash 1285(5위), Darwin-180B-RSI 1279(6위), Ornith-1.5-397B 1255(8위), Qwen3.8-Flash-Next 1224(9위)다.

분야별 특성

에이전트 레이팅이 1206(2위)로 가장 높은 순위를 기록했다. 코딩은 1137(10위), 추론·지식은 1128(9위)다. 멀티모달은 1003, 과학·보안은 959이며 두 분야의 순위 자료는 없다.

주요 벤치 결과

HF 리더보드에서 GPQA Diamond 93.5%(2/70), Humanity's Last Exam 56%(1/48), DeepSWE 67.5%(5/21), APEX Agents 41%(1/13), RedlineBench 49.3%(1/2)를 기록했다. 출처·하네스가 다른 점수끼리는 직접 비교할 수 없다.

도입 전 확인사항

Terminal-Bench 2.1 88.3%(4/37), MCP Atlas 84.2%(2/33), Toolathlon Verified 76.5%(1/7) 등 다수 결과가 미검증이다. 컨텍스트, 최대 출력, 입력·출력 가격은 자료 없음이다. 오픈 웨이트이며 라이선스는 other로 표시됐다.

수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.

분야레이팅분야 순위비교 수
코딩1208106
에이전트125316.7
추론·지식1210137.3
멀티모달116863
과학·보안960—1
차트를 불러오는 중입니다…

분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.

벤치마크 점수

51개 · 프로필별 순위

코딩

벤치프로필점수순위백분위출처
Terminal-Bench 2.1LLM Stats 집계88.3%6 / 4388자기보고 ↗
DeepSWE 1.1LLM Stats 집계69%12 / 3971인용 ↗
DeepSWEHF 리더보드67.5%5 / 2180확인됨 ↗
FrontierSWELLM Stats 집계81.2%2 / 1794자기보고 ↗
DeepSWELLM Stats 집계67.5%3 / 1383자기보고 ↗
Long-Horizon Terminal BenchHF 리더보드6.01 / 9100인용 ↗
PostTrainBenchLLM Stats 집계36.6%3 / 767자기보고 ↗
Terminal-Bench 3.0Z.ai 공개 평가17.4%5 / 620인용 ↗
PostTrainBenchZ.ai 공개 평가32%5 / 620인용 ↗
SWE-Marathon 1.1Z.ai 공개 평가48.1%2 / 680인용 ↗
SWE-MarathonLLM Stats 집계42%2 / 575자기보고 ↗
Kimi Code Bench v2LLM Stats 집계72.9%1 / 2100자기보고 ↗
RedlineBenchHF 리더보드49.3%1 / 2100확인됨 ↗

에이전트

벤치프로필점수순위백분위출처
BrowseCompLLM Stats 집계91.2%3 / 4796자기보고 ↗
ToolathlonLLM Stats 집계73.2%7 / 3884자기보고 ↗
MCP Atlas · PublicLLM Stats 집계84.2%2 / 3697자기보고 ↗
AutomationBenchLLM Stats 집계30.8%14 / 2443자기보고 ↗
WildClawBenchHF 리더보드54.5%3 / 2290인용 ↗
APEX AgentsHF 리더보드41%1 / 13100확인됨 ↗
DeepSearch QALLM Stats 집계95%2 / 1190자기보고 ↗
APEX-AgentsLLM Stats 집계37.6%1 / 8100자기보고 ↗
GDPval-AA v2Z.ai 공개 평가1,6824 / 750인용 ↗
Agents' Last Exam · CLIZ.ai 공개 평가27.6%3 / 767인용 ↗
AutomationBench 1.0.6Z.ai 공개 평가46.7%2 / 783인용 ↗
Toolathlon VerifiedZ.ai 공개 평가76.5%1 / 7100인용 ↗
AA-BriefcaseLLM Stats 집계1,5481 / 3100인용 ↗

추론·지식

벤치프로필점수순위백분위출처
GPQA DiamondLLM Stats 집계93.5%8 / 9092자기보고 ↗
GPQA DiamondHF 리더보드93.5%2 / 7099확인됨 ↗
Humanity's Last ExamLLM Stats 집계56%11 / 6484자기보고 ↗
Humanity's Last ExamHF 리더보드56%1 / 48100확인됨 ↗
Program BenchLLM Stats 집계77.8%4 / 1375자기보고 ↗
ZEROBenchLLM Stats 집계0.43 / 1383자기보고 ↗
OfficeQA ProLLM Stats 집계63.3%7 / 1245자기보고 ↗
Job BenchLLM Stats 집계52.9%7 / 814자기보고 ↗
HLE · with toolsZ.ai 공개 평가59.8%5 / 733인용 ↗
ProgramBench · Almost SolvedZ.ai 공개 평가17.5%4 / 640인용 ↗
WorldVQALLM Stats 집계51%3 / 660자기보고 ↗
NL2RepoZ.ai 공개 평가58%4 / 538인용 ↗
MLS-Bench LiteLLM Stats 집계48.3%1 / 3100자기보고 ↗
PerceptionBenchLLM Stats 집계58.5%2 / 20자기보고 ↗
DECK-BenchLLM Stats 집계73.5%1 / 150자기보고 ↗
SpreadsheetBench 2LLM Stats 집계34.8%1 / 150자기보고 ↗

멀티모달

벤치프로필점수순위백분위출처
MMMU-ProLLM Stats 집계81.6%7 / 6190자기보고 ↗
CharXiv-RLLM Stats 집계91.3%2 / 4898자기보고 ↗
MathVisionLLM Stats 집계97.8%1 / 34100자기보고 ↗
BabyVisionLLM Stats 집계85.7%2 / 1392자기보고 ↗
ExtractBenchHF 리더보드83.2%6 / 1150인용 ↗
MMMU-Pro (with tools)LLM Stats 집계83.4%2 / 467자기보고 ↗
OmniDocBenchLLM Stats 집계91.1%1 / 150자기보고 ↗

과학·보안

벤치프로필점수순위백분위출처
CyberGymZ.ai 공개 평가80%5 / 733인용 ↗
ExploitBenchZ.ai 공개 평가32.2%5 / 620인용 ↗

순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.

Hugging Face 다운로드 추이

30일 변화 -975.2K (-44.1%)
차트를 불러오는 중입니다…

Hugging Face가 제공하는 최근 30일 다운로드 집계를 매일 기록한 값입니다(누적 다운로드가 아님).

레이팅이 비슷한 모델

Moonshot AI (Kimi)의 다른 모델

공급사 →