벤치마크 · 에이전트

MCP Atlas · Public

도구·API 호출을 조합해 실제 업무형 과제를 해결하는 에이전트 능력을 평가합니다.

측정 모델 37개 · 프로필 2개 · 데이터 기준 2026년 10월 9일

LLM Stats 집계 대표

원문 출처 ↗

LLM Stats 공개 리더보드의 독립 프로필입니다. 검증·자기보고 여부를 보존합니다. 높을수록 좋습니다.

현재 최고점: 상용 Muse Spark 1.1 88.1% · 오픈 Kimi-K3 84.2% → 상용이 3.9%p 앞섭니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1Muse Spark 1.1Meta · 상용 APIAPI88.1%1002026-07-09자기보고 ↗
2Kimi-K3Moonshot AI (Kimi) · 오픈 웨이트오픈84.2%972026-06-13자기보고 ↗
3Seed 2.1 ProByteDance (Seed) · 상용 APIAPI83.8%942026-06-24자기보고 ↗
4Hy4-previewTencent · 오픈 웨이트오픈83.7%912026-08-27자기보고 ↗
5Gemini 3.5 FlashGoogle · 상용 APIAPI83.6%892026-05-19자기보고 ↗
6Claude Opus 4.8Anthropic · 상용 APIAPI82.2%862026-05-14자기보고 ↗
7Seed 2.1 TurboByteDance (Seed) · 상용 APIAPI80.3%832026-06-24자기보고 ↗
8Inkling-SmallThinking Machines · 오픈 웨이트오픈79.6%802026-07-27자기보고 ↗
9Hy3Tencent · 오픈 웨이트오픈79.1%772026-07-02자기보고 ↗
10Claude Opus 4.7Anthropic · 상용 APIAPI77.3%742026-04-16자기보고 ↗
11GLM-5.2Z.ai (GLM) · 오픈 웨이트오픈76.8%712026-06-16자기보고 ↗
12Qwen3.7 MaxAlibaba (Qwen) · 상용 APIAPI76.4%692026-05-19자기보고 ↗
13InklingThinking Machines · 오픈 웨이트오픈76%642026-07-14자기보고 ↗
14Kimi-K2.7-CodeMoonshot AI (Kimi) · 오픈 웨이트오픈76%642026-06-11자기보고 ↗
15Muse-Glimmer-30BMeta · 오픈 웨이트오픈75.5%602026-08-09자기보고 ↗
16GPT-5.5OpenAI · 상용 APIAPI75.3%572026-04-23자기보고 ↗
17MiniMax-M3MiniMax · 오픈 웨이트오픈74.2%542026-06-02자기보고 ↗
18Qwen3.6 PlusAlibaba (Qwen) · 상용 APIAPI74.1%512026-04-02자기보고 ↗
19DeepSeek-V4-Pro-MaxDeepSeek · 오픈 웨이트오픈73.6%492026-04-23자기보고 ↗
20Qwen3.7-PlusAlibaba (Qwen) · 상용 APIAPI73.2%462026-05-31자기보고 ↗
21GLM-5.1Z.ai (GLM) · 오픈 웨이트오픈71.8%432026-04-03자기보고 ↗
22Gemini 3.1 ProGoogle · 상용 APIAPI69.2%402026-02-19자기보고 ↗
23DeepSeek-V4-Flash-MaxDeepSeek · 오픈 웨이트오픈69%372026-04-23자기보고 ↗
24GLM-5Z.ai (GLM) · 오픈 웨이트오픈67.8%342026-02-11자기보고 ↗
25DeepSeek-V4-Flash-0423DeepSeek · 오픈 웨이트오픈67.4%312026-04-23자기보고 ↗
26GPT-5.4OpenAI · 상용 APIAPI67.2%292026-03-05자기보고 ↗
27Ling-3.0-flashinclusionAI (Ant) · 오픈 웨이트오픈65.5%262026-08-02자기보고 ↗
28Qwen3.6-35B-A3BAlibaba (Qwen) · 오픈 웨이트오픈62.8%232026-04-15자기보고 ↗
29Claude Opus 4.6Anthropic · 상용 APIAPI62.7%202026-02-05자기보고 ↗
30Claude Opus 4.5Anthropic · 상용 APIAPI62.3%172025-11-24자기보고 ↗
31Claude Sonnet 4.6Anthropic · 상용 APIAPI61.3%142026-02-17자기보고 ↗
32GPT-5.2OpenAI · 상용 APIAPI60.6%112025-12-11자기보고 ↗
33GPT-5.4 miniOpenAI · 상용 APIAPI57.7%92026-03-17자기보고 ↗
34Gemini 3 FlashGoogle · 상용 APIAPI57.4%62025-12-17자기보고 ↗
35GPT-5.4 nanoOpenAI · 상용 APIAPI56.1%32026-03-17자기보고 ↗
36Nova 2 LiteAmazon · 상용 APIAPI24.6%02025-12-02자기보고 ↗

Muse 공개 평가

원문 출처 ↗

공급자가 같은 표에서 공개한 특정 평가 설정의 결과입니다. 하네스가 다른 리더보드 점수와 합치지 않습니다. 높을수록 좋습니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1Muse-Glimmer-30BMeta · 오픈 웨이트오픈75.5%1002026-08-09확인됨 ↗
2Qwen3.6-27BAlibaba (Qwen) · 오픈 웨이트오픈62.5%02026-04-21인용 ↗

마커: 원 = 오픈 웨이트, 사각 = 상용 API, 빈 마커 = 검증되지 않은 값. 점을 누르면 모델 상세로 이동합니다. 백분위는 이 프로필 안에서의 상대 위치입니다.