벤치마크 · 에이전트

WildClawBench

도구와 실행 환경을 사용하는 AI 에이전트가 계획을 세우고 여러 단계의 작업을 끝까지 수행하는지 평가합니다.

측정 모델 24개 · 프로필 2개 · 데이터 기준 2026년 10월 9일

HF 리더보드 대표

원문 출처 ↗

같은 Hugging Face 리더보드 데이터셋·과제의 결과만 표시합니다. 높을수록 좋습니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1dots3-note-prevdots-studio · 오픈 웨이트오픈61.7%1002026-08-09확인됨 ↗
2Qwen3.8-2.4T-A95BAlibaba (Qwen) · 오픈 웨이트오픈56.2%952026-08-08인용 ↗
3Kimi-K3Moonshot AI (Kimi) · 오픈 웨이트오픈54.5%902026-06-13인용 ↗
4GLM-5.2Z.ai (GLM) · 오픈 웨이트오픈54.2%862026-06-16인용 ↗
5Hy3Tencent · 오픈 웨이트오픈53.6%812026-07-02확인됨 ↗
6Nex-N2-Pronex-agi · 오픈 웨이트오픈53.5%762026-06-03인용 ↗
7GLM-5.1Z.ai (GLM) · 오픈 웨이트오픈48.2%712026-04-03인용 ↗
8Qwen3.8-27BAlibaba (Qwen) · 오픈 웨이트오픈48.0%672026-08-05인용 ↗
9Muse-Glimmer-30BMeta · 오픈 웨이트오픈47.6%622026-08-09확인됨 ↗
10Kimi-K2.7-CodeMoonshot AI (Kimi) · 오픈 웨이트오픈46.9%572026-06-11인용 ↗
11Intern-S2-Preview-397BShanghai AI Lab (InternLM) · 오픈 웨이트오픈44.7%522026-07-16인용 ↗
12DeepSeek-V4-ProDeepSeek · 오픈 웨이트오픈43.7%482026-04-22인용 ↗
13Qwen3.6-27BAlibaba (Qwen) · 오픈 웨이트오픈43.2%432026-04-21인용 ↗
14MiMo-V2.5-ProXiaomi (MiMo) · 오픈 웨이트오픈43%382026-04-27인용 ↗
15GLM-5Z.ai (GLM) · 오픈 웨이트오픈42.6%332026-02-11인용 ↗
16openPangu-2.0-Flashopenpangu · 오픈 웨이트오픈41.5%292026-06-30확인됨 ↗
17Intern-S2-PreviewShanghai AI Lab (InternLM) · 오픈 웨이트오픈39.2%242026-05-15인용 ↗
18Qwen3.5-397B-A17BAlibaba (Qwen) · 오픈 웨이트오픈34.5%192026-02-16인용 ↗
19MiniMax-M2.7MiniMax · 오픈 웨이트오픈33.8%142026-04-09인용 ↗
20Kimi-K2.5Moonshot AI (Kimi) · 오픈 웨이트오픈30.8%102026-01-01인용 ↗
21MiniMax-M2.5MiniMax · 오픈 웨이트오픈27.1%52026-02-12인용 ↗
22Step-3.5-FlashStepFun · 오픈 웨이트오픈26.7%02026-02-01인용 ↗

LLM Stats 집계

원문 출처 ↗

LLM Stats 공개 리더보드의 독립 프로필입니다. 검증·자기보고 여부를 보존합니다. 높을수록 좋습니다.

현재 최고점: 상용 Seed 2.1 Turbo 62.8% · 오픈 Hy3 53.6% → 상용이 9.2%p 앞섭니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…

마커: 원 = 오픈 웨이트, 사각 = 상용 API, 빈 마커 = 검증되지 않은 값. 점을 누르면 모델 상세로 이동합니다. 백분위는 이 프로필 안에서의 상대 위치입니다.