벤치마크 · 에이전트

Claw-Eval

도구와 실행 환경을 사용하는 AI 에이전트가 계획을 세우고 여러 단계의 작업을 끝까지 수행하는지 평가합니다.

측정 모델 29개 · 프로필 2개 · 데이터 기준 2026년 10월 9일

HF 리더보드 대표

원문 출처 ↗

같은 Hugging Face 리더보드 데이터셋·과제의 결과만 표시합니다. 높을수록 좋습니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1Ornith-1.5-397Bornith-ai · 오픈 웨이트오픈81.4%1002026-08-18확인됨 ↗
2Ornith-1.0-397Bornith-ai · 오픈 웨이트오픈77.1%952026-06-23인용 ↗
3MiniMax-M3MiniMax · 오픈 웨이트오픈74.5%902026-06-02확인됨 ↗
4dots3-note-prevdots-studio · 오픈 웨이트오픈73.4%852026-08-09확인됨 ↗
5Ornith-1.5-35B-A3Bornith-ai · 오픈 웨이트오픈72.5%802026-08-18확인됨 ↗
6Ornith-1.0-35Bornith-ai · 오픈 웨이트오픈69.8%752026-06-21인용 ↗
7Ornith-1.5-9Bornith-ai · 오픈 웨이트오픈66.5%702026-08-18확인됨 ↗
8MiMo-V2.5-ProXiaomi (MiMo) · 오픈 웨이트오픈64%652026-04-27인용 ↗
9Ring-2.6-1TinclusionAI (Ant) · 오픈 웨이트오픈63.8%602026-05-14확인됨 ↗
10Ornith-1.0-9Bornith-ai · 오픈 웨이트오픈63.1%552026-06-21인용 ↗
11GLM-5.1Z.ai (GLM) · 오픈 웨이트오픈62.7%482026-04-03인용 ↗
12GLM-5.1-MXFP4-Mixed-CT-AutoRoundINCModel3 · 오픈 웨이트오픈62.7%482026-08-31인용 ↗
13MiMo-V2.5Xiaomi (MiMo) · 오픈 웨이트오픈62.1%402026-04-27인용 ↗
14Kimi-K2.6Moonshot AI (Kimi) · 오픈 웨이트오픈61.5%352026-04-14인용 ↗
15DeepSeek-V4-ProDeepSeek · 오픈 웨이트오픈58.4%302026-04-22인용 ↗
16openPangu-2.0-Flashopenpangu · 오픈 웨이트오픈58.2%252026-06-30확인됨 ↗
17DeepSeek-V4-FlashDeepSeek · 오픈 웨이트오픈57.8%182026-04-22인용 ↗
18Qwen3.5-397B-A17BAlibaba (Qwen) · 오픈 웨이트오픈57.8%182026-02-16인용 ↗
19Kimi-K2.5Moonshot AI (Kimi) · 오픈 웨이트오픈52.8%102026-01-01인용 ↗
20MiniMax-M2.7MiniMax · 오픈 웨이트오픈49.7%52026-04-09인용 ↗
21NVIDIA-Nemotron-3-Super-120B-A12B-BF16NVIDIA · 오픈 웨이트오픈6.8%02026-03-10인용 ↗

LLM Stats 집계

원문 출처 ↗

LLM Stats 공개 리더보드의 독립 프로필입니다. 검증·자기보고 여부를 보존합니다. 높을수록 좋습니다.

현재 최고점: 상용 Qwen3.7 Max 65.2% · 오픈 Kimi-K2.6 80.9% → 오픈 모델이 앞섭니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…

마커: 원 = 오픈 웨이트, 사각 = 상용 API, 빈 마커 = 검증되지 않은 값. 점을 누르면 모델 상세로 이동합니다. 백분위는 이 프로필 안에서의 상대 위치입니다.