벤치마크 · 에이전트

AutomationBench

도구·API 호출을 조합해 실제 업무형 과제를 해결하는 에이전트 능력을 평가합니다.

측정 모델 24개 · 프로필 1개 · 데이터 기준 2026년 10월 9일

LLM Stats 집계

원문 출처 ↗

LLM Stats 공개 리더보드의 독립 프로필입니다. 검증·자기보고 여부를 보존합니다. 높을수록 좋습니다.

현재 최고점: 상용 Mistral Large 4 59.9% · 오픈 DeepSeek-V4.1-Flash 54.8% → 상용이 5.1%p 앞섭니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1Mistral Large 4Mistral AI · 상용 APIAPI59.9%1002026-10-06자기보고 ↗
2DeepSeek-V4.1-FlashDeepSeek · 오픈 웨이트오픈54.8%962026-09-10자기보고 ↗
3Atria Dawn PreviewShanghai AI Lab (InternLM) · 오픈 웨이트오픈53.8%912026-09-11자기보고 ↗
4Ling 3.1 FlashinclusionAI (Ant) · 상용 APIAPI52.5%872026-09-30자기보고 ↗
5Muse Spark 1.3Meta · 상용 APIAPI49.4%832026-09-02자기보고 ↗
6GLM-5.3-FlashZ.ai (GLM) · 오픈 웨이트오픈48.8%782026-08-25자기보고 ↗
7GLM-5.3Z.ai (GLM) · 오픈 웨이트오픈48.2%742026-08-25자기보고 ↗
8Claude Sonnet 5.5Anthropic · 상용 APIAPI44.7%702026-09-28자기보고 ↗
9GPT-6 AstraOpenAI · 상용 APIAPI41.4%652026-09-03자기보고 ↗
10Claude Opus 5.5Anthropic · 상용 APIAPI40%612026-09-22자기보고 ↗
11Hy4-previewTencent · 오픈 웨이트오픈32.1%572026-08-27자기보고 ↗
12DeepSeek-V4-Pro-0813DeepSeek · 오픈 웨이트오픈31.8%522026-08-13자기보고 ↗
13Claude Fable 5.1Anthropic · 상용 APIAPI31.4%482026-09-01자기보고 ↗
14Kimi-K3Moonshot AI (Kimi) · 오픈 웨이트오픈30.8%432026-06-13자기보고 ↗
15Gemini 3.7 FlashGoogle · 상용 APIAPI30.4%392026-08-13자기보고 ↗
16Qwen3.8 MaxAlibaba (Qwen) · 상용 APIAPI27.3%352026-08-02자기보고 ↗
17Claude Opus 5Anthropic · 상용 APIAPI26%302026-07-24자기보고 ↗
18DeepSeek-V4-Flash-Vision-ExpDeepSeek · 오픈 웨이트오픈25.7%262026-08-31자기보고 ↗
19DeepSeek-V4-Flash-0731DeepSeek · 오픈 웨이트오픈25.1%222026-07-31자기보고 ↗
20GPT-5.6 SolOpenAI · 상용 APIAPI18.1%172026-07-09자기보고 ↗
21Claude Fable 5Anthropic · 상용 APIAPI17.4%132026-06-12자기보고 ↗
22GPT-5.6 TerraOpenAI · 상용 APIAPI15.2%92026-07-09자기보고 ↗
23GPT-5.6 LunaOpenAI · 상용 APIAPI14.9%42026-07-09자기보고 ↗
24Claude Sonnet 5Anthropic · 상용 APIAPI13.5%02026-06-30자기보고 ↗

마커: 원 = 오픈 웨이트, 사각 = 상용 API, 빈 마커 = 검증되지 않은 값. 점을 누르면 모델 상세로 이동합니다. 백분위는 이 프로필 안에서의 상대 위치입니다.