벤치마크 · 에이전트

APEX Agents

도구와 실행 환경을 사용하는 AI 에이전트가 계획을 세우고 여러 단계의 작업을 끝까지 수행하는지 평가합니다.

측정 모델 32개 · 프로필 2개 · 데이터 기준 2026년 10월 9일

Artificial Analysis 대표

원문 출처 ↗

Artificial Analysis가 같은 조건으로 측정한 API 평가 스냅샷입니다. 높을수록 좋습니다.

현재 최고점: 상용 Qwen3.8 Max 42.4% · 오픈 Kimi-K3 41.3% → 상용이 1.1%p 앞섭니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1Qwen3.8 MaxAlibaba (Qwen) · 상용 APIAPI42.4%1002026-08-02확인됨 ↗
2Kimi-K3Moonshot AI (Kimi) · 오픈 웨이트오픈41.3%952026-06-13확인됨 ↗
3GPT-5.6 TerraOpenAI · 상용 APIAPI38.9%902026-07-09확인됨 ↗
4GPT-5.5OpenAI · 상용 APIAPI37.7%862026-04-23확인됨 ↗
5GPT-5.6 LunaOpenAI · 상용 APIAPI35.8%812026-07-09확인됨 ↗
6GLM-5.2Z.ai (GLM) · 오픈 웨이트오픈33.7%762026-06-16확인됨 ↗
7GPT-5.4OpenAI · 상용 APIAPI33.3%712026-03-05확인됨 ↗
8Claude Opus 4.6Anthropic · 상용 APIAPI33.0%672026-02-05확인됨 ↗
9Gemini 3.1 Pro PreviewGoogle · 상용 APIAPI32.0%622026-02-19확인됨 ↗
10Kimi-K2.6Moonshot AI (Kimi) · 오픈 웨이트오픈28.5%572026-04-14확인됨 ↗
11GPT-5.4 miniOpenAI · 상용 APIAPI28.2%522026-03-17확인됨 ↗
12Claude Sonnet 4.6Anthropic · 상용 APIAPI28.0%482026-02-17확인됨 ↗
13GPT-5.4 nanoOpenAI · 상용 APIAPI24.9%432026-03-17확인됨 ↗
14Qwen3.7-PlusAlibaba (Qwen) · 상용 APIAPI22.4%382026-05-31확인됨 ↗
15Step-3.7-FlashStepFun · 오픈 웨이트오픈14.8%332026-05-23확인됨 ↗
16DeepSeek-V3.2DeepSeek · 오픈 웨이트오픈14.5%292025-12-01확인됨 ↗
17GLM-5Z.ai (GLM) · 오픈 웨이트오픈14.5%242026-02-11확인됨 ↗
18Gemini 3.1 Flash-LiteGoogle · 상용 APIAPI12.2%192026-03-03확인됨 ↗
19Kimi-K2.5Moonshot AI (Kimi) · 오픈 웨이트오픈11.5%142026-01-01확인됨 ↗
20MiniMax-M2.7MiniMax · 오픈 웨이트오픈10.6%102026-04-09확인됨 ↗
21MiMo-V2.5-ProXiaomi (MiMo) · 오픈 웨이트오픈2.4%52026-04-27확인됨 ↗
22Nemotron 3 Super (120B A12B)NVIDIA · 상용 APIAPI1.8%02026-03-11확인됨 ↗

HF 리더보드

원문 출처 ↗

같은 Hugging Face 리더보드 데이터셋·과제의 결과만 표시합니다. 높을수록 좋습니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…

마커: 원 = 오픈 웨이트, 사각 = 상용 API, 빈 마커 = 검증되지 않은 값. 점을 누르면 모델 상세로 이동합니다. 백분위는 이 프로필 안에서의 상대 위치입니다.