벤치마크 · 코딩

Terminal-Bench 4.0

터미널 환경에서 명령을 실행하며 여러 단계의 개발·운영 과제를 끝까지 수행하는지 평가합니다.

측정 모델 21개 · 프로필 1개 · 데이터 기준 2026년 10월 9일

LLM Stats 집계

원문 출처 ↗

LLM Stats 공개 리더보드의 독립 프로필입니다. 검증·자기보고 여부를 보존합니다. 높을수록 좋습니다.

현재 최고점: 상용 Claude Sonnet 5.5 70.6% · 오픈 GLM-5.3 41.8% → 상용이 28.8%p 앞섭니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1Claude Sonnet 5.5Anthropic · 상용 APIAPI70.6%1002026-09-28자기보고 ↗
2Claude Opus 5.5Anthropic · 상용 APIAPI66.4%952026-09-22자기보고 ↗
3GPT-6 AstraOpenAI · 상용 APIAPI57.7%902026-09-03자기보고 ↗
4Claude Fable 5.1Anthropic · 상용 APIAPI55.8%852026-09-01자기보고 ↗
5Claude Opus 5Anthropic · 상용 APIAPI51.8%802026-07-24인용 ↗
6Claude Fable 5Anthropic · 상용 APIAPI44.5%752026-06-12인용 ↗
7GLM-5.3Z.ai (GLM) · 오픈 웨이트오픈41.8%702026-08-25인용 ↗
8Ling 3.1 FlashinclusionAI (Ant) · 상용 APIAPI40.4%652026-09-30자기보고 ↗
9Claude Haiku 5.5Anthropic · 상용 APIAPI39.2%602026-10-07자기보고 ↗
10GPT-5.6 SolOpenAI · 상용 APIAPI37.3%552026-07-09인용 ↗
11MiMo-V2.6-ProXiaomi (MiMo) · 오픈 웨이트오픈34.9%502026-09-22자기보고 ↗
12DeepSeek-V4.1-FlashDeepSeek · 오픈 웨이트오픈31.2%452026-09-10자기보고 ↗
13MiMo-V2.6-FlashXiaomi (MiMo) · 오픈 웨이트오픈28.8%402026-09-22자기보고 ↗
14Mistral Large 4Mistral AI · 상용 APIAPI28.3%352026-10-06자기보고 ↗
15Claude Opus 4.8Anthropic · 상용 APIAPI23.6%302026-05-14인용 ↗
16GPT-5.6 TerraOpenAI · 상용 APIAPI21.5%252026-07-09인용 ↗
17Gemini 3.8 FlashGoogle · 상용 APIAPI19.1%202026-09-02자기보고 ↗
18GPT-5.6 LunaOpenAI · 상용 APIAPI17.3%152026-07-09인용 ↗
19Claude Sonnet 5Anthropic · 상용 APIAPI12.4%82026-06-30인용 ↗
20Grok 4.5xAI · 상용 APIAPI12.4%82026-07-16인용 ↗
21Solar Mini 4Upstage (Solar) · 상용 APIAPI1%02026-09-22인용 ↗

마커: 원 = 오픈 웨이트, 사각 = 상용 API, 빈 마커 = 검증되지 않은 값. 점을 누르면 모델 상세로 이동합니다. 백분위는 이 프로필 안에서의 상대 위치입니다.