벤치마크 · 코딩

SWE-bench Pro

실제 소프트웨어 저장소의 이슈를 분석하고 코드 패치로 해결하는 능력을 평가합니다. 저장소 탐색부터 구현·테스트까지 이어지는 엔지니어링 완성도를 봅니다.

측정 모델 88개 · 프로필 3개 · 데이터 기준 2026년 10월 9일

Public 731 대표

원문 출처 ↗

공개 731문항 결과입니다. 같은 문항 집합이라도 공급자별 에이전트·추론 설정 차이가 있어 출처를 함께 확인하세요. 높을수록 좋습니다.

현재 최고점: 상용 Claude Fable 5.1 81.2% · 오픈 Qwen3.8-2.4T-A95B 67.7% → 상용이 13.5%p 앞섭니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1Claude Fable 5.1Anthropic · 상용 APIAPI81.2%1002026-09-01확인됨 ↗
2Claude Mythos 5Anthropic · 상용 APIAPI80.3%982026-06-12인용 ↗
3Claude Fable 5Anthropic · 상용 APIAPI80%972026-06-12확인됨 ↗
4Claude Opus 5Anthropic · 상용 APIAPI79.2%952026-07-24확인됨 ↗
5Claude Mythos PreviewAnthropic · 상용 APIAPI77.8%942026-05-28인용 ↗
6Claude Opus 4.8Anthropic · 상용 APIAPI69.2%922026-05-14인용 ↗
7Qwen3.8-2.4T-A95BAlibaba (Qwen) · 오픈 웨이트오픈67.7%902026-08-08확인됨 ↗
8Hy4-previewTencent · 오픈 웨이트오픈65.7%892026-08-27확인됨 ↗
9Ornith-1.5-397Bornith-ai · 오픈 웨이트오픈65.1%872026-08-18확인됨 ↗
10GPT-5.6 SolOpenAI · 상용 APIAPI64.6%852026-07-09확인됨 ↗
11Claude Opus 4.7Anthropic · 상용 APIAPI64.3%842026-04-16인용 ↗
12GPT-5.6 TerraOpenAI · 상용 APIAPI63.4%822026-07-09확인됨 ↗
13Claude Sonnet 5Anthropic · 상용 APIAPI63.2%812026-06-30인용 ↗
14GPT-5.6 LunaOpenAI · 상용 APIAPI62.7%792026-07-09확인됨 ↗
15Qwen3.8-Flash-NextAlibaba (Qwen) · 오픈 웨이트오픈62.5%772026-08-24확인됨 ↗
16Ornith-1.0-397Bornith-ai · 오픈 웨이트오픈62.2%762026-06-23인용 ↗
17GLM-5.2Z.ai (GLM) · 오픈 웨이트오픈62.1%742026-06-16확인됨 ↗
18Qwen3.8-27BAlibaba (Qwen) · 오픈 웨이트오픈61.7%732026-08-05확인됨 ↗
19Gemini 3.8 FlashGoogle · 상용 APIAPI61.6%712026-09-02확인됨 ↗
20Nex-N2.5-Pronex-agi · 오픈 웨이트오픈61.2%692026-09-08확인됨 ↗
21dots3-note-prevdots-studio · 오픈 웨이트오픈61%682026-08-09확인됨 ↗
22Gemini 3.7 FlashGoogle · 상용 APIAPI60.4%662026-08-13확인됨 ↗
23Ornith-1.5-35B-A3Bornith-ai · 오픈 웨이트오픈59.6%652026-08-18확인됨 ↗
24GPT-5.5OpenAI · 상용 APIAPI59.4%622026-04-23확인됨 ↗
25Laguna-S-2.1Poolside · 오픈 웨이트오픈59.4%622026-07-13확인됨 ↗
26MiniMax-M3MiniMax · 오픈 웨이트오픈59%602026-06-02확인됨 ↗
27Gemini 3.6 FlashGoogle · 상용 APIAPI58.7%582026-07-21확인됨 ↗
28Kimi-K2.6Moonshot AI (Kimi) · 오픈 웨이트오픈58.6%562026-04-14확인됨 ↗
29GLM-5.1Z.ai (GLM) · 오픈 웨이트오픈58.4%542026-04-03확인됨 ↗
30GLM-5.1-MXFP4-Mixed-CT-AutoRoundINCModel3 · 오픈 웨이트오픈58.4%542026-08-31인용 ↗
31Hy3Tencent · 오픈 웨이트오픈57.9%522026-07-02확인됨 ↗
32MiMo-V2.5-ProXiaomi (MiMo) · 오픈 웨이트오픈57.2%502026-04-27확인됨 ↗
33GPT-5.3-CodexOpenAI · 상용 APIAPI56.8%482026-02-05인용 ↗
34Ling-3.0-flashinclusionAI (Ant) · 오픈 웨이트오픈56.6%472026-08-02확인됨 ↗
35Step-3.7-FlashStepFun · 오픈 웨이트오픈56.3%452026-05-23확인됨 ↗
36MiniMax-M2.7MiniMax · 오픈 웨이트오픈56.2%442026-04-09확인됨 ↗
37MiMo-V2.5Xiaomi (MiMo) · 오픈 웨이트오픈56.1%422026-04-27확인됨 ↗
38Inkling-SmallThinking Machines · 오픈 웨이트오픈55.9%402026-07-27확인됨 ↗
39DeepSeek-V4-ProDeepSeek · 오픈 웨이트오픈55.4%382026-04-22확인됨 ↗
40MiniMax-M2.5MiniMax · 오픈 웨이트오픈55.4%382026-02-12확인됨 ↗
41Gemini 3.5 FlashGoogle · 상용 APIAPI55.1%352026-05-19확인됨 ↗
42InklingThinking Machines · 오픈 웨이트오픈54.3%342026-07-14확인됨 ↗
43Gemini 3.1 Pro PreviewGoogle · 상용 APIAPI54.2%312026-02-19확인됨 ↗
44Gemini 3.5 Flash-LiteGoogle · 상용 APIAPI54.2%312026-07-21확인됨 ↗
45Qwen3.6-27BAlibaba (Qwen) · 오픈 웨이트오픈53.5%292026-04-21확인됨 ↗
46DeepSeek-V4-FlashDeepSeek · 오픈 웨이트오픈52.6%272026-04-22확인됨 ↗
47Muse-Glimmer-30BMeta · 오픈 웨이트오픈51.2%262026-08-09확인됨 ↗
48Kimi-K2.5Moonshot AI (Kimi) · 오픈 웨이트오픈50.7%242026-01-01확인됨 ↗
49Ornith-1.0-35Bornith-ai · 오픈 웨이트오픈50.4%232026-06-21인용 ↗
50Qwen3.6-35B-A3BAlibaba (Qwen) · 오픈 웨이트오픈49.5%212026-04-15확인됨 ↗
51Laguna-M.1Poolside · 오픈 웨이트오픈49.2%192026-06-15확인됨 ↗
52Laguna-XS-2.1Poolside · 오픈 웨이트오픈47.6%182026-06-20확인됨 ↗
53Ornith-1.5-9Bornith-ai · 오픈 웨이트오픈47.5%162026-08-18확인됨 ↗
54Laguna-XS.2Poolside · 오픈 웨이트오픈46.3%152026-04-23확인됨 ↗
55Laguna-XS.2MuVeraAI · 오픈 웨이트오픈44.5%132026-04-28인용 ↗
56Qwen3-Coder-NextAlibaba (Qwen) · 오픈 웨이트오픈44.3%112026-01-30인용 ↗
57Ornith-1.0-9Bornith-ai · 오픈 웨이트오픈42.9%102026-06-21인용 ↗
58North-Mini-Code-1.0Cohere · 오픈 웨이트오픈40.2%82026-06-05확인됨 ↗
59Claude Haiku 4.5Anthropic · 상용 APIAPI39.5%62025-10-15인용 ↗
60Gemini 3.1 Flash-LiteGoogle · 상용 APIAPI38.3%52026-03-03확인됨 ↗
61MiniMax-M2.1MiniMax · 오픈 웨이트오픈36.8%32025-12-20확인됨 ↗
62Kimi-K2-InstructMoonshot AI (Kimi) · 오픈 웨이트오픈27.7%22025-07-11확인됨 ↗
63GLM-4.6Z.ai (GLM) · 오픈 웨이트오픈9.7%02025-09-29확인됨 ↗

LLM Stats 집계

원문 출처 ↗

LLM Stats 공개 리더보드의 독립 프로필입니다. 검증·자기보고 여부를 보존합니다. 높을수록 좋습니다.

현재 최고점: 상용 Claude Opus 5.5 89.9% · 오픈 Hy4-preview 65.7% → 상용이 24.2%p 앞섭니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1Claude Opus 5.5Anthropic · 상용 APIAPI89.9%1002026-09-22자기보고 ↗
2Claude Sonnet 5.5Anthropic · 상용 APIAPI81.3%982026-09-28자기보고 ↗
3Claude Fable 5Anthropic · 상용 APIAPI80%962026-06-12자기보고 ↗
4Claude Mythos PreviewAnthropic · 상용 APIAPI77.8%942026-05-28자기보고 ↗
5Claude Opus 4.8Anthropic · 상용 APIAPI69.2%932026-05-14자기보고 ↗
6Qwen3.8 MaxAlibaba (Qwen) · 상용 APIAPI67.7%912026-08-02자기보고 ↗
7Hy4-previewTencent · 오픈 웨이트오픈65.7%892026-08-27자기보고 ↗
8Claude Haiku 5.5Anthropic · 상용 APIAPI64.8%872026-10-07자기보고 ↗
9Grok 4.5xAI · 상용 APIAPI64.7%852026-07-16자기보고 ↗
10GPT-5.6 SolOpenAI · 상용 APIAPI64.6%832026-07-09자기보고 ↗
11Claude Opus 4.7Anthropic · 상용 APIAPI64.3%812026-04-16자기보고 ↗
12GPT-5.6 TerraOpenAI · 상용 APIAPI63.4%802026-07-09자기보고 ↗
13Claude Sonnet 5Anthropic · 상용 APIAPI63.2%782026-06-30자기보고 ↗
14GPT-5.6 LunaOpenAI · 상용 APIAPI62.7%762026-07-09자기보고 ↗
15Qwen3.8 FlashAlibaba (Qwen) · 상용 APIAPI62.5%732026-08-26자기보고 ↗
16Qwen3.8-Flash-NextAlibaba (Qwen) · 오픈 웨이트오픈62.5%732026-08-24자기보고 ↗
17GLM-5.2Z.ai (GLM) · 오픈 웨이트오픈62.1%702026-06-16자기보고 ↗
18Qwen3.8-27BAlibaba (Qwen) · 오픈 웨이트오픈61.7%692026-08-05자기보고 ↗
19Muse Spark 1.1Meta · 상용 APIAPI61.5%672026-07-09자기보고 ↗
20Qwen3.7 MaxAlibaba (Qwen) · 상용 APIAPI60.6%652026-05-19자기보고 ↗
21Atria Dawn PreviewShanghai AI Lab (InternLM) · 오픈 웨이트오픈59.6%632026-09-11자기보고 ↗
22Laguna-S-2.1Poolside · 오픈 웨이트오픈59.4%612026-07-13자기보고 ↗
23MiniMax-M3MiniMax · 오픈 웨이트오픈59%592026-06-02자기보고 ↗
24Gemini 3.6 FlashGoogle · 상용 APIAPI58.7%572026-07-21자기보고 ↗
25GPT-5.5OpenAI · 상용 APIAPI58.6%552026-04-23자기보고 ↗
26Kimi-K2.6Moonshot AI (Kimi) · 오픈 웨이트오픈58.6%552026-04-14자기보고 ↗
27GLM-5.1Z.ai (GLM) · 오픈 웨이트오픈58.4%522026-04-03자기보고 ↗
28Hy3Tencent · 오픈 웨이트오픈57.9%502026-07-02자기보고 ↗
29GPT-5.4OpenAI · 상용 APIAPI57.7%482026-03-05자기보고 ↗
30Qwen3.7-PlusAlibaba (Qwen) · 상용 APIAPI57.6%462026-05-31자기보고 ↗
31Seed 2.1 ProByteDance (Seed) · 상용 APIAPI57.5%442026-06-24자기보고 ↗
32Seed 2.1 TurboByteDance (Seed) · 상용 APIAPI57%432026-06-24자기보고 ↗
33GPT-5.3-CodexOpenAI · 상용 APIAPI56.8%412026-02-05자기보고 ↗
34Ling-3.0-flashinclusionAI (Ant) · 오픈 웨이트오픈56.6%382026-08-02자기보고 ↗
35Qwen3.6 PlusAlibaba (Qwen) · 상용 APIAPI56.6%382026-04-02자기보고 ↗
36Step-3.7-FlashStepFun · 오픈 웨이트오픈56.3%352026-05-23자기보고 ↗
37Inkling-SmallThinking Machines · 오픈 웨이트오픈55.9%332026-07-27자기보고 ↗
38DeepSeek-V4-Pro-MaxDeepSeek · 오픈 웨이트오픈55.4%312026-04-23자기보고 ↗
39Gemini 3.5 FlashGoogle · 상용 APIAPI55.1%302026-05-19자기보고 ↗
40GPT-5.4 miniOpenAI · 상용 APIAPI54.4%282026-03-17자기보고 ↗
41Gemini 3.1 ProGoogle · 상용 APIAPI54.2%252026-02-19자기보고 ↗
42Gemini 3.5 Flash-LiteGoogle · 상용 APIAPI54.2%252026-07-21자기보고 ↗
43Qwen3.6-27BAlibaba (Qwen) · 오픈 웨이트오픈53.5%222026-04-21자기보고 ↗
44MAI-Thinking-1Microsoft · 상용 APIAPI52.8%202026-06-02자기보고 ↗
45DeepSeek-V4-Flash-MaxDeepSeek · 오픈 웨이트오픈52.6%192026-04-23자기보고 ↗
46GPT-5.4 nanoOpenAI · 상용 APIAPI52.4%162026-03-17자기보고 ↗
47Muse SparkMeta · 상용 APIAPI52.4%162026-04-08자기보고 ↗
48DeepSeek-V4-Flash-0423DeepSeek · 오픈 웨이트오픈52.3%132026-04-23자기보고 ↗
49MAI-Code-1-FlashMicrosoft · 상용 APIAPI51.2%102026-06-02자기보고 ↗
50Muse-Glimmer-30BMeta · 오픈 웨이트오픈51.2%102026-08-09자기보고 ↗
51Kimi-K2.5Moonshot AI (Kimi) · 오픈 웨이트오픈50.7%72026-01-01자기보고 ↗
52Qwen3.6-35B-A3BAlibaba (Qwen) · 오픈 웨이트오픈49.5%62026-04-15자기보고 ↗
53North-Mini-Code-1.0Cohere · 오픈 웨이트오픈40.2%42026-06-05자기보고 ↗
54IBM Granite 4.2 30BIBM · 오픈 웨이트오픈33.3%22026-08-25자기보고 ↗
55IBM Granite 4.2 8BIBM · 오픈 웨이트오픈19.1%02026-08-25자기보고 ↗

Anthropic 482

원문 출처 ↗

Anthropic 하네스 호환 482문항 부분집합입니다. Public 731 점수와 직접 비교할 수 없습니다. 높을수록 좋습니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1Claude Fable 5.1Anthropic · 상용 APIAPI92.1%1002026-09-01확인됨 ↗
2Claude Opus 5Anthropic · 상용 APIAPI91.7%502026-07-24확인됨 ↗
3Claude Sonnet 5Anthropic · 상용 APIAPI77.4%02026-06-30확인됨 ↗

마커: 원 = 오픈 웨이트, 사각 = 상용 API, 빈 마커 = 검증되지 않은 값. 점을 누르면 모델 상세로 이동합니다. 백분위는 이 프로필 안에서의 상대 위치입니다.