벤치마크 · 코딩

DeepSWE

실제 소프트웨어 저장소의 이슈를 분석하고 코드 패치로 해결하는 능력을 평가합니다. 저장소 탐색부터 구현·테스트까지 이어지는 엔지니어링 완성도를 봅니다.

측정 모델 28개 · 프로필 2개 · 데이터 기준 2026년 10월 9일

HF 리더보드 대표

원문 출처 ↗

같은 Hugging Face 리더보드 데이터셋·과제의 결과만 표시합니다. 높을수록 좋습니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1DeepSeek-V4.1-FlashDeepSeek · 오픈 웨이트오픈74.2%1002026-09-10확인됨 ↗
2MiMo-V2.6-Pro-RLXiaomi (MiMo) · 오픈 웨이트오픈71.9%952026-09-21확인됨 ↗
3Macaron-V1.1mindlab-research · 오픈 웨이트오픈71.7%902026-09-21확인됨 ↗
4MiMo-V2.6-Flash-RLXiaomi (MiMo) · 오픈 웨이트오픈67.9%852026-09-21확인됨 ↗
5Kimi-K3Moonshot AI (Kimi) · 오픈 웨이트오픈67.5%802026-06-13확인됨 ↗
6GLM-5.3Z.ai (GLM) · 오픈 웨이트오픈66.9%752026-08-25확인됨 ↗
7Hy4-previewTencent · 오픈 웨이트오픈64.3%702026-08-27확인됨 ↗
8GLM-5.3-FlashZ.ai (GLM) · 오픈 웨이트오픈63.4%652026-08-25확인됨 ↗
9DeepSeek-V4-Flash-Vision-ExpDeepSeek · 오픈 웨이트오픈59.3%602026-08-31확인됨 ↗
10Qwen3.8-Flash-NextAlibaba (Qwen) · 오픈 웨이트오픈58.7%552026-08-24확인됨 ↗
11Macaron-V1-Coding-Ventimindlab-research · 오픈 웨이트오픈58.4%482026-07-20확인됨 ↗
12Macaron-V1-Ventimindlab-research · 오픈 웨이트오픈58.4%482026-07-20확인됨 ↗
13Qwen3.8-2.4T-A95BAlibaba (Qwen) · 오픈 웨이트오픈56.6%402026-08-08확인됨 ↗
14Ornith-1.5-397Bornith-ai · 오픈 웨이트오픈56%352026-08-18확인됨 ↗
15Nex-N2.5-Pronex-agi · 오픈 웨이트오픈55.8%302026-09-08확인됨 ↗
16DeepSeek-V4-Flash-0731DeepSeek · 오픈 웨이트오픈54.4%252026-07-31확인됨 ↗
17GLM-5.2Z.ai (GLM) · 오픈 웨이트오픈46.2%202026-06-16확인됨 ↗
18Qwen3.8-27BAlibaba (Qwen) · 오픈 웨이트오픈42.2%152026-08-05확인됨 ↗
19Laguna-S-2.1Poolside · 오픈 웨이트오픈40.4%102026-07-13확인됨 ↗
20Hy3Tencent · 오픈 웨이트오픈28%52026-07-02확인됨 ↗
21Ornith-1.5-35B-A3Bornith-ai · 오픈 웨이트오픈22%02026-08-18확인됨 ↗

LLM Stats 집계

원문 출처 ↗

LLM Stats 공개 리더보드의 독립 프로필입니다. 검증·자기보고 여부를 보존합니다. 높을수록 좋습니다.

현재 최고점: 상용 GPT-5.6 Sol 72.7% · 오픈 Kimi-K3 67.5% → 상용이 5.2%p 앞섭니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…

마커: 원 = 오픈 웨이트, 사각 = 상용 API, 빈 마커 = 검증되지 않은 값. 점을 누르면 모델 상세로 이동합니다. 백분위는 이 프로필 안에서의 상대 위치입니다.