벤치마크 · 코딩

IMO-AnswerBench

실제 소프트웨어 저장소의 이슈를 분석하고 코드 패치로 해결하는 능력을 평가합니다. 저장소 탐색부터 구현·테스트까지 이어지는 엔지니어링 완성도를 봅니다.

측정 모델 18개 · 프로필 1개 · 데이터 기준 2026년 10월 9일

LLM Stats 집계

원문 출처 ↗

LLM Stats 공개 리더보드의 독립 프로필입니다. 검증·자기보고 여부를 보존합니다. 높을수록 좋습니다.

현재 최고점: 상용 Qwen3.7 Max 90% · 오픈 Nemotron 3 Ultra (550B A55B) 92.3% → 오픈 모델이 앞섭니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1Nemotron 3 Ultra (550B A55B)NVIDIA · 오픈 웨이트오픈92.3%1002026-06-04자기보고 ↗
2GLM-5.2Z.ai (GLM) · 오픈 웨이트오픈91%942026-06-16자기보고 ↗
3Hy3Tencent · 오픈 웨이트오픈90%852026-07-02자기보고 ↗
4Qwen3.7 MaxAlibaba (Qwen) · 상용 APIAPI90%852026-05-19자기보고 ↗
5DeepSeek-V4-Pro-MaxDeepSeek · 오픈 웨이트오픈89.8%762026-04-23자기보고 ↗
6DeepSeek-V4-Flash-MaxDeepSeek · 오픈 웨이트오픈88.4%712026-04-23자기보고 ↗
7Kimi-K2.6Moonshot AI (Kimi) · 오픈 웨이트오픈86%622026-04-14자기보고 ↗
8Qwen3.7-PlusAlibaba (Qwen) · 상용 APIAPI86%622026-05-31자기보고 ↗
9DeepSeek-V4-Flash-0423DeepSeek · 오픈 웨이트오픈85.1%532026-04-23자기보고 ↗
10Qwen3 Max ThinkingAlibaba (Qwen) · 상용 APIAPI83.9%472026-02-13자기보고 ↗
11GLM-5.1Z.ai (GLM) · 오픈 웨이트오픈83.8%382026-04-03자기보고 ↗
12Qwen3.6 PlusAlibaba (Qwen) · 상용 APIAPI83.8%382026-04-02자기보고 ↗
13Ling-3.0-flashinclusionAI (Ant) · 오픈 웨이트오픈83.7%292026-08-02자기보고 ↗
14Kimi-K2.5Moonshot AI (Kimi) · 오픈 웨이트오픈81.8%242026-01-01자기보고 ↗
15Qwen3.5-397B-A17BAlibaba (Qwen) · 오픈 웨이트오픈80.9%182026-02-16자기보고 ↗
16Qwen3.6-27BAlibaba (Qwen) · 오픈 웨이트오픈80.8%122026-04-21자기보고 ↗
17Qwen3.6-35B-A3BAlibaba (Qwen) · 오픈 웨이트오픈78.9%62026-04-15자기보고 ↗
18Kimi K2-Thinking-0905Moonshot AI (Kimi) · 오픈 웨이트오픈78.6%02025-09-05자기보고 ↗

마커: 원 = 오픈 웨이트, 사각 = 상용 API, 빈 마커 = 검증되지 않은 값. 점을 누르면 모델 상세로 이동합니다. 백분위는 이 프로필 안에서의 상대 위치입니다.