SWE-bench ProPublic 731
- 1Claude Fable 5.181.2%
- 2Claude Mythos 580.3%
- 3Claude Fable 580%
- 4Claude Opus 579.2%
- 5Claude Mythos Preview77.8%
새 글 수는 최근 24시간 발행 기준입니다.
AI 모델 인사이트
공개 벤치마크 75종·측정 1,152건으로 354개 모델의 성능·가격·컨텍스트·출시 흐름을 비교합니다. 점마다 원문 출처를 연결합니다.
데이터 기준 2026년 10월 9일 · 매일 자동 갱신
| 순위 | 모델 | 접근 | 레이팅 | 비교 수 | SWE-bench Pro | SWE-bench Verified | Terminal-Bench 2.1 | 출시 |
|---|---|---|---|---|---|---|---|---|
| 1 | GPT-5.6 SolOpenAI · 상용 API | API | 21.4 | 64.6% | — | — | 2026-07-09 | |
| 2 | GLM-5.3Z.ai (GLM) · 오픈 웨이트 | 오픈 | 10.3 | — | — | 88.2% | 2026-08-25 | |
| 3 | Claude Fable 5Anthropic · 상용 API | API | 11.4 | 80% | — | — | 2026-06-12 | |
| 4 | Hy4-previewTencent · 오픈 웨이트 | 오픈 | 8.6 | 65.7% | — | 85.4% | 2026-08-27 | |
| 5 | DeepSeek-V4.1-FlashDeepSeek · 오픈 웨이트 | 오픈 | 4.8 근거 적음 | — | — | 90.6% | 2026-09-10 | |
| 6 | Darwin-180B-RSIFINAL-Bench · 오픈 웨이트 | 오픈 | 4.1 근거 적음 | — | — | — | 2026-09-28 | |
| 7 | Kimi-K3Moonshot AI (Kimi) · 오픈 웨이트 | 오픈 | 12.5 | — | — | 88.3% | 2026-06-13 | |
| 8 | Ornith-1.5-397Bornith-ai · 오픈 웨이트 | 오픈 | 7.3 근거 적음 | 65.1% | 86% | — | 2026-08-18 | |
| 9 | Qwen3.8-Flash-NextAlibaba (Qwen) · 오픈 웨이트 | 오픈 | 5.7 근거 적음 | 62.5% | — | — | 2026-08-24 | |
| 10 | Qwen3.8-2.4T-A95BAlibaba (Qwen) · 오픈 웨이트 | 오픈 | 5.2 근거 적음 | 67.7% | — | — | 2026-08-08 |
레이팅은 같은 벤치·같은 조건에서 함께 측정된 모델끼리의 승패로 계산한 Bradley–Terry 점수(Elo 눈금, 200점 차이 ≈ 기대 승률 76%)입니다. 벤치 점수 열은 각 벤치의 대표 프로필이며 * 는 검증되지 않은 값입니다. 계산 방법
종합 레이팅은 GPT-5.6 Sol이 선두, 오픈 모델은 GLM-5.3이 최고
같은 벤치 비교로 만든 상대 지표에서 GPT-5.6 Sol이 1414로 1위다. 오픈 모델 중에는 GLM-5.3이 1309로 가장 높고, Claude Fable 5가 1293으로 뒤를 잇는다.
상용 최고점은 SWE-bench Pro에서 Claude Fable 5.1 81.2%, IFBench와 OSWorld-Verified에서 Qwen3.8 Max 82.8%·86.1%다. 오픈 최고점은 Terminal-Bench 2.1에서 DeepSeek-V4.1-Flash 90.6%다.
레이팅 1300 이상과 1200 이상 구간의 최저 혼합 가격은 GPT-5.6 Sol $8.00이다. 1100 이상에서는 Gemini 3.7 Flash $1.13이다. 실제 선택은 요구 레이팅과 접근 방식을 함께 봐야 한다.
최근 목록에는 Mistral Large 4(2026-10-06), Darwin-180B-RSI-R3(2026-10-01), Ling 3.1 Flash(2026-09-30)가 포함된다. 이 모델들의 종합 레이팅과 벤치 점수는 자료 없음이다.
수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.
출시일 기준으로 그때까지 나온 모델 중 가장 높은 종합 레이팅을 이은 선입니다.지금 상용 최고는 GPT-5.6 Sol(1414), 오픈 최고는 GLM-5.3(1309)로 105점 차이입니다.
혼합 가격 = (입력×3 + 출력×1)/4, 100만 토큰당 USD. 점선은 같은 가격대에서 가장 높은 레이팅을 잇는 가성비 경계입니다.
| 벤치 | 상용 최고 | 오픈 최고 | 격차 |
|---|---|---|---|
| SWE-bench Pro | Claude Fable 5.1 81.2% | Qwen3.8-2.4T-A95B 67.7% | 13.5%p |
| Terminal-Bench 2.1 | Muse Spark 1.3 88.8% | DeepSeek-V4.1-Flash 90.6% | 오픈 우위 1.8%p |
| AIME 2026 | Sakana Namazu 96.7% | GLM-5.2 99.2% | 오픈 우위 2.5%p |
| IFBench | Qwen3.8 Max 82.8% | Inkling-Small 82.2% | 0.6%p |
| MCP Atlas · Public | Muse Spark 1.1 88.1% | Kimi-K3 84.2% | 3.9%p |
| OSWorld-Verified | Qwen3.8 Max 86.1% | Qwen3.8-27B 84.3% | 1.8%p |
| ScreenSpot-Pro | GPT-6 Astra 92.7% | Muse-Glimmer-30B 75.4% | 17.3%p |
각 벤치 대표 프로필에서 상용·오픈 모델의 현재 최고점 차이입니다. 측정되지 않은 모델은 비교에 들어가지 않습니다.
| 모델 | 접근 | 출시 | 레이팅 | 컨텍스트·가격 |
|---|---|---|---|---|
| Mistral Large 4Mistral AI · 상용 API | API | 2026-10-06 | — | $1.03/1M |
| Darwin-180B-RSI-R3FINAL-Bench · 오픈 웨이트 | 오픈 | 2026-10-01 | — | 오픈 웨이트 |
| Ling 3.1 FlashinclusionAI (Ant) · 상용 API | API | 2026-09-30 | — | — |
| Darwin-180B-RSIFINAL-Bench · 오픈 웨이트 | 오픈 | 2026-09-28 | 오픈 웨이트 | |
| Ember-1Fireworks AI · 상용 API | API | 2026-09-23 | — | $6.00/1M |
| MiMo-V2.6-FlashXiaomi (MiMo) · 오픈 웨이트 | 오픈 | 2026-09-22 | — | $0.175/1M |
| MiMo-V2.6-ProXiaomi (MiMo) · 오픈 웨이트 | 오픈 | 2026-09-22 | — | $0.544/1M |
| Solar Mini 4Upstage (Solar) · 상용 API | API | 2026-09-22 | — | $0.175/1M |
| MiMo-V2.6-Flash-RLXiaomi (MiMo) · 오픈 웨이트 | 오픈 | 2026-09-21 | — | 오픈 웨이트 |
| MiMo-V2.6-Pro-RLXiaomi (MiMo) · 오픈 웨이트 | 오픈 | 2026-09-21 | — | 오픈 웨이트 |
| Macaron-V1.1mindlab-research · 오픈 웨이트 | 오픈 | 2026-09-21 | — | 오픈 웨이트 |
| Atria Dawn PreviewShanghai AI Lab (InternLM) · 오픈 웨이트 | 오픈 | 2026-09-11 | — | 오픈 웨이트 |
이 사이트가 추적하는 모델 기준입니다. 오픈 모델은 Hugging Face 저장소 생성일을 출시일로 봅니다.