AI 모델 인사이트

지금 가장 잘하는 AI 모델은?

공개 벤치마크 75종·측정 1,152건으로 354개 모델의 성능·가격·컨텍스트·출시 흐름을 비교합니다. 점마다 원문 출처를 연결합니다.

데이터 기준 2026년 10월 9일 · 매일 자동 갱신

추적 모델354오픈 웨이트 278 · 상용 API 76
종합 순위 모델55같은 벤치 비교가 충분한 모델
벤치마크75프로필 100개(출처·하네스별)
주요 공급사36전체 게시자 83곳
최근 60일 출시12점수가 있는 모델 기준

종합 레이팅 TOP 10

전체 리더보드 →
순위모델접근레이팅비교 수SWE-bench ProSWE-bench VerifiedTerminal-Bench 2.1출시
1GPT-5.6 SolOpenAI · 상용 APIAPI141421.464.6%——2026-07-09
2GLM-5.3Z.ai (GLM) · 오픈 웨이트오픈130910.3——88.2%2026-08-25
3Claude Fable 5Anthropic · 상용 APIAPI129311.480%——2026-06-12
4Hy4-previewTencent · 오픈 웨이트오픈12918.665.7%—85.4%2026-08-27
5DeepSeek-V4.1-FlashDeepSeek · 오픈 웨이트오픈12854.8 근거 적음——90.6%2026-09-10
6Darwin-180B-RSIFINAL-Bench · 오픈 웨이트오픈12794.1 근거 적음———2026-09-28
7Kimi-K3Moonshot AI (Kimi) · 오픈 웨이트오픈125912.5——88.3%2026-06-13
8Ornith-1.5-397Bornith-ai · 오픈 웨이트오픈12557.3 근거 적음65.1%86%—2026-08-18
9Qwen3.8-Flash-NextAlibaba (Qwen) · 오픈 웨이트오픈12245.7 근거 적음62.5%——2026-08-24
10Qwen3.8-2.4T-A95BAlibaba (Qwen) · 오픈 웨이트오픈12205.2 근거 적음67.7%——2026-08-08

레이팅은 같은 벤치·같은 조건에서 함께 측정된 모델끼리의 승패로 계산한 Bradley–Terry 점수(Elo 눈금, 200점 차이 ≈ 기대 승률 76%)입니다. 벤치 점수 열은 각 벤치의 대표 프로필이며 * 는 검증되지 않은 값입니다. 계산 방법

AI AI 해설

2026년 10월 9일 생성

종합 레이팅은 GPT-5.6 Sol이 선두, 오픈 모델은 GLM-5.3이 최고

종합 레이팅

같은 벤치 비교로 만든 상대 지표에서 GPT-5.6 Sol이 1414로 1위다. 오픈 모델 중에는 GLM-5.3이 1309로 가장 높고, Claude Fable 5가 1293으로 뒤를 잇는다.

벤치별 선택

상용 최고점은 SWE-bench Pro에서 Claude Fable 5.1 81.2%, IFBench와 OSWorld-Verified에서 Qwen3.8 Max 82.8%·86.1%다. 오픈 최고점은 Terminal-Bench 2.1에서 DeepSeek-V4.1-Flash 90.6%다.

가격 구간

레이팅 1300 이상과 1200 이상 구간의 최저 혼합 가격은 GPT-5.6 Sol $8.00이다. 1100 이상에서는 Gemini 3.7 Flash $1.13이다. 실제 선택은 요구 레이팅과 접근 방식을 함께 봐야 한다.

최근 출시

최근 목록에는 Mistral Large 4(2026-10-06), Darwin-180B-RSI-R3(2026-10-01), Ling 3.1 Flash(2026-09-30)가 포함된다. 이 모델들의 종합 레이팅과 벤치 점수는 자료 없음이다.

수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.

벤치마크별 1~5위

모든 벤치마크 →

오픈 vs 상용, 최고 성능의 흐름

트렌드 →
차트를 불러오는 중입니다…

출시일 기준으로 그때까지 나온 모델 중 가장 높은 종합 레이팅을 이은 선입니다.지금 상용 최고는 GPT-5.6 Sol(1414), 오픈 최고는 GLM-5.3(1309)로 105점 차이입니다.

가격 대비 성능

가격·성능 →
차트를 불러오는 중입니다…

혼합 가격 = (입력×3 + 출력×1)/4, 100만 토큰당 USD. 점선은 같은 가격대에서 가장 높은 레이팅을 잇는 가성비 경계입니다.

벤치별 오픈·상용 격차

벤치상용 최고오픈 최고격차
SWE-bench ProClaude Fable 5.1 81.2%Qwen3.8-2.4T-A95B 67.7% 13.5%p
Terminal-Bench 2.1Muse Spark 1.3 88.8%DeepSeek-V4.1-Flash 90.6%오픈 우위 1.8%p
AIME 2026Sakana Namazu 96.7%GLM-5.2 99.2%오픈 우위 2.5%p
IFBenchQwen3.8 Max 82.8%Inkling-Small 82.2% 0.6%p
MCP Atlas · PublicMuse Spark 1.1 88.1%Kimi-K3 84.2% 3.9%p
OSWorld-VerifiedQwen3.8 Max 86.1%Qwen3.8-27B 84.3% 1.8%p
ScreenSpot-ProGPT-6 Astra 92.7%Muse-Glimmer-30B 75.4% 17.3%p

각 벤치 대표 프로필에서 상용·오픈 모델의 현재 최고점 차이입니다. 측정되지 않은 모델은 비교에 들어가지 않습니다.

최근 출시된 모델

모든 모델 →
모델접근출시레이팅컨텍스트·가격
Mistral Large 4Mistral AI · 상용 APIAPI2026-10-06—$1.03/1M
Darwin-180B-RSI-R3FINAL-Bench · 오픈 웨이트오픈2026-10-01—오픈 웨이트
Ling 3.1 FlashinclusionAI (Ant) · 상용 APIAPI2026-09-30——
Darwin-180B-RSIFINAL-Bench · 오픈 웨이트오픈2026-09-281279오픈 웨이트
Ember-1Fireworks AI · 상용 APIAPI2026-09-23—$6.00/1M
MiMo-V2.6-FlashXiaomi (MiMo) · 오픈 웨이트오픈2026-09-22—$0.175/1M
MiMo-V2.6-ProXiaomi (MiMo) · 오픈 웨이트오픈2026-09-22—$0.544/1M
Solar Mini 4Upstage (Solar) · 상용 APIAPI2026-09-22—$0.175/1M
MiMo-V2.6-Flash-RLXiaomi (MiMo) · 오픈 웨이트오픈2026-09-21—오픈 웨이트
MiMo-V2.6-Pro-RLXiaomi (MiMo) · 오픈 웨이트오픈2026-09-21—오픈 웨이트
Macaron-V1.1mindlab-research · 오픈 웨이트오픈2026-09-21—오픈 웨이트
Atria Dawn PreviewShanghai AI Lab (InternLM) · 오픈 웨이트오픈2026-09-11—오픈 웨이트

월별 출시 수(최근 1년)

차트를 불러오는 중입니다…

이 사이트가 추적하는 모델 기준입니다. 오픈 모델은 Hugging Face 저장소 생성일을 출시일로 봅니다.