벤치마크 · 추론·지식

IFBench

복잡하고 검증 가능한 지시를 정확히 따르는지 평가합니다.

측정 모델 43개 · 프로필 3개 · 데이터 기준 2026년 10월 9일

LLM Stats 집계 대표

원문 출처 ↗

LLM Stats 공개 리더보드의 독립 프로필입니다. 검증·자기보고 여부를 보존합니다. 높을수록 좋습니다.

현재 최고점: 상용 Qwen3.8 Max 82.8% · 오픈 Inkling-Small 82.2% → 상용이 0.6%p 앞섭니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1Qwen3.8 MaxAlibaba (Qwen) · 상용 APIAPI82.8%1002026-08-02자기보고 ↗
2Inkling-SmallThinking Machines · 오픈 웨이트오픈82.2%982026-07-27자기보고 ↗
3Nemotron 3 Ultra (550B A55B)NVIDIA · 오픈 웨이트오픈81.7%952026-06-04자기보고 ↗
4Qwen3.8 FlashAlibaba (Qwen) · 상용 APIAPI81.3%912026-08-26자기보고 ↗
5Qwen3.8-Flash-NextAlibaba (Qwen) · 오픈 웨이트오픈81.3%912026-08-24자기보고 ↗
6Hermes 3 70BNous Research · 오픈 웨이트오픈81.2%882024-08-15자기보고 ↗
7Nova 2 ProAmazon · 상용 APIAPI80.2%852025-12-02자기보고 ↗
8InklingThinking Machines · 오픈 웨이트오픈79.8%832026-07-14자기보고 ↗
9Qwen3.8-27BAlibaba (Qwen) · 오픈 웨이트오픈79.5%802026-08-05자기보고 ↗
10IBM Granite 4.2 8BIBM · 오픈 웨이트오픈79.3%782026-08-25자기보고 ↗
11Qwen3.7 MaxAlibaba (Qwen) · 상용 APIAPI79.1%742026-05-19자기보고 ↗
12Qwen3.7-PlusAlibaba (Qwen) · 상용 APIAPI79.1%742026-05-31자기보고 ↗
13IBM Granite 4.2 30BIBM · 오픈 웨이트오픈77.2%712026-08-25자기보고 ↗
14Muse-Glimmer-30BMeta · 오픈 웨이트오픈77%682026-08-09자기보고 ↗
15Qwen3.5-27BAlibaba (Qwen) · 오픈 웨이트오픈76.5%652026-02-24자기보고 ↗
16Qwen3.5-397B-A17BAlibaba (Qwen) · 오픈 웨이트오픈76.5%652026-02-16자기보고 ↗
17Qwen3.5-122B-A10BAlibaba (Qwen) · 오픈 웨이트오픈76.1%612026-02-24자기보고 ↗
18MAI-Code-1-FlashMicrosoft · 상용 APIAPI75%592026-06-02자기보고 ↗
19Ling-3.0-flashinclusionAI (Ant) · 오픈 웨이트오픈74.5%562026-08-02자기보고 ↗
20IBM Granite 4.2 3BIBM · 오픈 웨이트오픈74.3%542026-08-25자기보고 ↗
21Qwen3.6 PlusAlibaba (Qwen) · 상용 APIAPI74.2%512026-04-02자기보고 ↗
22Command A+Cohere · 오픈 웨이트오픈74%492026-05-20자기보고 ↗
23Nemotron 3 Super (120B A12B)NVIDIA · 상용 APIAPI72.6%462026-03-11자기보고 ↗
24Nemotron 3.5 Lightning (30B A3B)NVIDIA · 오픈 웨이트오픈71.9%442026-08-11자기보고 ↗
25Mercury 2Inception · 상용 APIAPI71%412026-02-24자기보고 ↗
26Qwen3 Max ThinkingAlibaba (Qwen) · 상용 APIAPI70.9%392026-02-13자기보고 ↗
27Nova 2 LiteAmazon · 상용 APIAPI70.8%372025-12-02자기보고 ↗
28Qwen3.5-35B-A3BAlibaba (Qwen) · 오픈 웨이트오픈70.2%342026-02-24자기보고 ↗
29MiniMax-M2.1MiniMax · 오픈 웨이트오픈70%322025-12-20자기보고 ↗
30GPT OSS 120B HighOpenAI · 오픈 웨이트오픈69.5%292025-08-05자기보고 ↗
31MAI-Thinking-1Microsoft · 상용 APIAPI69%262026-06-02자기보고 ↗
32Mistral Medium 3.5Mistral AI · 상용 APIAPI69%262026-04-29자기보고 ↗
33Nova 2 OmniAmazon · 상용 APIAPI68.7%222025-12-02자기보고 ↗
34K-EXAONE-236B-A23BLG AI Research (EXAONE) · 오픈 웨이트오픈67.3%202025-12-26자기보고 ↗
35Qwen3.5-9BAlibaba (Qwen) · 오픈 웨이트오픈64.5%172026-02-27자기보고 ↗
36Qwen3.5-4BAlibaba (Qwen) · 오픈 웨이트오픈59.2%152026-03-02자기보고 ↗
37LFM2.5-2.6BLiquid AI · 상용 APIAPI59.2%122026-08-04자기보고 ↗
38Mistral Small 4Mistral AI · 오픈 웨이트오픈48%102026-03-16자기보고 ↗
39Qwen3.5-2BAlibaba (Qwen) · 오픈 웨이트오픈41.3%72026-03-02자기보고 ↗
40Nova 2 SonicAmazon · 상용 APIAPI37.5%52025-12-02자기보고 ↗
41LFM2.5-VL-3BLiquid AI · 상용 APIAPI25.8%22026-08-12자기보고 ↗
42Qwen3.5-0.8BAlibaba (Qwen) · 오픈 웨이트오픈21%02026-03-02자기보고 ↗

Qwen 공개 평가

원문 출처 ↗

공급자가 같은 표에서 공개한 특정 평가 설정의 결과입니다. 하네스가 다른 리더보드 점수와 합치지 않습니다. 높을수록 좋습니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1Qwen3.8-27BAlibaba (Qwen) · 오픈 웨이트오픈79.5%1002026-08-05확인됨 ↗
2Muse-Glimmer-30BMeta · 오픈 웨이트오픈77%502026-08-09인용 ↗
3Qwen3.6-27BAlibaba (Qwen) · 오픈 웨이트오픈69.1%02026-04-21확인됨 ↗

Muse 공개 평가

원문 출처 ↗

공급자가 같은 표에서 공개한 특정 평가 설정의 결과입니다. 하네스가 다른 리더보드 점수와 합치지 않습니다. 높을수록 좋습니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1Muse-Glimmer-30BMeta · 오픈 웨이트오픈77%1002026-08-09확인됨 ↗
2Qwen3.6-27BAlibaba (Qwen) · 오픈 웨이트오픈70.8%02026-04-21인용 ↗

마커: 원 = 오픈 웨이트, 사각 = 상용 API, 빈 마커 = 검증되지 않은 값. 점을 누르면 모델 상세로 이동합니다. 백분위는 이 프로필 안에서의 상대 위치입니다.