벤치마크 · 추론·지식

GSM8K

수학 문제를 단계적으로 추론해 정확한 최종 답을 내는 능력을 평가합니다.

측정 모델 18개 · 프로필 1개 · 데이터 기준 2026년 10월 9일

HF 리더보드

원문 출처 ↗

같은 Hugging Face 리더보드 데이터셋·과제의 결과만 표시합니다. 높을수록 좋습니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1MiMo-V2.5-ProXiaomi (MiMo) · 오픈 웨이트오픈99.6%1002026-04-27확인됨 ↗
2Llama-3.1-405BMeta · 오픈 웨이트오픈96.8%942024-07-16인용 ↗
3granite-4.1-30bIBM · 오픈 웨이트오픈94.2%882026-04-06확인됨 ↗
4Llama-3.2-90B-Vision-InstructMeta · 오픈 웨이트오픈93.1%822024-09-19인용 ↗
5DeepSeek-V4-ProDeepSeek · 오픈 웨이트오픈92.6%762026-04-22확인됨 ↗
6granite-4.1-8bIBM · 오픈 웨이트오픈92.5%712026-04-06확인됨 ↗
7Phi-3-medium-4k-instructMicrosoft · 오픈 웨이트오픈91%652024-05-07확인됨 ↗
8Qwen2-72BAlibaba (Qwen) · 오픈 웨이트오픈89.5%592024-05-22확인됨 ↗
9DeepSeek-V3DeepSeek · 오픈 웨이트오픈89.3%532024-12-25확인됨 ↗
10granite-4.1-3bIBM · 오픈 웨이트오픈86.9%472026-04-06확인됨 ↗
11Phi-3.5-mini-instructMicrosoft · 오픈 웨이트오픈86.2%412024-08-16인용 ↗
12internlm2_5-7b-chatShanghai AI Lab (InternLM) · 오픈 웨이트오픈86%352024-06-27확인됨 ↗
13Phi-3-mini-4k-instructMicrosoft · 오픈 웨이트오픈85.7%292024-04-22확인됨 ↗
14Mellum2-12B-A2.5B-BaseJetBrains · 오픈 웨이트오픈81.7%212026-05-26인용 ↗
15Mellum2-12B-A2.5B-Base-PretrainJetBrains · 오픈 웨이트오픈81.7%212026-04-07인용 ↗
16Qwen2-7BAlibaba (Qwen) · 오픈 웨이트오픈79.9%122024-06-04확인됨 ↗
17internlm2-chat-20bShanghai AI Lab (InternLM) · 오픈 웨이트오픈79.6%62024-01-10확인됨 ↗
18DeepSeek-V2DeepSeek · 오픈 웨이트오픈79.2%02024-04-22확인됨 ↗

마커: 원 = 오픈 웨이트, 사각 = 상용 API, 빈 마커 = 검증되지 않은 값. 점을 누르면 모델 상세로 이동합니다. 백분위는 이 프로필 안에서의 상대 위치입니다.