벤치마크 · 추론·지식

MRCR v2 (8-needle)

아주 긴 문맥에서 필요한 정보를 찾아 연결하는 장문맥 추론을 평가합니다.

측정 모델 22개 · 프로필 1개 · 데이터 기준 2026년 10월 9일

LLM Stats 집계

원문 출처 ↗

LLM Stats 공개 리더보드의 독립 프로필입니다. 검증·자기보고 여부를 보존합니다. 높을수록 좋습니다.

현재 최고점: 상용 Muse Spark 1.3 98.5% · 오픈 Gemma 4 31B 66.4% → 상용이 32.1%p 앞섭니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1Muse Spark 1.3Meta · 상용 APIAPI98.5%1002026-09-02자기보고 ↗
2Gemini 3.7 FlashGoogle · 상용 APIAPI97%952026-08-13자기보고 ↗
3Qwen3.8 MaxAlibaba (Qwen) · 상용 APIAPI92.9%902026-08-02자기보고 ↗
4GPT-5.6 SolOpenAI · 상용 APIAPI91.5%862026-07-09자기보고 ↗
5GPT-5.6 TerraOpenAI · 상용 APIAPI89.6%812026-07-09자기보고 ↗
6Claude Opus 4.6Anthropic · 상용 APIAPI76%762026-02-05자기보고 ↗
7GPT-5.5OpenAI · 상용 APIAPI74%712026-04-23자기보고 ↗
8Gemma 4 31BGoogle · 오픈 웨이트오픈66.4%672026-04-02자기보고 ↗
9Gemini 3.6 FlashGoogle · 상용 APIAPI54%622026-07-21자기보고 ↗
10Seed 2.0 MiniByteDance (Seed) · 상용 APIAPI51.4%572026-02-17자기보고 ↗
11Gemma 4 26B-A4BGoogle · 오픈 웨이트오픈44.1%522026-04-02자기보고 ↗
12Gemma 4 12BGoogle · 오픈 웨이트오픈43.4%482026-05-23자기보고 ↗
13GPT-5.6 LunaOpenAI · 상용 APIAPI41.3%432026-07-09자기보고 ↗
14GPT-5.4 miniOpenAI · 상용 APIAPI33.6%382026-03-17자기보고 ↗
15GPT-5.4 nanoOpenAI · 상용 APIAPI33.1%332026-03-17자기보고 ↗
16Gemini 3.5 FlashGoogle · 상용 APIAPI26.6%292026-05-19자기보고 ↗
17Gemini 3 ProGoogle · 상용 APIAPI26.3%212025-11-18자기보고 ↗
18Gemini 3.1 ProGoogle · 상용 APIAPI26.3%212026-02-19자기보고 ↗
19Gemma 4 E4BGoogle · 오픈 웨이트오픈25.4%142026-04-02자기보고 ↗
20Gemini 3 FlashGoogle · 상용 APIAPI22.1%102025-12-17자기보고 ↗
21Gemini 3.5 Flash-LiteGoogle · 상용 APIAPI21.3%52026-07-21자기보고 ↗
22Gemma 4 E2BGoogle · 오픈 웨이트오픈19.1%02026-04-02자기보고 ↗

마커: 원 = 오픈 웨이트, 사각 = 상용 API, 빈 마커 = 검증되지 않은 값. 점을 누르면 모델 상세로 이동합니다. 백분위는 이 프로필 안에서의 상대 위치입니다.