종합 레이팅537 · 210위레이팅 벤치 24개
컨텍스트 창—
가격 (입력 / 출력, 1M 토큰)오픈 웨이트
파라미터5.1B
라이선스—
최근 30일 다운로드0좋아요 0
벤치 점수24개코딩·에이전트·추론·지식·멀티모달·과학·보안
분야별 레이팅
비슷한 모델과 비교 →| 분야 | 레이팅 | 분야 순위 | 벤치 수 |
|---|---|---|---|
| 코딩 | 189 | 3 | |
| 에이전트 | — | 1 | |
| 추론·지식 | 203 | 15 | |
| 멀티모달 | 73 | 3 | |
| 과학·보안 | 117 | 2 |
차트를 불러오는 중입니다…
분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.
벤치마크 점수
24개 · 프로필별 순위코딩
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | Artificial Analysis | 0.4% | 96 / 97 | 1 | 확인됨 ↗ |
| Terminal-Bench Hard | Artificial Analysis | 3.0% | 82 / 93 | 11 | 확인됨 ↗ |
| LiveCodeBench v6 | LLM Stats 집계 | 44% | 47 / 51 | 8 | 자기보고 ↗ |
에이전트
추론·지식
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Humanity's Last Exam | Artificial Analysis | 4.8% | 127 / 141 | 10 | 확인됨 ↗ |
| Intelligence Index | Artificial Analysis | 7.8 | 126 / 141 | 11 | 확인됨 ↗ |
| AA-LCR | Artificial Analysis | 16.3% | 127 / 139 | 9 | 확인됨 ↗ |
| CritPT | Artificial Analysis | 0% | 113 / 139 | 12 | 확인됨 ↗ |
| GPQA Diamond | Artificial Analysis | 43.3% | 121 / 130 | 7 | 확인됨 ↗ |
| IFBench | Artificial Analysis | 38.0% | 80 / 97 | 18 | 확인됨 ↗ |
| τ²-Bench Telecom | Artificial Analysis | 20.8% | 87 / 96 | 9 | 확인됨 ↗ |
| GPQA Diamond | LLM Stats 집계 | 43.4% | 89 / 90 | 1 | 자기보고 ↗ |
| MMLU-Pro | LLM Stats 집계 | 60% | 58 / 60 | 3 | 자기보고 ↗ |
| MMMLU | LLM Stats 집계 | 67.4% | 28 / 30 | 7 | 자기보고 ↗ |
| AIME 2026 | LLM Stats 집계 | 37.5% | 26 / 26 | 0 | 자기보고 ↗ |
| MRCR v2 (8-needle) | LLM Stats 집계 | 19.1% | 22 / 22 | 0 | 자기보고 ↗ |
| t2-bench | LLM Stats 집계 | 29.4% | 18 / 19 | 6 | 자기보고 ↗ |
| MedXpertQA | LLM Stats 집계 | 23.5% | 11 / 11 | 0 | 자기보고 ↗ |
| BIG-Bench Extra Hard | LLM Stats 집계 | 21.9% | 6 / 6 | 0 | 자기보고 ↗ |
멀티모달
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| MMMU-Pro | Artificial Analysis | 44.6% | 66 / 69 | 4 | 확인됨 ↗ |
| MMMU-Pro | LLM Stats 집계 | 44.2% | 59 / 61 | 3 | 자기보고 ↗ |
| MathVision | LLM Stats 집계 | 52.4% | 30 / 34 | 12 | 자기보고 ↗ |
과학·보안
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| AA-Omniscience Accuracy | Artificial Analysis | 6.6% | 136 / 139 | 2 | 확인됨 ↗ |
| AA-Omniscience Index | Artificial Analysis | -23.6 | 84 / 139 | 40 | 확인됨 ↗ |
순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.
레이팅이 비슷한 모델
- Qwen3-8B 207위 · 584 비교
- granite-4.1-3b 208위 · 562 비교
- Qwen3-VL-8B-Instruct 209위 · 550 비교
- Llama-3.2-1B-Instruct 211위 · 536 비교
- Qwen3-0.6B 212위 · 513 비교
- Qwen3 VL 4B Thinking 213위 · 505 비교
Google의 다른 모델
공급사 →- DiarizationLM-Gemma-4-E4B-v1 2026-10-04
- Gemini 3.8 Flash 2026-09-02 · 1432
- Gemini 3.7 Flash 2026-08-13 · 1369
- Gemini 3.5 Flash-Lite 2026-07-21 · 983
- Gemini 3.6 Flash 2026-07-21 · 1208
- DiffusionGemma 26B-A4B 2026-06-10 · 705
- Gemma 4 12B 2026-05-23 · 781
- Gemini 3.5 Flash 2026-05-19 · 1227