Qwen3.8-27B
AI AI 해설
2026년 10월 9일 생성멀티모달 레이팅 1178(1위), 코딩은 999(34위)로 분야별 편차
종합 평가
종합 레이팅은 1162(14위), 가중 비교는 10이다. 비슷한 레이팅의 모델로 DeepSeek-V4-Pro-0813 1170(13위), MiniMax-M3 1161(15위), GPT-5.6 Terra 1156(16위)가 제시됐다.
분야별 강약
멀티모달은 1178(1위), 추론·지식은 1144(8위)다. 에이전트는 1070, 코딩은 999(34위)다. 과학·보안은 자료 없음으로, 해당 업무 적합성을 판단할 근거가 부족하다.
주요 벤치 결과
HF 리더보드에서 GPQA Diamond 89.2%(17/70), Humanity's Last Exam 30.8%(16/48), ExtractBench 89.8%(미검증, 3/11)다. Public 731의 SWE-bench Pro는 61.7%(18/63)다.
해석 시 주의점
Terminal-Bench 2.1은 LLM Stats 집계에서 73%(미검증, 20/37), HF 리더보드에서 73%(16/28)다. 같은 점수라도 프로필과 측정 모델 수가 달라 순위를 직접 비교하면 안 된다. Qwen 공개 평가는 비교 대상이 3 또는 2인 결과가 포함된다.
수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.
분야별 레이팅
비슷한 모델과 비교 →| 분야 | 레이팅 | 분야 순위 | 비교 수 |
|---|---|---|---|
| 코딩 | 51 | 4.9 | |
| 에이전트 | 22 | 2.5 | |
| 추론·지식 | 46 | 6.6 | |
| 멀티모달 | 4 | 5.5 | |
| 과학·보안 | — | — | — |
분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.
벤치마크 점수
42개 · 프로필별 순위코딩
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| SWE-bench Pro | Public 731 | 61.7% | 18 / 63 | 73 | 확인됨 ↗ |
| SWE-bench Pro | LLM Stats 집계 | 61.7% | 18 / 55 | 69 | 자기보고 ↗ |
| LiveCodeBench v6 | LLM Stats 집계 | 90.3% | 5 / 51 | 92 | 자기보고 ↗ |
| Terminal-Bench 2.1 | LLM Stats 집계 | 73% | 26 / 43 | 40 | 자기보고 ↗ |
| DeepSWE 1.1 | LLM Stats 집계 | 42.2% | 34 / 39 | 13 | 자기보고 ↗ |
| Terminal-Bench 2.1 | HF 리더보드 | 73% | 16 / 28 | 44 | 확인됨 ↗ |
| DeepSWE | HF 리더보드 | 42.2% | 18 / 21 | 15 | 확인됨 ↗ |
| LiveCodeBench v6 | Qwen 공개 평가 | 90.3% | 1 / 2 | 100 | 확인됨 ↗ |
| QwenSWEBench | LLM Stats 집계 | 79% | 2 / 2 | 0 | 자기보고 ↗ |
| QwenSWEBench | Qwen 공개 평가 | 79% | 1 / 2 | 100 | 확인됨 ↗ |
| SWE-MM | LLM Stats 집계 | 38.6% | 1 / 1 | 50 | 자기보고 ↗ |
에이전트
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| OSWorld-Verified | LLM Stats 집계 | 84.3% | 3 / 26 | 92 | 자기보고 ↗ |
| WildClawBench | HF 리더보드 | 48.0% | 8 / 22 | 67 | 인용 ↗ |
| Agents' Last Exam | LLM Stats 집계 | 42.9% | 10 / 21 | 55 | 자기보고 ↗ |
| CoWorkBench | LLM Stats 집계 | 70.7% | 4 / 6 | 40 | 자기보고 ↗ |
| ClawEval-MM | LLM Stats 집계 | 56.9% | 3 / 6 | 60 | 자기보고 ↗ |
| CoWorkBench | Qwen 공개 평가 | 70.7% | 1 / 2 | 100 | 확인됨 ↗ |
| JobBench | Qwen 공개 평가 | 33.4% | 1 / 2 | 100 | 확인됨 ↗ |
추론·지식
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| GPQA Diamond | LLM Stats 집계 | 89.2% | 32 / 90 | 65 | 자기보고 ↗ |
| GPQA Diamond | HF 리더보드 | 89.2% | 17 / 70 | 78 | 확인됨 ↗ |
| Humanity's Last Exam | LLM Stats 집계 | 30.8% | 44 / 64 | 32 | 자기보고 ↗ |
| Humanity's Last Exam | HF 리더보드 | 30.8% | 16 / 48 | 68 | 확인됨 ↗ |
| IFBench | LLM Stats 집계 | 79.5% | 9 / 42 | 80 | 자기보고 ↗ |
| ERQA | LLM Stats 집계 | 65.5% | 8 / 25 | 71 | 자기보고 ↗ |
| NL2Repo | LLM Stats 집계 | 42.3% | 17 / 22 | 24 | 자기보고 ↗ |
| Job Bench | LLM Stats 집계 | 33.4% | 8 / 8 | 0 | 자기보고 ↗ |
| AndroidWorld | LLM Stats 집계 | 81.9% | 4 / 7 | 50 | 자기보고 ↗ |
| IFBench | Qwen 공개 평가 | 79.5% | 1 / 3 | 100 | 확인됨 ↗ |
| RecreationBench | LLM Stats 집계 | 47.1% | 3 / 3 | 0 | 자기보고 ↗ |
| NL2Repo | Qwen 공개 평가 | 42.3% | 1 / 2 | 100 | 확인됨 ↗ |
| WebArena-Verified | LLM Stats 집계 | 64.8% | 1 / 1 | 50 | 자기보고 ↗ |
멀티모달
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| CharXiv-R | LLM Stats 집계 | 90.2% | 6 / 48 | 89 | 자기보고 ↗ |
| MathVision | LLM Stats 집계 | 94.6% | 4 / 34 | 91 | 자기보고 ↗ |
| RealWorldQA | LLM Stats 집계 | 85.9% | 7 / 25 | 75 | 자기보고 ↗ |
| OmniDocBench 1.5 | LLM Stats 집계 | 91.1% | 4 / 20 | 84 | 자기보고 ↗ |
| BabyVision | LLM Stats 집계 | 85.6% | 3 / 13 | 83 | 자기보고 ↗ |
| ExtractBench | HF 리더보드 | 89.8% | 3 / 11 | 80 | 인용 ↗ |
| SWE-Bench Multimodal | LLM Stats 집계 | 38.6% | 4 / 7 | 50 | 자기보고 ↗ |
| Vision2Web | LLM Stats 집계 | 62.9% | 4 / 4 | 0 | 자기보고 ↗ |
| OmniDocBench 1.5 | Qwen 공개 평가 | 91.1% | 1 / 3 | 100 | 확인됨 ↗ |
| CharXiv Reasoning · without CI | Qwen 공개 평가 | 83.7% | 1 / 3 | 100 | 확인됨 ↗ |
| RealWorldQA | Qwen 공개 평가 | 85.9% | 1 / 2 | 100 | 확인됨 ↗ |
순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.
Hugging Face 다운로드 추이
30일 변화 -614.6K (-8.2%)Hugging Face가 제공하는 최근 30일 다운로드 집계를 매일 기록한 값입니다(누적 다운로드가 아님).
레이팅이 비슷한 모델
- DeepSeek-V4-Pro-Max 35위 · 1178 비교
- Kimi-K2.6 36위 · 1175 비교
- DeepSeek-V4-Flash-Vision-Exp 37위 · 1173 비교
- Mistral Large 4 39위 · 1169 비교
- GPT-5.5 40위 · 1168 비교
- GPT-5.4 41위 · 1157 비교
Alibaba (Qwen)의 다른 모델
공급사 →- Qwen-Drive-1.0-4B 2026-08-27
- Qwen3.8 Flash 2026-08-26 · 1273
- Qwen3.8-Flash-Next-FP8 2026-08-24
- Qwen3.8-Flash-Next 2026-08-24 · 1295
- Qwen3.8-2.4T-A95B 2026-08-08 · 1245
- Qwen3.8 Max 2026-08-02 · 1353
- Qwen3.7-Plus 2026-05-31 · 1151
- Qwen3.7 Max 2026-05-19 · 1233