Z.ai (GLM) · 모델
GLM-5.3
AI AI 해설
2026년 10월 9일 생성종합 레이팅 1309로 2위, 코딩·에이전트는 모두 4위
종합 평가
종합 레이팅은 1309로 2위이며 가중 비교는 10.3이다. 비슷한 모델은 GPT-5.6 Sol 1414, Claude Fable 5 1293, Hy4-preview 1291이다. 레이팅은 같은 벤치 비교를 바탕으로 한 상대 지표다.
분야별 역량
코딩 레이팅은 1196으로 4위, 에이전트는 1140으로 4위다. 추론·지식은 1077, 과학·보안은 1091이며 멀티모달은 자료 없음이다.
벤치 결과
HF 리더보드에서 Terminal-Bench 2.1은 88.2%로 3/28, DeepSWE는 66.9%로 6/21이다. LLM Stats 집계의 Terminal-Bench 2.1은 88.2%로 5/37이지만 미검증이다. 프로필이 달라 순위를 직접 비교할 수 없다.
도입 전 확인사항
오픈 웨이트 모델이며 라이선스는 other다. 컨텍스트, 최대 출력, 입력·출력 가격은 자료 없음이다. Z.ai 공개 평가에서는 GDPval-AA v2 1,769와 AutomationBench 1.0.6 48.2%, CyberGym 84.5%가 각각 1/7이다.
수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.
분야별 레이팅
비슷한 모델과 비교 →| 분야 | 레이팅 | 분야 순위 | 비교 수 |
|---|---|---|---|
| 코딩 | 5 | 8 | |
| 에이전트 | 8 | 4.3 | |
| 추론·지식 | 28 | 3.3 | |
| 멀티모달 | — | — | — |
| 과학·보안 | 4 | 2.7 |
분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.
벤치마크 점수
32개 · 프로필별 순위코딩
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | LLM Stats 집계 | 88.2% | 7 / 43 | 86 | 자기보고 ↗ |
| DeepSWE 1.1 | LLM Stats 집계 | 66.9% | 18 / 39 | 55 | 자기보고 ↗ |
| Terminal-Bench 2.1 | HF 리더보드 | 88.2% | 3 / 28 | 93 | 확인됨 ↗ |
| DeepSWE | HF 리더보드 | 66.9% | 6 / 21 | 75 | 확인됨 ↗ |
| Terminal-Bench 4.0 | LLM Stats 집계 | 41.8% | 7 / 21 | 70 | 인용 ↗ |
| FrontierSWE | LLM Stats 집계 | 78.1% | 3 / 17 | 88 | 자기보고 ↗ |
| PostTrainBench | LLM Stats 집계 | 39.8% | 1 / 7 | 100 | 자기보고 ↗ |
| Terminal-Bench 3.0 | Z.ai 공개 평가 | 28.3% | 3 / 6 | 60 | 확인됨 ↗ |
| PostTrainBench | Z.ai 공개 평가 | 39.8% | 2 / 6 | 80 | 확인됨 ↗ |
| SWE-Marathon 1.1 | Z.ai 공개 평가 | 42.5% | 3 / 6 | 50 | 확인됨 ↗ |
| SWE-Marathon | LLM Stats 집계 | 42.5% | 1 / 5 | 100 | 자기보고 ↗ |
| FrontierSWE | Z.ai 공개 평가 | 78.1% | 2 / 4 | 67 | 확인됨 ↗ |
| Terminal-Bench 3.0 | LLM Stats 집계 | 28.3% | 2 / 3 | 50 | 자기보고 ↗ |
에이전트
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Toolathlon | LLM Stats 집계 | 73% | 8 / 38 | 81 | 자기보고 ↗ |
| AutomationBench | LLM Stats 집계 | 48.2% | 7 / 24 | 74 | 자기보고 ↗ |
| Agents' Last Exam | LLM Stats 집계 | 28.5% | 14 / 21 | 35 | 자기보고 ↗ |
| GDPval-AA | LLM Stats 집계 | 1,769 | 3 / 11 | 80 | 자기보고 ↗ |
| GDPval-AA v2 | Z.ai 공개 평가 | 1,769 | 1 / 7 | 100 | 확인됨 ↗ |
| Agents' Last Exam · CLI | Z.ai 공개 평가 | 28.5% | 2 / 7 | 83 | 확인됨 ↗ |
| AutomationBench 1.0.6 | Z.ai 공개 평가 | 48.2% | 1 / 7 | 100 | 확인됨 ↗ |
| Toolathlon Verified | Z.ai 공개 평가 | 73% | 6 / 7 | 17 | 확인됨 ↗ |
추론·지식
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| Humanity's Last Exam | LLM Stats 집계 | 62.5% | 5 / 64 | 94 | 자기보고 ↗ |
| NL2Repo | LLM Stats 집계 | 58% | 4 / 22 | 86 | 자기보고 ↗ |
| Program Bench | LLM Stats 집계 | 19% | 12 / 13 | 8 | 자기보고 ↗ |
| HLE · with tools | Z.ai 공개 평가 | 62.5% | 3 / 7 | 67 | 확인됨 ↗ |
| ProgramBench · Almost Solved | Z.ai 공개 평가 | 19% | 3 / 6 | 60 | 확인됨 ↗ |
| NL2Repo | Z.ai 공개 평가 | 58% | 3 / 5 | 38 | 확인됨 ↗ |
과학·보안
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| CyberGym | LLM Stats 집계 | 84.5% | 6 / 19 | 72 | 자기보고 ↗ |
| ExploitBench | LLM Stats 집계 | 54.4% | 4 / 8 | 57 | 자기보고 ↗ |
| ExploitGym | LLM Stats 집계 | 15% | 6 / 8 | 29 | 자기보고 ↗ |
| CyberGym | Z.ai 공개 평가 | 84.5% | 1 / 7 | 100 | 확인됨 ↗ |
| ExploitBench | Z.ai 공개 평가 | 54.4% | 3 / 6 | 60 | 확인됨 ↗ |
순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.
Hugging Face 다운로드 추이
30일 변화 +745.4K (+93.1%)Hugging Face가 제공하는 최근 30일 다운로드 집계를 매일 기록한 값입니다(누적 다운로드가 아님).
레이팅이 비슷한 모델
- Claude Fable 5 5위 · 1410 비교
- Claude Fable 5.1 6위 · 1409 비교
- Claude Opus 5 7위 · 1395 비교
- Muse Spark 1.3 9위 · 1385 비교
- Kimi-K3 10위 · 1369 비교
- Claude Mythos Preview 11위 · 1357 비교
Z.ai (GLM)의 다른 모델
공급사 →- GLM-5.3-Flash-BF16 2026-08-25
- GLM-5.3-BF16 2026-08-25
- GLM-5.3-Flash 2026-08-25 · 1242
- GLM-5.2 2026-06-16 · 1109
- GLM-5.2-FP8 2026-06-16
- GLM-5.1-FP8 2026-04-03
- GLM-5.1 2026-04-03 · 1064
- GLM-5 2026-02-11 · 1069