AI AI 해설
2026년 10월 9일 생성에이전트·과학·보안 레이팅 1위, 대형 컨텍스트를 갖춘 상용 API
종합 평가
종합 레이팅 1414로 1위이며 가중 비교는 21.4다. 분야별로 에이전트 1220, 과학·보안 1204가 1위이고 코딩 1223, 추론·지식 1221은 2위다. 레이팅은 같은 벤치 비교로 만든 상대 지표다.
주요 벤치 결과
OpenAI 공개 평가에서 Terminal-Bench 2.1 88.8%, BrowseComp 90.4%, DeepSWE v1.1 72.7%, Agents' Last Exam 52.7%가 1위다. GPQA Diamond는 94.6%로 2위다.
검증과 비교 주의
Z.ai 공개 평가 결과에는 미검증 표기가 있다. 같은 벤치라도 출처·하네스가 다른 점수는 직접 비교하면 안 된다. 멀티모달 레이팅은 1158이며, 세부 벤치 자료는 자료 없음이다.
도입 조건
컨텍스트 1.1M, 최대 출력 128K의 commercial API다. 1M 토큰 가격은 입력 $4.00, 출력 $20.0이다. 같은 공급사에는 GPT-6.1 Sol, GPT-6 Luna, GPT-6 Sol, GPT-6 Astra가 최신 모델로 제시돼 있다.
수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.
분야별 레이팅
비슷한 모델과 비교 →| 분야 | 레이팅 | 분야 순위 | 비교 수 |
|---|---|---|---|
| 코딩 | 3 | 8.4 | |
| 에이전트 | 4 | 10.5 | |
| 추론·지식 | 2 | 11.7 | |
| 멀티모달 | 2 | 3.1 | |
| 과학·보안 | 2 | 10.2 |
분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.
벤치마크 점수
76개 · 프로필별 순위코딩
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| SWE-bench Pro | Public 731 | 64.6% | 10 / 63 | 85 | 확인됨 ↗ |
| SWE-bench Pro | LLM Stats 집계 | 64.6% | 10 / 55 | 83 | 자기보고 ↗ |
| Terminal-Bench 2.1 | LLM Stats 집계 | 88.8% | 4 / 43 | 92 | 자기보고 ↗ |
| DeepSWE 1.1 | LLM Stats 집계 | 73% | 7 / 39 | 84 | 인용 ↗ |
| FrontierCode 1.1 | LLM Stats 집계 | 47.5% | 7 / 22 | 71 | 인용 ↗ |
| Terminal-Bench 4.0 | LLM Stats 집계 | 37.3% | 10 / 21 | 55 | 인용 ↗ |
| DeepSWE | LLM Stats 집계 | 72.7% | 1 / 13 | 100 | 자기보고 ↗ |
| Terminal-Bench 2.1 | OpenAI 공개 평가 | 88.8% | 1 / 8 | 100 | 확인됨 ↗ |
| DeepSWE v1.1 | OpenAI 공개 평가 | 72.7% | 1 / 7 | 100 | 확인됨 ↗ |
| Terminal-Bench 3.0 | Z.ai 공개 평가 | 34.6% | 1 / 6 | 100 | 인용 ↗ |
| PostTrainBench | Z.ai 공개 평가 | 36.2% | 3 / 6 | 60 | 인용 ↗ |
| SWE-Marathon 1.1 | Z.ai 공개 평가 | 42.5% | 4 / 6 | 50 | 인용 ↗ |
| KernelGen 1P | LLM Stats 집계 | 61.1% | 1 / 3 | 100 | 자기보고 ↗ |
| NanoGPT | LLM Stats 집계 | 9.7% | 2 / 3 | 50 | 자기보고 ↗ |
| PostTrainBench Lite | LLM Stats 집계 | 50.3% | 2 / 3 | 50 | 자기보고 ↗ |
에이전트
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| BrowseComp | LLM Stats 집계 | 90.4% | 5 / 47 | 91 | 자기보고 ↗ |
| Toolathlon | LLM Stats 집계 | 58% | 12 / 38 | 70 | 자기보고 ↗ |
| AutomationBench | LLM Stats 집계 | 18.1% | 20 / 24 | 17 | 자기보고 ↗ |
| Agents' Last Exam | LLM Stats 집계 | 52.7% | 3 / 21 | 90 | 자기보고 ↗ |
| OSWorld 2.0 | LLM Stats 집계 | 62.6% | 7 / 14 | 54 | 자기보고 ↗ |
| Toolathlon | OpenAI 공개 평가 | 58% | 5 / 9 | 50 | 확인됨 ↗ |
| BrowseComp | OpenAI 공개 평가 | 90.4% | 1 / 8 | 100 | 확인됨 ↗ |
| GDPval-AA v2 | OpenAI 공개 평가 | 1,748 | 2 / 8 | 86 | 확인됨 ↗ |
| Agents' Last Exam | OpenAI 공개 평가 | 52.7% | 1 / 7 | 100 | 확인됨 ↗ |
| GDPval-AA v2 | Z.ai 공개 평가 | 1,730 | 3 / 7 | 67 | 인용 ↗ |
| BenchCAD | LLM Stats 집계 | 70.6% | 3 / 7 | 67 | 자기보고 ↗ |
| BenchCAD | OpenAI 공개 평가 | 70.6% | 1 / 7 | 100 | 확인됨 ↗ |
| Agents' Last Exam · CLI | Z.ai 공개 평가 | 28.6% | 1 / 7 | 100 | 인용 ↗ |
| AutomationBench 1.0.6 | Z.ai 공개 평가 | 45.8% | 4 / 7 | 50 | 인용 ↗ |
| BenchCAD (with Python tool) | LLM Stats 집계 | 83.4% | 5 / 7 | 33 | 자기보고 ↗ |
| Toolathlon Verified | Z.ai 공개 평가 | 74.9% | 3 / 7 | 67 | 인용 ↗ |
| OSWorld 2.0 | OpenAI 공개 평가 | 62.6% | 1 / 5 | 100 | 확인됨 ↗ |
| Management Consulting Tasks (Internal) | LLM Stats 집계 | 43.2% | 1 / 3 | 100 | 자기보고 ↗ |
추론·지식
멀티모달
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| MMMU-Pro | LLM Stats 집계 | 83% | 3 / 61 | 97 | 자기보고 ↗ |
| gdp.pdf | LLM Stats 집계 | 30.7% | 4 / 8 | 57 | 자기보고 ↗ |
| gdp.pdf | OpenAI 공개 평가 | 30.7% | 1 / 7 | 100 | 확인됨 ↗ |
| MMMU-Pro · no tools | OpenAI 공개 평가 | 83% | 1 / 5 | 100 | 확인됨 ↗ |
| MMMU-Pro (with tools) | LLM Stats 집계 | 84.6% | 1 / 4 | 100 | 자기보고 ↗ |
과학·보안
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| HealthBench Professional | LLM Stats 집계 | 60.5% | 7 / 14 | 54 | 자기보고 ↗ |
| HealthBench | LLM Stats 집계 | 57% | 6 / 10 | 39 | 자기보고 ↗ |
| ExploitBench | LLM Stats 집계 | 73.5% | 3 / 8 | 71 | 자기보고 ↗ |
| ExploitGym | LLM Stats 집계 | 33.7% | 2 / 8 | 86 | 자기보고 ↗ |
| CyberGym | Z.ai 공개 평가 | 83.6% | 3 / 7 | 67 | 인용 ↗ |
| ExploitBench | OpenAI 공개 평가 | 73.5% | 3 / 7 | 67 | 확인됨 ↗ |
| SEC-Bench Pro | LLM Stats 집계 | 71.2% | 2 / 7 | 83 | 자기보고 ↗ |
| GeneBench Pro | OpenAI 공개 평가 | 28.7% | 1 / 7 | 100 | 확인됨 ↗ |
| HealthBench Professional | OpenAI 공개 평가 | 60.5% | 2 / 6 | 80 | 확인됨 ↗ |
| ExploitBench | Z.ai 공개 평가 | 76.5% | 2 / 6 | 80 | 인용 ↗ |
| HealthBench Hard | LLM Stats 집계 | 33.1% | 2 / 6 | 80 | 자기보고 ↗ |
| LifeSciBench | OpenAI 공개 평가 | 59.9% | 1 / 5 | 100 | 확인됨 ↗ |
| SEC-Bench Pro | OpenAI 공개 평가 | 71.2% | 1 / 4 | 100 | 확인됨 ↗ |
| LifeSciBench | LLM Stats 집계 | 59.9% | 2 / 4 | 67 | 자기보고 ↗ |
| GeneBench-Pro | LLM Stats 집계 | 28.7% | 2 / 4 | 67 | 자기보고 ↗ |
| HealthBench Consensus | LLM Stats 집계 | 95.5% | 1 / 4 | 100 | 자기보고 ↗ |
| MedChemBench (Internal) | LLM Stats 집계 | 48.3% | 1 / 3 | 100 | 자기보고 ↗ |
순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.
레이팅이 비슷한 모델
- Claude Opus 5.5 1위 · 1615 비교
- GPT-6 Astra 2위 · 1572 비교
- Claude Sonnet 5.5 3위 · 1527 비교
- Claude Fable 5 5위 · 1410 비교
- Claude Fable 5.1 6위 · 1409 비교
- Claude Opus 5 7위 · 1395 비교
OpenAI의 다른 모델
공급사 →- GPT-6.1 Sol 2026-09-29
- GPT-6 Luna 2026-09-22
- GPT-6 Sol 2026-09-22
- GPT-6 Astra 2026-09-03 · 1572
- GPT-5.6 Luna 2026-07-09 · 1048
- GPT-5.6 Terra 2026-07-09 · 1266
- GPT-5.5 Instant 2026-05-05 · 933
- GPT-5.5 2026-04-23 · 1168