xAI · 모델

Grok 4.5

API출시 2026년 7월 16일LLMStats/grok-4.5공식 문서 ↗
종합 레이팅1291 · 35위레이팅 벤치 23개
컨텍스트 창500K
가격 (입력 / 출력, 1M 토큰)$2.00 / $6.00혼합 $3.00
파라미터—
라이선스—
벤치 점수28개코딩·에이전트·추론·지식·멀티모달·과학·보안·속도·비용

AI AI 해설

2026년 10월 9일 생성

Grok 4.5는 500K 컨텍스트를 제공하는 상용 API 모델

종합 평가

종합 레이팅은 1121(52위), 가중 비교는 6이다. 레이팅은 같은 벤치 비교를 바탕으로 만든 상대 지표다.

분야별 성능

코딩 1016(54위), 에이전트 1047, 추론·지식 1051, 과학·보안 1054다. 멀티모달은 자료 없음이다.

주요 벤치 결과

LLM Stats 집계에서 GPQA Diamond 93%(미검증)·9/90, SWE-bench Pro 64.7%(미검증)·9/55, Terminal-Bench 2.1 83.3%(미검증)·18/43이다. 출처가 같아도 서로 다른 벤치의 점수는 직접 비교하기 어렵다.

도입 조건

상용 API로 제공되며 컨텍스트는 500K다. 가격은 1M 토큰당 입력 $2.00, 출력 $6.00이다. 최대 출력과 라이선스는 자료 없음이며, 같은 공급사의 최신 모델도 없다.

수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.

분야레이팅분야 순위벤치 수
코딩1106489
에이전트1078362
추론·지식1218357
멀티모달1070—1
과학·보안1156134
차트를 불러오는 중입니다…

분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.

벤치마크 점수

28개 · 프로필별 순위

코딩

벤치프로필점수순위백분위출처
Terminal-Bench 2.1Artificial Analysis81.6%18 / 9782확인됨 ↗
SciCodeArtificial Analysis55.0%21 / 8477확인됨 ↗
SWE-bench ProLLM Stats 집계64.7%9 / 5585자기보고 ↗
Terminal-Bench 2.1LLM Stats 집계83.3%18 / 4360자기보고 ↗
DeepSWE 1.1LLM Stats 집계54%29 / 3928인용 ↗
FrontierCode 1.1LLM Stats 집계42.4%14 / 2240인용 ↗
Terminal-Bench 4.0LLM Stats 집계12.4%20 / 218인용 ↗
DeepSWELLM Stats 집계53%9 / 1333자기보고 ↗
SWE-MarathonLLM Stats 집계29%4 / 525자기보고 ↗
DeepSWE 1.0LLM Stats 집계62%1 / 150자기보고 ↗

에이전트

벤치프로필점수순위백분위출처
GDPval-AAArtificial Analysis44.5%32 / 10470확인됨 ↗
Tau3 BankingLLM Stats 집계33%2 / 1089인용 ↗
AutomationBench-AALLM Stats 집계51.4%1 / 150인용 ↗

추론·지식

벤치프로필점수순위백분위출처
Humanity's Last ExamArtificial Analysis42.7%23 / 14184확인됨 ↗
Intelligence IndexArtificial Analysis38.828 / 14181확인됨 ↗
AA-LCRArtificial Analysis79.3%42 / 13970확인됨 ↗
CritPTArtificial Analysis15.4%33 / 13977확인됨 ↗
GPQA DiamondArtificial Analysis93.1%11 / 13092확인됨 ↗
GPQA DiamondLLM Stats 집계93%9 / 9091인용 ↗
Artificial AnalysisLLM Stats 집계54%5 / 733인용 ↗

멀티모달

벤치프로필점수순위백분위출처
MMMU-ProArtificial Analysis80.4%17 / 6976확인됨 ↗

과학·보안

벤치프로필점수순위백분위출처
AA-Omniscience AccuracyArtificial Analysis51.6%16 / 13989확인됨 ↗
AA-Omniscience IndexArtificial Analysis25.315 / 13990확인됨 ↗
AA-Omniscience IndexLLM Stats 집계1261 / 3100인용 ↗
OmniScienceLLM Stats 집계52%2 / 350인용 ↗
OmniScience (non-hallucination rate)LLM Stats 집계46%1 / 150인용 ↗

속도·비용

벤치프로필점수순위백분위출처
Artificial Analysis Output SpeedArtificial Analysis49 tok/s90 / 10817확인됨 ↗
Artificial Analysis Time to First ChunkArtificial Analysis18.13초80 / 10826확인됨 ↗

순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.

레이팅이 비슷한 모델