OpenAI · 모델

GPT-5.4

API출시 2026년 3월 5일LLMStats/gpt-5.4공식 문서 ↗
종합 레이팅1268 · 41위레이팅 벤치 35개
컨텍스트 창1M
가격 (입력 / 출력, 1M 토큰)$2.50 / $15.0혼합 $5.63
파라미터—
라이선스—
벤치 점수37개코딩·에이전트·추론·지식·멀티모달·과학·보안·속도·비용

AI AI 해설

2026년 10월 9일 생성

GPT-5.4는 추론·지식이 강점이며 과학·보안은 자료 없음

종합 평가

종합 레이팅은 1157(41위), 가중 비교는 10.5다. 분야별로 추론·지식 1192(19위), 멀티모달 1065, 코딩 1020(52위), 에이전트 970(43위)다.

벤치마크

LLM Stats 집계에서 LiveBench 80.3%(2/23), Tau2 Telecom 98.9%(2/20), Graphwalks BFS >128k 93%(2/12), ARC-AGI v2 73.3%(4/14)를 기록했다. 모든 점수는 미검증이다.

도입 조건

OpenAI의 상용 API 모델이다. 컨텍스트는 1M이며 입력·출력 가격은 1M 토큰당 $2.50/$15.0이다. 최대 출력과 라이선스는 자료 없음이다.

판단 시 유의점

과학·보안 분야는 자료 없음이다. 같은 공급사의 최신 모델로 GPT-6.1 Sol(2026-09-29), GPT-6 Luna·GPT-6 Sol(2026-09-22), GPT-6 Astra(2026-09-03)가 제시돼 있다.

수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.

분야레이팅분야 순위벤치 수
코딩1112446
에이전트1023548
추론·지식12702116
멀티모달1073273
과학·보안1116242
차트를 불러오는 중입니다…

분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.

벤치마크 점수

37개 · 프로필별 순위

코딩

벤치프로필점수순위백분위출처
Terminal-Bench 2.1Artificial Analysis78.3%26 / 9774확인됨 ↗
Terminal-Bench HardArtificial Analysis57.6%5 / 9395확인됨 ↗
SWE-bench ProLLM Stats 집계57.7%29 / 5548자기보고 ↗
Terminal-Bench 2.0LLM Stats 집계75.1%6 / 4087자기보고 ↗
DeepSWE 1.1LLM Stats 집계52%31 / 3921인용 ↗
FrontierSWELLM Stats 집계54%11 / 1738인용 ↗

에이전트

벤치프로필점수순위백분위출처
GDPval-AAArtificial Analysis37.4%38 / 10464확인됨 ↗
BrowseCompLLM Stats 집계82.7%20 / 4759자기보고 ↗
ToolathlonLLM Stats 집계54.6%15 / 3862자기보고 ↗
MCP Atlas · PublicLLM Stats 집계67.2%26 / 3629자기보고 ↗
OSWorld-VerifiedLLM Stats 집계75%14 / 2648자기보고 ↗
APEX AgentsArtificial Analysis33.3%7 / 2271확인됨 ↗
Legal Agent BenchmarkLLM Stats 집계0.4%11 / 1423인용 ↗
Finance AgentLLM Stats 집계56%6 / 829자기보고 ↗

추론·지식

벤치프로필점수순위백분위출처
Humanity's Last ExamArtificial Analysis43.7%20 / 14186확인됨 ↗
Intelligence IndexArtificial Analysis39.027 / 14181확인됨 ↗
AA-LCRArtificial Analysis82%25 / 13983확인됨 ↗
CritPTArtificial Analysis23.4%14 / 13990확인됨 ↗
GPQA DiamondArtificial Analysis92.0%23 / 13083확인됨 ↗
IFBenchArtificial Analysis73.9%22 / 9779확인됨 ↗
τ²-Bench TelecomArtificial Analysis87.1%38 / 9661확인됨 ↗
GPQA DiamondLLM Stats 집계92.8%11 / 9089자기보고 ↗
Humanity's Last ExamLLM Stats 집계39.8%35 / 6446자기보고 ↗
LiveBenchLLM Stats 집계80.3%2 / 2395인용 ↗
Tau2 TelecomLLM Stats 집계98.9%2 / 2095자기보고 ↗
ARC-AGI v2LLM Stats 집계73.3%4 / 1477자기보고 ↗
Graphwalks BFS >128kLLM Stats 집계93%2 / 1291자기보고 ↗
Graphwalks parents >128kLLM Stats 집계89.8%3 / 871자기보고 ↗
ARC-AGILLM Stats 집계93.7%3 / 767자기보고 ↗
FrontierMathLLM Stats 집계47.6%4 / 750자기보고 ↗

멀티모달

벤치프로필점수순위백분위출처
MMMU-ProArtificial Analysis78.4%27 / 6962확인됨 ↗
MMMU-ProLLM Stats 집계81.2%9 / 6188자기보고 ↗
OmniDocBench 1.5LLM Stats 집계89.1%8 / 2063자기보고 ↗

과학·보안

벤치프로필점수순위백분위출처
AA-Omniscience AccuracyArtificial Analysis50.9%18 / 13988확인됨 ↗
AA-Omniscience IndexArtificial Analysis5.835 / 13975확인됨 ↗

속도·비용

벤치프로필점수순위백분위출처
Artificial Analysis Output SpeedArtificial Analysis91 tok/s49 / 10855확인됨 ↗
Artificial Analysis Time to First ChunkArtificial Analysis168.38초101 / 1087확인됨 ↗

순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.

레이팅이 비슷한 모델

OpenAI의 다른 모델

공급사 →

관련 소식

euno.news 패밀리 기사