OpenAI · 모델

GPT-5.6 Sol

API출시 2026년 7월 9일OpenAI/gpt-5.6-sol공식 문서 ↗
종합 레이팅1485 · 4위가중 비교 43.9
컨텍스트 창1.1M최대 출력 128K
가격 (입력 / 출력, 1M 토큰)$4.00 / $20.0혼합 $8.00
파라미터—
라이선스commercial API
벤치 점수76개코딩·에이전트·추론·지식·멀티모달·과학·보안

AI AI 해설

2026년 10월 9일 생성

에이전트·과학·보안 레이팅 1위, 대형 컨텍스트를 갖춘 상용 API

종합 평가

종합 레이팅 1414로 1위이며 가중 비교는 21.4다. 분야별로 에이전트 1220, 과학·보안 1204가 1위이고 코딩 1223, 추론·지식 1221은 2위다. 레이팅은 같은 벤치 비교로 만든 상대 지표다.

주요 벤치 결과

OpenAI 공개 평가에서 Terminal-Bench 2.1 88.8%, BrowseComp 90.4%, DeepSWE v1.1 72.7%, Agents' Last Exam 52.7%가 1위다. GPQA Diamond는 94.6%로 2위다.

검증과 비교 주의

Z.ai 공개 평가 결과에는 미검증 표기가 있다. 같은 벤치라도 출처·하네스가 다른 점수는 직접 비교하면 안 된다. 멀티모달 레이팅은 1158이며, 세부 벤치 자료는 자료 없음이다.

도입 조건

컨텍스트 1.1M, 최대 출력 128K의 commercial API다. 1M 토큰 가격은 입력 $4.00, 출력 $20.0이다. 같은 공급사에는 GPT-6.1 Sol, GPT-6 Luna, GPT-6 Sol, GPT-6 Astra가 최신 모델로 제시돼 있다.

수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.

분야레이팅분야 순위비교 수
코딩128638.4
에이전트1220410.5
추론·지식1333211.7
멀티모달120923.1
과학·보안1201210.2
차트를 불러오는 중입니다…

분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.

벤치마크 점수

76개 · 프로필별 순위

코딩

벤치프로필점수순위백분위출처
SWE-bench ProPublic 73164.6%10 / 6385확인됨 ↗
SWE-bench ProLLM Stats 집계64.6%10 / 5583자기보고 ↗
Terminal-Bench 2.1LLM Stats 집계88.8%4 / 4392자기보고 ↗
DeepSWE 1.1LLM Stats 집계73%7 / 3984인용 ↗
FrontierCode 1.1LLM Stats 집계47.5%7 / 2271인용 ↗
Terminal-Bench 4.0LLM Stats 집계37.3%10 / 2155인용 ↗
DeepSWELLM Stats 집계72.7%1 / 13100자기보고 ↗
Terminal-Bench 2.1OpenAI 공개 평가88.8%1 / 8100확인됨 ↗
DeepSWE v1.1OpenAI 공개 평가72.7%1 / 7100확인됨 ↗
Terminal-Bench 3.0Z.ai 공개 평가34.6%1 / 6100인용 ↗
PostTrainBenchZ.ai 공개 평가36.2%3 / 660인용 ↗
SWE-Marathon 1.1Z.ai 공개 평가42.5%4 / 650인용 ↗
KernelGen 1PLLM Stats 집계61.1%1 / 3100자기보고 ↗
NanoGPTLLM Stats 집계9.7%2 / 350자기보고 ↗
PostTrainBench LiteLLM Stats 집계50.3%2 / 350자기보고 ↗

에이전트

벤치프로필점수순위백분위출처
BrowseCompLLM Stats 집계90.4%5 / 4791자기보고 ↗
ToolathlonLLM Stats 집계58%12 / 3870자기보고 ↗
AutomationBenchLLM Stats 집계18.1%20 / 2417자기보고 ↗
Agents' Last ExamLLM Stats 집계52.7%3 / 2190자기보고 ↗
OSWorld 2.0LLM Stats 집계62.6%7 / 1454자기보고 ↗
ToolathlonOpenAI 공개 평가58%5 / 950확인됨 ↗
BrowseCompOpenAI 공개 평가90.4%1 / 8100확인됨 ↗
GDPval-AA v2OpenAI 공개 평가1,7482 / 886확인됨 ↗
Agents' Last ExamOpenAI 공개 평가52.7%1 / 7100확인됨 ↗
GDPval-AA v2Z.ai 공개 평가1,7303 / 767인용 ↗
BenchCADLLM Stats 집계70.6%3 / 767자기보고 ↗
BenchCADOpenAI 공개 평가70.6%1 / 7100확인됨 ↗
Agents' Last Exam · CLIZ.ai 공개 평가28.6%1 / 7100인용 ↗
AutomationBench 1.0.6Z.ai 공개 평가45.8%4 / 750인용 ↗
BenchCAD (with Python tool)LLM Stats 집계83.4%5 / 733자기보고 ↗
Toolathlon VerifiedZ.ai 공개 평가74.9%3 / 767인용 ↗
OSWorld 2.0OpenAI 공개 평가62.6%1 / 5100확인됨 ↗
Management Consulting Tasks (Internal)LLM Stats 집계43.2%1 / 3100자기보고 ↗

추론·지식

벤치프로필점수순위백분위출처
GPQA DiamondLLM Stats 집계94.6%3 / 9098자기보고 ↗
MRCR v2 (8-needle)LLM Stats 집계91.5%4 / 2286자기보고 ↗
Graphwalks BFS >128kLLM Stats 집계90.7%3 / 1282자기보고 ↗
GPQA DiamondOpenAI 공개 평가94.6%2 / 994확인됨 ↗
Artificial AnalysisLLM Stats 집계59%1 / 7100인용 ↗
FrontierMathLLM Stats 집계89%1 / 7100자기보고 ↗
FrontierMath Tier 1-3 v2OpenAI 공개 평가89%1 / 7100확인됨 ↗
HLE · with toolsZ.ai 공개 평가64.5%1 / 7100인용 ↗
ARC-AGI-3OpenAI 공개 평가7.8%1 / 6100확인됨 ↗
ProgramBench · Almost SolvedZ.ai 공개 평가23%2 / 680인용 ↗
ARC-AGI-3LLM Stats 집계7.8%3 / 550자기보고 ↗
FrontierMath Tier 4 (v2)LLM Stats 집계83%2 / 467자기보고 ↗
MRCR v2 · 512K–1MOpenAI 공개 평가73.8%2 / 467확인됨 ↗
MRCR v2 (8-needle, 512K-1M)LLM Stats 집계73.8%2 / 467자기보고 ↗
Big Finance BenchLLM Stats 집계53%1 / 3100자기보고 ↗
Capture-the-Flag Challenges (Internal)LLM Stats 집계96.7%1 / 3100자기보고 ↗
ConnectorsLLM Stats 집계100%1 / 375자기보고 ↗
Graphwalks BFS 1MLLM Stats 집계77.1%1 / 3100자기보고 ↗
Internal Research Debugging EvaluationLLM Stats 집계68.3%1 / 3100자기보고 ↗
RSI IndexLLM Stats 집계57.9%1 / 3100자기보고 ↗
Search and Function-CallingLLM Stats 집계91%2 / 350자기보고 ↗

멀티모달

벤치프로필점수순위백분위출처
MMMU-ProLLM Stats 집계83%3 / 6197자기보고 ↗
gdp.pdfLLM Stats 집계30.7%4 / 857자기보고 ↗
gdp.pdfOpenAI 공개 평가30.7%1 / 7100확인됨 ↗
MMMU-Pro · no toolsOpenAI 공개 평가83%1 / 5100확인됨 ↗
MMMU-Pro (with tools)LLM Stats 집계84.6%1 / 4100자기보고 ↗

과학·보안

벤치프로필점수순위백분위출처
HealthBench ProfessionalLLM Stats 집계60.5%7 / 1454자기보고 ↗
HealthBenchLLM Stats 집계57%6 / 1039자기보고 ↗
ExploitBenchLLM Stats 집계73.5%3 / 871자기보고 ↗
ExploitGymLLM Stats 집계33.7%2 / 886자기보고 ↗
CyberGymZ.ai 공개 평가83.6%3 / 767인용 ↗
ExploitBenchOpenAI 공개 평가73.5%3 / 767확인됨 ↗
SEC-Bench ProLLM Stats 집계71.2%2 / 783자기보고 ↗
GeneBench ProOpenAI 공개 평가28.7%1 / 7100확인됨 ↗
HealthBench ProfessionalOpenAI 공개 평가60.5%2 / 680확인됨 ↗
ExploitBenchZ.ai 공개 평가76.5%2 / 680인용 ↗
HealthBench HardLLM Stats 집계33.1%2 / 680자기보고 ↗
LifeSciBenchOpenAI 공개 평가59.9%1 / 5100확인됨 ↗
SEC-Bench ProOpenAI 공개 평가71.2%1 / 4100확인됨 ↗
LifeSciBenchLLM Stats 집계59.9%2 / 467자기보고 ↗
GeneBench-ProLLM Stats 집계28.7%2 / 467자기보고 ↗
HealthBench ConsensusLLM Stats 집계95.5%1 / 4100자기보고 ↗
MedChemBench (Internal)LLM Stats 집계48.3%1 / 3100자기보고 ↗

순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.

레이팅이 비슷한 모델

OpenAI의 다른 모델

공급사 →

관련 소식

euno.news 패밀리 기사