벤치마크

분야별 AI 벤치마크

측정 모델이 3개 이상인 벤치마크 310종을 분야별로 묶었습니다(전체 538종 중). 같은 이름이라도 문항·하네스·출처가 다르면 프로필로 나눠 각각 순위를 매깁니다. 측정 모델이 적은 벤치는 각 모델 페이지의 점수표에만 나옵니다.

데이터 기준 2026년 10월 9일

코딩 저장소 수정, 코드 생성, 터미널 작업

33종
벤치마크대표 프로필측정 모델1위최고점
SWE-bench Verified 프로필 2LLM Stats 집계95Claude Fable 595%
SWE-bench Pro 프로필 3Public 73188Claude Fable 5.181.2%
Terminal-Bench 2.0 프로필 2LLM Stats 집계62GPT-5.582.7%
Terminal-Bench 2.1 프로필 4LLM Stats 집계62DeepSeek-V4.1-Flash90.6%
SWE-bench Multilingual 프로필 2LLM Stats 집계52Claude Opus 5.593.9%
LiveCodeBench v6 프로필 2LLM Stats 집계51Qwen3.8 Flash91.9%
DeepSWE 1.1LLM Stats 집계39Muse Spark 1.375.4%
SciCode 프로필 3LLM Stats 집계31Mistral Large 491.8%
DeepSWE 프로필 2HF 리더보드28DeepSeek-V4.1-Flash74.2%
FrontierCode 1.1 프로필 2LLM Stats 집계23Claude Opus 5.554.4%
Terminal-Bench 4.0LLM Stats 집계21Claude Sonnet 5.570.6%
IMO-AnswerBenchLLM Stats 집계18Nemotron 3 Ultra (550B A55B)92.3%
FrontierSWE 프로필 2LLM Stats 집계17Claude Fable 590%
LiveCodeBenchLLM Stats 집계13DeepSeek-V4-Pro-Max93.5%
Terminal-Bench 3.0 프로필 3Z.ai 공개 평가11GPT-5.6 Sol34.6%
CodeForcesLLM Stats 집계10DeepSeek-V4.1-Flash3,471
DeepSWE v1.1 프로필 2OpenAI 공개 평가10GPT-5.6 Sol72.7%
PostTrainBench 프로필 2LLM Stats 집계10GLM-5.339.8%
Long-Horizon Terminal BenchHF 리더보드9Kimi-K36.0
Terminal-BenchLLM Stats 집계9MiniMax-M2.147.9%
SWE-Marathon 1.1Z.ai 공개 평가6Claude Opus 4.848.8%
LiveCodeBench ProLLM Stats 집계5Gemini 3.1 Pro2,887
SWE Atlas - Codebase QnALLM Stats 집계5Mistral Large 459.4%
SWE-MarathonLLM Stats 집계5GLM-5.342.5%
AetherCodeLLM Stats 집계4Seed 2.1 Turbo67.9%
Code ArenaGoogle 공개 평가4Gemini 3.7 Flash1,588
Multi-SWE-BenchLLM Stats 집계4MiniMax-M2.149.4%
FrontierCodeLLM Stats 집계3Claude Opus 553.4%
FrontierSWE V2LLM Stats 집계3Claude Opus 5.562.3%
KernelGen 1PLLM Stats 집계3GPT-5.6 Sol61.1%
NanoGPTLLM Stats 집계3GPT-5.6 Terra14.5%
PostTrainBench LiteLLM Stats 집계3GPT-5.6 Terra51.5%
QwenSWEBench 프로필 2LLM Stats 집계3Qwen3.8 Max80.7%

에이전트 도구 사용, 브라우징, 컴퓨터 조작

41종
벤치마크대표 프로필측정 모델1위최고점
BrowseComp 프로필 2LLM Stats 집계49Atria Dawn Preview92.5%
Toolathlon 프로필 2LLM Stats 집계42GLM-5.3-Flash78.4%
MCP Atlas · Public 프로필 2LLM Stats 집계37Muse Spark 1.188.1%
Claw-Eval 프로필 2HF 리더보드29Ornith-1.5-397B81.4%
OSWorld-VerifiedLLM Stats 집계26Qwen3.8 Max86.1%
Agents' Last Exam 프로필 2LLM Stats 집계25GPT-6 Astra59.3%
AutomationBenchLLM Stats 집계24Mistral Large 459.9%
WildClawBench 프로필 2HF 리더보드24dots3-note-prev61.7%
Finance Agent v2LLM Stats 집계21Ling 3.1 Flash57.9%
SkillsBench 프로필 2LLM Stats 집계19Qwen3.8 Max70.2%
OSWorldLLM Stats 집계18Seed 2.1 Pro78.8%
OSWorld 2.0 프로필 2LLM Stats 집계16Claude Opus 5.581.8%
Legal Agent BenchmarkLLM Stats 집계14Claude Fable 513.3%
APEX AgentsHF 리더보드13Kimi-K341%
DeepSearch QA 프로필 2LLM Stats 집계12Atria Dawn Preview96%
GDPval-AA v2 프로필 2OpenAI 공개 평가12Claude Fable 51,760
BenchCAD 프로필 2LLM Stats 집계11Claude Sonnet 5.574.7%
GDPval-AALLM Stats 집계11Claude Fable 5.11,853
Tau3 Banking 프로필 2LLM Stats 집계11Atria Dawn Preview41.2%
APEX-AgentsLLM Stats 집계8Kimi-K337.6%
BrowseComp-zhLLM Stats 집계8Seed 1.881.3%
Finance AgentLLM Stats 집계8Claude Opus 4.764.4%
MCP-MarkLLM Stats 집계8Kimi-K2.7-Code81.1%
Agents' Last Exam · CLIZ.ai 공개 평가7GPT-5.6 Sol28.6%
AutomationBench 1.0.6Z.ai 공개 평가7GLM-5.348.2%
BenchCAD (with Python tool)LLM Stats 집계7Claude Sonnet 5.596.3%
CoWorkBench 프로필 2LLM Stats 집계7Qwen3.8 Max74.8%
TAU3-BenchLLM Stats 집계7Qwen3.6 Plus70.7%
Toolathlon VerifiedZ.ai 공개 평가7Kimi-K376.5%
ClawEval-MMLLM Stats 집계6Qwen3.8 Flash60.4%
GDPval-AA 2.1LLM Stats 집계6Claude Opus 5.51,846
AA-Briefcase EloArtificial Analysis4Claude Opus 51,685
AA-Briefcase Rubric Pass RateArtificial Analysis4Claude Opus 557.2%
AA-Briefcase v1.1LLM Stats 집계4Claude Opus 5.51,822
AutomationBench v1.0.6LLM Stats 집계4MiMo-V2.6-Pro53.1%
GDPvalLLM Stats 집계4Seed 2.1 Pro87.9%
JobBench 프로필 2LLM Stats 집계4MiMo-V2.6-Pro62%
Toolathlon-VerifiedLLM Stats 집계4Claude Opus 5.577.8%
AA-BriefcaseLLM Stats 집계3Kimi-K31,548
Management Consulting Tasks (Internal)LLM Stats 집계3GPT-5.6 Sol43.2%
ZClawBenchLLM Stats 집계3Qwen3.7 Max64.3%

추론·지식 지식, 수학, 추론, 지시 따르기, 장문맥

189종
벤치마크대표 프로필측정 모델1위최고점
GPQA Diamond 프로필 4LLM Stats 집계147GPT-6 Astra96%
MMLU-Pro 프로필 2LLM Stats 집계101Sakana Namazu90.3%
Humanity's Last Exam 프로필 3LLM Stats 집계95Claude Fable 5.165%
IFBench 프로필 3LLM Stats 집계43Qwen3.8 Max82.8%
AIME 2025LLM Stats 집계40Gemini 3 Pro100%
AIME 2026 프로필 2LLM Stats 집계40GLM-5.299.2%
MMMLULLM Stats 집계30Claude Mythos Preview92.7%
LVBenchLLM Stats 집계28Gemini 3.8 Flash87.1%
SuperGPQALLM Stats 집계28Qwen3.7 Max73.6%
AA-LCR 프로필 3LLM Stats 집계27Solar Mini 483.3%
ERQALLM Stats 집계25Qwen3.8 Max77.8%
MMLU-ReduxLLM Stats 집계25Qwen3.7 Max95%
IFEvalLLM Stats 집계24Qwen3.5-27B95%
MMLU-ProXLLM Stats 집계24Qwen3.7 Max87%
NL2Repo 프로필 3LLM Stats 집계24DeepSeek-V4.1-Flash64%
LiveBenchLLM Stats 집계23GPT-5.580.7%
BFCL-V4LLM Stats 집계22Atria Dawn Preview77%
IncludeLLM Stats 집계22Claude Opus 4.887.6%
MathVista-MiniLLM Stats 집계22Kimi-K2.590.1%
MMStarLLM Stats 집계22Qwen3.6 Plus83.3%
MRCR v2 (8-needle)LLM Stats 집계22Muse Spark 1.398.5%
HMMT25LLM Stats 집계20Qwen3.6 Plus94.6%
Tau2 TelecomLLM Stats 집계20Claude Opus 4.699.3%
Hallusion BenchLLM Stats 집계19Qwen3.5-27B70%
HMMT February 2026HF 리더보드19Darwin-180B-RSI100%
Multi-ChallengeLLM Stats 집계19Nova 2 Pro77.7%
PolyMATHLLM Stats 집계19Qwen3.7 Max86.5%
t2-benchLLM Stats 집계19Gemini 3.1 Pro99.3%
AI2DLLM Stats 집계18Qwen3.6 Plus94.4%
CC-OCRLLM Stats 집계18Qwen3.6 Plus83.4%
GSM8KHF 리더보드18MiMo-V2.5-Pro99.6%
OCRBenchLLM Stats 집계18Kimi-K2.592.3%
MVBenchLLM Stats 집계16GLM-5.3-Flash77.8%
WMT24++LLM Stats 집계16Nemotron 3 Super (120B A12B)86.7%
BLINKLLM Stats 집계15Seed 2.1 Pro81.4%
Global PIQALLM Stats 집계15Gemini 3 Pro93.4%
HMMT 2025LLM Stats 집계15GPT-5.299.4%
MMBench-V1.1LLM Stats 집계15Qwen3.5-122B-A10B92.8%
ODinWLLM Stats 집계15Qwen3.6 Plus51.8%
SimpleVQALLM Stats 집계15Seed 1.865.4
WideSearchLLM Stats 집계15Hy4-preview83.9%
ARC-AGI v2LLM Stats 집계14GPT-6 Astra95%
LongBench v2LLM Stats 집계14Qwen3.8 Max66.3%
BFCL-v3LLM Stats 집계13GLM-4.577.8%
HMMT Feb 26LLM Stats 집계13Qwen3.7 Max97.1%
MMLULLM Stats 집계13Seed 1.892.3%
MuirBenchLLM Stats 집계13Qwen3 VL 32B Thinking80.3%
OCRBench-V2 (en)LLM Stats 집계13Qwen3 VL 32B Thinking68.4%
Program BenchLLM Stats 집계13Claude Opus 5.591.2%
ZEROBenchLLM Stats 집계13Seed 1.811.0
Arena-Hard v2LLM Stats 집계12Qwen3 VL 235B A22B Instruct77.4%
C-EvalLLM Stats 집계12Qwen3 Max Thinking93.7%
CharadesSTALLM Stats 집계12Qwen3 VL 235B A22B Instruct64.8%
Graphwalks BFS >128kLLM Stats 집계12GPT-5.294%
MAXIFELLM Stats 집계12Qwen3.7 Max89.2%
Multi-IFLLM Stats 집계12Ling-3.0-flash87.7%
NOVA-63LLM Stats 집계12Qwen3.5-397B-A17B59.1%
OfficeQA ProLLM Stats 집계12Seed 2.1 Pro72.2%
SimpleQALLM Stats 집계12Gemini 3 Pro72.1%
Humanity's Last Exam (no tools, text-only)LLM Stats 집계11Claude Opus 5.564.4%
InfoVQAtestLLM Stats 집계11Kimi-K2.592.6%
MathArena ApexLLM Stats 집계11DeepSeek-V4-Pro-Max90.2%
MedXpertQALLM Stats 집계11Muse Spark78.4%
OCRBench-V2 (zh)LLM Stats 집계11Qwen3 VL 235B A22B Thinking63.5%
VITA-BenchLLM Stats 집계11Qwen3.5-397B-A17B49.7%
WritingBenchLLM Stats 집계11Qwen3 VL 235B A22B Thinking86.7%
DeepPlanningLLM Stats 집계10Qwen3.7-Plus62.3%
DocVQAtestLLM Stats 집계10Qwen3 VL 235B A22B Instruct97.1%
Humanity's Last Exam (with tools, text-only)LLM Stats 집계10Claude Opus 5.567.7%
LiveBench 20241125LLM Stats 집계10Qwen3 VL 235B A22B Thinking79.6%
MLVULLM Stats 집계10Qwen3.7-Plus87.4%
MM-MT-BenchLLM Stats 집계10Qwen3 VL 235B A22B Instruct8.5
Tau2 RetailLLM Stats 집계10Claude Opus 4.691.9%
DynaMathLLM Stats 집계9Qwen3.6 Plus88%
AndroidWorld_SRLLM Stats 집계8Qwen3.5-35B-A3B71.1%
ARC-AGI-3 프로필 2OpenAI 공개 평가8GPT-5.6 Sol7.8%
CountBenchLLM Stats 집계8Seed 1.896.3
Creative Writing v3LLM Stats 집계8Qwen3 VL 235B A22B Instruct86.5%
EmbSpatialBenchLLM Stats 집계8Qwen3.6-27B0.8
Graphwalks parents >128kLLM Stats 집계8Claude Opus 4.695.4%
Job BenchLLM Stats 집계8Muse Spark 1.364.9%
MLVU-MLLM Stats 집계8Qwen3 VL 32B Instruct82.1%
RefCOCO-avgLLM Stats 집계8Qwen3.6 Plus0.9
RefSpatialBenchLLM Stats 집계8Seed 1.856.3
Tau2 AirlineLLM Stats 집계8Nova 2 Omni68.8%
AndroidWorldLLM Stats 집계7Qwen3.8 Max85.3%
ARC-AGILLM Stats 집계7GPT-6 Astra98.5%
Artificial AnalysisLLM Stats 집계7GPT-5.6 Sol59%
BioMysteryBenchLLM Stats 집계7Claude Opus 590.1%
FrontierMathLLM Stats 집계7GPT-5.6 Sol89%
FrontierMath Tier 1-3 v2OpenAI 공개 평가7GPT-5.6 Sol89%
HLE · with toolsZ.ai 공개 평가7GPT-5.6 Sol64.5%
MMVULLM Stats 집계7GLM-5.3-Flash80.5%
OCRBench_V2LLM Stats 집계7Qwen3.7-Plus67.1%
Seal-0LLM Stats 집계7Kimi-K2.557.4%
BIG-Bench Extra HardLLM Stats 집계6Gemma 4 31B74.4%
CritPTLLM Stats 집계6Hy4-preview16.9%
MMLongBench-DocLLM Stats 집계6Qwen3.6 Plus0.6
ProgramBench · Almost SolvedZ.ai 공개 평가6Claude Fable 533%
V*LLM Stats 집계6Kimi-K2.696.9%
VLMsAreBlindLLM Stats 집계6Qwen3.5-35B-A3B97%
WorldVQALLM Stats 집계6Qwen3.7-Plus61.1%
ZEROBench-SubLLM Stats 집계6Qwen3.5-122B-A10B0.4
ArXivMathLLM Stats 집계5Claude Opus 5.591.2%
Beyond AIMELLM Stats 집계5Seed 2.1 Turbo88%
ChartographyLLM Stats 집계5Claude Sonnet 5.590.2%
MotionBenchLLM Stats 집계5Seed 2.1 Pro74.9%
OJBenchLLM Stats 집계5Kimi-K2.660.6%
SuperChemLLM Stats 집계5Hy4-preview66.4%
TVBenchLLM Stats 집계5Seed 2.1 Pro80.5%
AA Intelligence IndexGoogle 공개 평가4GPT-5.6 Terra57.0
Artifacts BenchLLM Stats 집계4Ling-3.0-flash77%
ChartQAProLLM Stats 집계4Seed 2.1 Pro70.9%
CSimpleQALLM Stats 집계4DeepSeek-V4-Pro-Max84.4%
DocVQALLM Stats 집계4Qwen2.5-VL-72B-Instruct96.4%
DRACOLLM Stats 집계4Ling 3.1 Flash85.5%
DUDELLM Stats 집계4Seed 2.1 Turbo83.1%
EMMALLM Stats 집계4Seed 2.1 Pro79.3%
FrontierMath Tier 4 (v2)LLM Stats 집계4GPT-6 Astra97.6%
HorizonMathLLM Stats 집계4Hy4-preview8.8%
HypersimLLM Stats 집계4Qwen3.5-35B-A3B0.1
Intelligence Index v4.1.1Artificial Analysis4Claude Opus 563.1
LingoQALLM Stats 집계4Qwen3.7-Plus83.4%
LiveSports-3KLLM Stats 집계4Seed 1.877.5%
MathVistaLLM Stats 집계4Seed 2.1 Pro90.7%
MinervaLLM Stats 집계4Seed 2.1 Pro70.7%
MRCR v2 · 512K–1MOpenAI 공개 평가4GPT-5.574%
MRCR v2 (8-needle, 512K-1M)LLM Stats 집계4Muse Spark 1.398.1%
OneMillion BenchLLM Stats 집계4Seed 2.1 Pro68.8%
OVBenchLLM Stats 집계4Seed 2.1 Pro70%
OVOBenchLLM Stats 집계4Seed 2.1 Pro80.7%
PinchBenchLLM Stats 집계4Nemotron 3 Ultra (550B A55B)90%
ProfBenchLLM Stats 집계4Nemotron 3 Ultra (550B A55B)56%
SimpleQA VerifiedLLM Stats 집계4Inkling43.9%
SUNRGBDLLM Stats 집계4Qwen3.5-122B-A10B0.4
TempCompassLLM Stats 집계4Seed 1.886.9%
TIR-BenchLLM Stats 집계4Qwen3.6 Plus61.6%
TOMATOLLM Stats 집계4Seed 2.1 Pro79.5%
Vending-Bench 2LLM Stats 집계4Claude Opus 4.6801,759%
VisFactorLLM Stats 집계4Seed 2.1 Pro51.4%
VisuLogicLLM Stats 집계4Seed 2.1 Pro0.5
VLMsAreBiasedLLM Stats 집계4Seed 2.1 Pro83.6%
Workspace BenchLLM Stats 집계4Qwen3.8 Max67.7%
AA-IndexLLM Stats 집계3GLM-4.567.7%
AITZ_EMLLM Stats 집계3Qwen2.5-VL-72B-Instruct83.2%
Android Control High_EMLLM Stats 집계3Qwen2.5 VL 32B Instruct69.6%
Android Control Low_EMLLM Stats 집계3Qwen2.5-VL-72B-Instruct93.7%
ArcAGI2LLM Stats 집계3Seed 2.1 Pro62.5%
Big Finance BenchLLM Stats 집계3GPT-5.6 Sol53%
Bird-SQL (dev)LLM Stats 집계3IBM Granite 4.2 30B41.9%
Capture-the-Flag Challenges (Internal)LLM Stats 집계3GPT-5.6 Sol96.7%
ChartQALLM Stats 집계3Qwen2.5-VL-72B-Instruct89.5%
CL-benchLLM Stats 집계3Hy323.8%
COLLIELLM Stats 집계3Mistral Medium 3.595.8%
ConnectorsLLM Stats 집계3GPT-5.6 Sol100%
ContPhyLLM Stats 집계3Seed 2.1 Pro63.6%
CorpusQA 1MLLM Stats 집계3DeepSeek-V4-Pro-Max62%
CrossVidLLM Stats 집계3Seed 2.1 Pro65%
DSBench-HardLLM Stats 집계3DeepSeek-V4-Pro-081367.2%
FullStackBench enLLM Stats 집계3Qwen3.5-122B-A10B62.6%
FullStackBench zhLLM Stats 집계3Qwen3.5-122B-A10B58.7%
Global-MMLULLM Stats 집계3Claude Opus 5.594.3%
Graphwalks BFS 1MLLM Stats 집계3GPT-5.6 Sol77.1%
HLE-VerifiedLLM Stats 집계3Gemini 3.8 Flash54.9%
Humanity's Last Exam (with tools)LLM Stats 집계3Claude Sonnet 5.564.5%
Internal Research Debugging EvaluationLLM Stats 집계3GPT-5.6 Sol68.3%
LatchBio SingleCellBenchLLM Stats 집계3Claude Opus 5.561.2%
LatchBio SpatialBench VerifiedLLM Stats 집계3Claude Sonnet 5.572.5%
MILULLM Stats 집계3Claude Opus 5.593.1%
MLS-Bench LiteLLM Stats 집계3Kimi-K348.3%
MMAULLM Stats 집계3Inkling77.2%
MobileWorldLLM Stats 집계3Qwen3.8 Max77.8%
MRCR 1MLLM Stats 집계3DeepSeek-V4-Pro-Max83.5%
NusceneLLM Stats 집계3Qwen3.5-122B-A10B15.4%
OfficeQALLM Stats 집계3Claude Opus 5.578.9%
PaperBenchLLM Stats 집계3Qwen3.8 Max93%
PHYBenchLLM Stats 집계3Hy377.4%
PMC-VQALLM Stats 집계3Qwen3.5-122B-A10B63.3%
QVHighlightsLLM Stats 집계3Nova 2 Lite77.2%
RealKIE-FCCLLM Stats 집계3Nova 2 Pro67%
RecreationBenchLLM Stats 집계3Qwen3.8 Flash49.9%
RSI IndexLLM Stats 집계3GPT-5.6 Sol57.9%
RULER 128kLLM Stats 집계3IBM Granite 4.2 30B81.4%
RULER 64kLLM Stats 집계3IBM Granite 4.2 30B90.0%
Search and Function-CallingLLM Stats 집계3GPT-5.6 Terra94.6%
SlakeVQALLM Stats 집계3Qwen3.5-122B-A10B81.6%
SpreadSheetBench-v1LLM Stats 집계3MiniMax-M389.4%
TreeBenchLLM Stats 집계3Seed 2.1 Pro71.1%
USAMO 2026LLM Stats 집계3MiniMax-M336.0

멀티모달 이미지, 영상, 화면, 문서 이해

27종
벤치마크대표 프로필측정 모델1위최고점
MMMU-Pro 프로필 3LLM Stats 집계69Gemini 3.5 Flash83.6%
CharXiv-RLLM Stats 집계48Claude Mythos Preview93.2%
ScreenSpot-Pro 프로필 2LLM Stats 집계44GPT-6 Astra92.7%
MathVisionLLM Stats 집계34Kimi-K397.8%
RealWorldQA 프로필 2LLM Stats 집계25Qwen3.8 Flash88.5%
VideoMMMULLM Stats 집계23Gemini 3 Pro87.6%
OmniDocBench 1.5 프로필 3LLM Stats 집계21MiniMax-M391.6%
ScreenSpotLLM Stats 집계16Qwen3 VL 32B Instruct95.8%
BabyVisionLLM Stats 집계13DeepSeek-V4.1-Flash89.6%
MMMULLM Stats 집계13Qwen3.6 Plus86%
CharXiv-DLLM Stats 집계12Seed 2.1 Pro95.5%
ExtractBenchHF 리더보드11Darwin-180B-RSI-R390.3%
gdp.pdf 프로필 2LLM Stats 집계11Claude Sonnet 581.6%
Video-MMELLM Stats 집계11Seed 2.1 Pro89.2%
VideoMME w sub.LLM Stats 집계10Qwen3.8 Max90.4%
VideoMME w/o sub.LLM Stats 집계10Qwen3.5-122B-A10B83.9%
MMMU (val)LLM Stats 집계9Qwen3 VL 32B Thinking78.1%
SWE-Bench MultimodalLLM Stats 집계7Claude Opus 5.561.4%
LongVideoBenchLLM Stats 집계6Seed 2.1 Pro80.6%
MMMU-Pro · no toolsOpenAI 공개 평가5GPT-5.6 Sol83%
MMMU-Pro (with tools)LLM Stats 집계4GPT-5.6 Sol84.6%
Video-MME v2HF 리더보드4MiniMax-M385.4%
VideoSimpleQALLM Stats 집계4Seed 2.1 Pro76.4%
Vision2WebLLM Stats 집계4Qwen3.8 Max69%
CharXiv Reasoning · without CIQwen 공개 평가3Qwen3.8-27B83.7%
MMBench-VideoLLM Stats 집계3Qwen2.5-VL-72B-Instruct2.0%
VideoHolmesLLM Stats 집계3Seed 2.1 Pro68.2%

과학·보안 과학·의료·보안 전문 평가

18종
벤치마크대표 프로필측정 모델1위최고점
CyberGym 프로필 2LLM Stats 집계23MiMo-V2.6-Flash95.1%
HealthBench Professional 프로필 2LLM Stats 집계15Claude Sonnet 5.569.2%
ExploitBench 프로필 3LLM Stats 집계14GPT-6 Astra100%
HealthBenchLLM Stats 집계10Claude Sonnet 5.565.4%
ExploitGymLLM Stats 집계8GPT-6 Astra42.4%
SEC-Bench Pro 프로필 2LLM Stats 집계8GPT-6 Astra85.4%
AA-Omniscience Index 프로필 2Artificial Analysis7Claude Opus 537.1
GeneBench ProOpenAI 공개 평가7GPT-5.6 Sol28.7%
HealthBench HardLLM Stats 집계6Muse Spark42.8%
LifeSciBench 프로필 2OpenAI 공개 평가6GPT-5.6 Sol59.9%
FrontierScience ResearchLLM Stats 집계5Muse Spark38.3%
Terminal-Bench-Science 0.1LLM Stats 집계5GPT-6 Astra64.6%
AA-Omniscience AccuracyArtificial Analysis4Claude Opus 560.9%
FrontierScience OlympiadLLM Stats 집계4Seed 2.1 Turbo76%
GeneBench-ProLLM Stats 집계4GPT-6 Astra37.8%
HealthBench ConsensusLLM Stats 집계4GPT-5.6 Sol95.5%
MedChemBench (Internal)LLM Stats 집계3GPT-5.6 Sol48.3%
OmniScienceLLM Stats 집계3Nemotron 3 Ultra (550B A55B)78.7%

속도·비용 API 속도, 첫 토큰 지연

2종
벤치마크대표 프로필측정 모델1위최고점
Artificial Analysis Output SpeedArtificial Analysis4Gemini 3.7 Flash324 tok/s
Artificial Analysis Time to First ChunkArtificial Analysis4Gemini 3.7 Flash9.06초