벤치마크
분야별 AI 벤치마크
측정 모델이 3개 이상인 벤치마크 310종을 분야별로 묶었습니다(전체 538종 중). 같은 이름이라도 문항·하네스·출처가 다르면 프로필로 나눠 각각 순위를 매깁니다. 측정 모델이 적은 벤치는 각 모델 페이지의 점수표에만 나옵니다.
데이터 기준 2026년 10월 9일
코딩 저장소 수정, 코드 생성, 터미널 작업
33종에이전트 도구 사용, 브라우징, 컴퓨터 조작
41종추론·지식 지식, 수학, 추론, 지시 따르기, 장문맥
189종멀티모달 이미지, 영상, 화면, 문서 이해
27종과학·보안 과학·의료·보안 전문 평가
18종| 벤치마크 | 대표 프로필 | 측정 모델 | 1위 | 최고점 |
|---|---|---|---|---|
| CyberGym 프로필 2 | LLM Stats 집계 | 23 | MiMo-V2.6-Flash | 95.1% |
| HealthBench Professional 프로필 2 | LLM Stats 집계 | 15 | Claude Sonnet 5.5 | 69.2% |
| ExploitBench 프로필 3 | LLM Stats 집계 | 14 | GPT-6 Astra | 100% |
| HealthBench | LLM Stats 집계 | 10 | Claude Sonnet 5.5 | 65.4% |
| ExploitGym | LLM Stats 집계 | 8 | GPT-6 Astra | 42.4% |
| SEC-Bench Pro 프로필 2 | LLM Stats 집계 | 8 | GPT-6 Astra | 85.4% |
| AA-Omniscience Index 프로필 2 | Artificial Analysis | 7 | Claude Opus 5 | 37.1 |
| GeneBench Pro | OpenAI 공개 평가 | 7 | GPT-5.6 Sol | 28.7% |
| HealthBench Hard | LLM Stats 집계 | 6 | Muse Spark | 42.8% |
| LifeSciBench 프로필 2 | OpenAI 공개 평가 | 6 | GPT-5.6 Sol | 59.9% |
| FrontierScience Research | LLM Stats 집계 | 5 | Muse Spark | 38.3% |
| Terminal-Bench-Science 0.1 | LLM Stats 집계 | 5 | GPT-6 Astra | 64.6% |
| AA-Omniscience Accuracy | Artificial Analysis | 4 | Claude Opus 5 | 60.9% |
| FrontierScience Olympiad | LLM Stats 집계 | 4 | Seed 2.1 Turbo | 76% |
| GeneBench-Pro | LLM Stats 집계 | 4 | GPT-6 Astra | 37.8% |
| HealthBench Consensus | LLM Stats 집계 | 4 | GPT-5.6 Sol | 95.5% |
| MedChemBench (Internal) | LLM Stats 집계 | 3 | GPT-5.6 Sol | 48.3% |
| OmniScience | LLM Stats 집계 | 3 | Nemotron 3 Ultra (550B A55B) | 78.7% |
속도·비용 API 속도, 첫 토큰 지연
2종| 벤치마크 | 대표 프로필 | 측정 모델 | 1위 | 최고점 |
|---|---|---|---|---|
| Artificial Analysis Output Speed | Artificial Analysis | 4 | Gemini 3.7 Flash | 324 tok/s |
| Artificial Analysis Time to First Chunk | Artificial Analysis | 4 | Gemini 3.7 Flash | 9.06초 |