벤치마크 · 추론·지식

Tau2 Telecom

Tau2 Telecom 과제로 모델의 상대적인 문제 해결 성능을 비교합니다. 점수 하나로 전체 능력을 단정하지 말고 평가 조건을 함께 확인하세요.

측정 모델 20개 · 프로필 1개 · 데이터 기준 2026년 10월 9일

LLM Stats 집계

원문 출처 ↗

LLM Stats 공개 리더보드의 독립 프로필입니다. 검증·자기보고 여부를 보존합니다. 높을수록 좋습니다.

현재 최고점: 상용 Claude Opus 4.6 99.3% · 오픈 MiniMax-M2 87% → 상용이 12.3%p 앞섭니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1Claude Opus 4.6Anthropic · 상용 APIAPI99.3%1002026-02-05자기보고 ↗
2GPT-5.4OpenAI · 상용 APIAPI98.9%952026-03-05자기보고 ↗
3GPT-5.2OpenAI · 상용 APIAPI98.7%892025-12-11자기보고 ↗
4Claude Opus 4.5Anthropic · 상용 APIAPI98.2%842025-11-24자기보고 ↗
5GPT-5.5OpenAI · 상용 APIAPI98%792026-04-23자기보고 ↗
6Claude Sonnet 4.6Anthropic · 상용 APIAPI97.9%742026-02-17자기보고 ↗
7MiMo-V2-ProXiaomi (MiMo) · 상용 APIAPI96.8%682026-03-18자기보고 ↗
8GPT-5.4 miniOpenAI · 상용 APIAPI93.4%632026-03-17자기보고 ↗
9Nova 2 ProAmazon · 상용 APIAPI92.7%582025-12-02자기보고 ↗
10GPT-5.4 nanoOpenAI · 상용 APIAPI92.5%532026-03-17자기보고 ↗
11Muse SparkMeta · 상용 APIAPI91.5%472026-04-08자기보고 ↗
12MiniMax-M2MiniMax · 오픈 웨이트오픈87%392025-10-22자기보고 ↗
13MiniMax-M2.1MiniMax · 오픈 웨이트오픈87%392025-12-20자기보고 ↗
14Command A+Cohere · 오픈 웨이트오픈85%322026-05-20자기보고 ↗
15Nova 2 OmniAmazon · 상용 APIAPI80%262025-12-02자기보고 ↗
16Nova 2 LiteAmazon · 상용 APIAPI76%212025-12-02자기보고 ↗
17EXAONE-4.5-33BLG AI Research (EXAONE) · 오픈 웨이트오픈73%162026-04-04자기보고 ↗
18MAI-Code-1-FlashMicrosoft · 상용 APIAPI71.7%112026-06-02자기보고 ↗
19Nemotron 3 Super (120B A12B)NVIDIA · 상용 APIAPI64.4%52026-03-11자기보고 ↗
20Nemotron 3 Nano (30B A3B)NVIDIA · 상용 APIAPI42.2%02025-12-15자기보고 ↗

마커: 원 = 오픈 웨이트, 사각 = 상용 API, 빈 마커 = 검증되지 않은 값. 점을 누르면 모델 상세로 이동합니다. 백분위는 이 프로필 안에서의 상대 위치입니다.