Microsoft · 모델

MAI-Thinking-1

API출시 2026년 6월 2일LLMStats/mai-thinking-1공식 문서 ↗
종합 레이팅943 · 129위레이팅 벤치 16개
컨텍스트 창—
가격 (입력 / 출력, 1M 토큰)—
파라미터1.0T
라이선스—
벤치 점수23개코딩·추론·지식·과학·보안

AI AI 해설

2026년 10월 9일 생성

코딩·추론 레이팅이 강점이지만 벤치 점수는 모두 미검증

종합 평가

MAI-Thinking-1은 상용 API 모델이다. 종합 레이팅은 938(96위), 가중 비교는 8이다. 레이팅은 같은 벤치 비교로 만든 상대 지표이므로 절대 성능으로 해석하면 안 된다.

분야별 적합성

코딩 레이팅은 956(70위), 추론·지식은 983(78위), 과학·보안은 937이다. 에이전트와 멀티모달은 자료 없음으로, 해당 업무 적합성을 이 입력만으로 판단하기 어렵다.

주요 벤치 결과

LLM Stats 집계에서 LiveCodeBench v6 87.7%(10/51), SWE-bench Verified 73.5%(35/58), GPQA Diamond 84.2%(53/90), AIME 2025 97%(8/40), AIME 2026 94.5%(10/26)다. 모든 점수는 미검증이다.

도입 전 확인사항

컨텍스트, 최대 출력, 입력·출력 가격, 라이선스는 자료 없음이다. BFCL-v3는 72%(3/13), LongBench v2는 61%(6/14), HealthBench Professional은 35%(14/14)다. 실제 도입 전 비용·제한과 자체 업무 평가가 필요하다.

수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.

분야레이팅분야 순위벤치 수
코딩9641084
에이전트———
추론·지식97311811
멀티모달———
과학·보안955—1
차트를 불러오는 중입니다…

분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.

벤치마크 점수

23개 · 프로필별 순위

코딩

벤치프로필점수순위백분위출처
SWE-bench VerifiedLLM Stats 집계73.5%35 / 5839자기보고 ↗
SWE-bench ProLLM Stats 집계52.8%44 / 5520자기보고 ↗
LiveCodeBench v6LLM Stats 집계87.7%10 / 5182자기보고 ↗
Terminal-Bench 2.0LLM Stats 집계46%34 / 4015자기보고 ↗

추론·지식

벤치프로필점수순위백분위출처
GPQA DiamondLLM Stats 집계84.2%53 / 9041자기보고 ↗
MMLU-ProLLM Stats 집계85%20 / 6068자기보고 ↗
IFBenchLLM Stats 집계69%31 / 4226자기보고 ↗
AIME 2025LLM Stats 집계97%8 / 4082자기보고 ↗
AIME 2026LLM Stats 집계94.5%10 / 2664자기보고 ↗
Multi-ChallengeLLM Stats 집계53%15 / 1922자기보고 ↗
LongBench v2LLM Stats 집계61%6 / 1465자기보고 ↗
BFCL-v3LLM Stats 집계72%3 / 1383자기보고 ↗
HMMT Feb 26LLM Stats 집계84.9%10 / 1325자기보고 ↗
MedXpertQALLM Stats 집계43%9 / 1120자기보고 ↗
SimpleQA VerifiedLLM Stats 집계31%2 / 467자기보고 ↗
AdvancedIFLLM Stats 집계85%1 / 2100자기보고 ↗
TruthfulQALLM Stats 집계88%1 / 2100자기보고 ↗
AIR-BenchLLM Stats 집계88%1 / 150자기보고 ↗
CorpusQALLM Stats 집계82%1 / 150자기보고 ↗
GraphWalksLLM Stats 집계90%1 / 150자기보고 ↗
LongFactLLM Stats 집계98%1 / 150자기보고 ↗

과학·보안

벤치프로필점수순위백분위출처
HealthBench ProfessionalLLM Stats 집계35%14 / 140자기보고 ↗
CyberSecEval 4LLM Stats 집계63%1 / 150자기보고 ↗

순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.

레이팅이 비슷한 모델

Microsoft의 다른 모델

공급사 →