AI AI 해설
2026년 10월 9일 생성코딩·추론 레이팅이 강점이지만 벤치 점수는 모두 미검증
종합 평가
MAI-Thinking-1은 상용 API 모델이다. 종합 레이팅은 938(96위), 가중 비교는 8이다. 레이팅은 같은 벤치 비교로 만든 상대 지표이므로 절대 성능으로 해석하면 안 된다.
분야별 적합성
코딩 레이팅은 956(70위), 추론·지식은 983(78위), 과학·보안은 937이다. 에이전트와 멀티모달은 자료 없음으로, 해당 업무 적합성을 이 입력만으로 판단하기 어렵다.
주요 벤치 결과
LLM Stats 집계에서 LiveCodeBench v6 87.7%(10/51), SWE-bench Verified 73.5%(35/58), GPQA Diamond 84.2%(53/90), AIME 2025 97%(8/40), AIME 2026 94.5%(10/26)다. 모든 점수는 미검증이다.
도입 전 확인사항
컨텍스트, 최대 출력, 입력·출력 가격, 라이선스는 자료 없음이다. BFCL-v3는 72%(3/13), LongBench v2는 61%(6/14), HealthBench Professional은 35%(14/14)다. 실제 도입 전 비용·제한과 자체 업무 평가가 필요하다.
수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.
분야별 레이팅
비슷한 모델과 비교 →| 분야 | 레이팅 | 분야 순위 | 벤치 수 |
|---|---|---|---|
| 코딩 | 108 | 4 | |
| 에이전트 | — | — | — |
| 추론·지식 | 118 | 11 | |
| 멀티모달 | — | — | — |
| 과학·보안 | — | 1 |
분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.
벤치마크 점수
23개 · 프로필별 순위코딩
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| SWE-bench Verified | LLM Stats 집계 | 73.5% | 35 / 58 | 39 | 자기보고 ↗ |
| SWE-bench Pro | LLM Stats 집계 | 52.8% | 44 / 55 | 20 | 자기보고 ↗ |
| LiveCodeBench v6 | LLM Stats 집계 | 87.7% | 10 / 51 | 82 | 자기보고 ↗ |
| Terminal-Bench 2.0 | LLM Stats 집계 | 46% | 34 / 40 | 15 | 자기보고 ↗ |
추론·지식
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| GPQA Diamond | LLM Stats 집계 | 84.2% | 53 / 90 | 41 | 자기보고 ↗ |
| MMLU-Pro | LLM Stats 집계 | 85% | 20 / 60 | 68 | 자기보고 ↗ |
| IFBench | LLM Stats 집계 | 69% | 31 / 42 | 26 | 자기보고 ↗ |
| AIME 2025 | LLM Stats 집계 | 97% | 8 / 40 | 82 | 자기보고 ↗ |
| AIME 2026 | LLM Stats 집계 | 94.5% | 10 / 26 | 64 | 자기보고 ↗ |
| Multi-Challenge | LLM Stats 집계 | 53% | 15 / 19 | 22 | 자기보고 ↗ |
| LongBench v2 | LLM Stats 집계 | 61% | 6 / 14 | 65 | 자기보고 ↗ |
| BFCL-v3 | LLM Stats 집계 | 72% | 3 / 13 | 83 | 자기보고 ↗ |
| HMMT Feb 26 | LLM Stats 집계 | 84.9% | 10 / 13 | 25 | 자기보고 ↗ |
| MedXpertQA | LLM Stats 집계 | 43% | 9 / 11 | 20 | 자기보고 ↗ |
| SimpleQA Verified | LLM Stats 집계 | 31% | 2 / 4 | 67 | 자기보고 ↗ |
| AdvancedIF | LLM Stats 집계 | 85% | 1 / 2 | 100 | 자기보고 ↗ |
| TruthfulQA | LLM Stats 집계 | 88% | 1 / 2 | 100 | 자기보고 ↗ |
| AIR-Bench | LLM Stats 집계 | 88% | 1 / 1 | 50 | 자기보고 ↗ |
| CorpusQA | LLM Stats 집계 | 82% | 1 / 1 | 50 | 자기보고 ↗ |
| GraphWalks | LLM Stats 집계 | 90% | 1 / 1 | 50 | 자기보고 ↗ |
| LongFact | LLM Stats 집계 | 98% | 1 / 1 | 50 | 자기보고 ↗ |
과학·보안
| 벤치 | 프로필 | 점수 | 순위 | 백분위 | 출처 |
|---|---|---|---|---|---|
| HealthBench Professional | LLM Stats 집계 | 35% | 14 / 14 | 0 | 자기보고 ↗ |
| CyberSecEval 4 | LLM Stats 집계 | 63% | 1 / 1 | 50 | 자기보고 ↗ |
순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.
레이팅이 비슷한 모델
- Step-3.5-Flash 126위 · 951 비교
- Nova 2 Pro 127위 · 948 비교
- Qwen3 Max Thinking 128위 · 943 비교
- Gemini 3.1 Flash-Lite 130위 · 927 비교
- Qwen3.6-35B-A3B 131위 · 926 비교
- MiniMax-M2.1 132위 · 923 비교
Microsoft의 다른 모델
공급사 →- MAI-Code-1.1-Flash 2026-08-11
- Mage-VL 2026-07-25
- Fara1.5-27B 2026-07-17
- MAI-Code-1-Flash 2026-06-02 · 886
- Phi-4-reasoning-vision-15B 2026-01-23
- Fara-7B 2025-10-30
- phi-4 2024-12-11 · 589
- Phi-3.5-vision-instruct 2024-08-16