벤치마크 · 추론·지식

BFCL-V4

BFCL-V4 과제로 모델의 상대적인 문제 해결 성능을 비교합니다. 점수 하나로 전체 능력을 단정하지 말고 평가 조건을 함께 확인하세요.

측정 모델 22개 · 프로필 1개 · 데이터 기준 2026년 10월 9일

LLM Stats 집계

원문 출처 ↗

LLM Stats 공개 리더보드의 독립 프로필입니다. 검증·자기보고 여부를 보존합니다. 높을수록 좋습니다.

현재 최고점: 상용 Qwen3.7 Max 75% · 오픈 Atria Dawn Preview 77% → 오픈 모델이 앞섭니다.

출시일별 점수와 최고점 흐름

차트를 불러오는 중입니다…

상위 20

차트를 불러오는 중입니다…
출처
1Atria Dawn PreviewShanghai AI Lab (InternLM) · 오픈 웨이트오픈77%1002026-09-11자기보고 ↗
2Qwen3.7 MaxAlibaba (Qwen) · 상용 APIAPI75%952026-05-19자기보고 ↗
3Ling-3.0-flashinclusionAI (Ant) · 오픈 웨이트오픈73%902026-08-02자기보고 ↗
4Qwen3.5-397B-A17BAlibaba (Qwen) · 오픈 웨이트오픈72.9%832026-02-16자기보고 ↗
5Qwen3.7-PlusAlibaba (Qwen) · 상용 APIAPI72.9%832026-05-31자기보고 ↗
6Qwen3.5-122B-A10BAlibaba (Qwen) · 오픈 웨이트오픈72.2%762026-02-24자기보고 ↗
7Qwen3.5-27BAlibaba (Qwen) · 오픈 웨이트오픈68.5%712026-02-24자기보고 ↗
8Qwen3 Max ThinkingAlibaba (Qwen) · 상용 APIAPI67.7%672026-02-13자기보고 ↗
9Qwen3.5-35B-A3BAlibaba (Qwen) · 오픈 웨이트오픈67.3%622026-02-24자기보고 ↗
10Qwen3.5-9BAlibaba (Qwen) · 오픈 웨이트오픈66.1%572026-02-27자기보고 ↗
11Nova 2 ProAmazon · 상용 APIAPI61.6%522025-12-02자기보고 ↗
12IBM Granite 4.2 30BIBM · 오픈 웨이트오픈61.4%482026-08-25자기보고 ↗
13Nova 2 LiteAmazon · 상용 APIAPI60.3%432025-12-02자기보고 ↗
14Nova 2 OmniAmazon · 상용 APIAPI58.3%382025-12-02자기보고 ↗
15Seed 1.8ByteDance (Seed) · 상용 APIAPI57.2%332026-02-17자기보고 ↗
16LFM2.5-2.6BLiquid AI · 상용 APIAPI56.9%292026-08-04자기보고 ↗
17IBM Granite 4.2 3BIBM · 오픈 웨이트오픈52.4%242026-08-25자기보고 ↗
18IBM Granite 4.2 8BIBM · 오픈 웨이트오픈52.4%192026-08-25자기보고 ↗
19Qwen3.5-4BAlibaba (Qwen) · 오픈 웨이트오픈50.3%142026-03-02자기보고 ↗
20Qwen3.5-2BAlibaba (Qwen) · 오픈 웨이트오픈43.6%102026-03-02자기보고 ↗
21LFM2.5-VL-3BLiquid AI · 상용 APIAPI32.5%52026-08-12자기보고 ↗
22Qwen3.5-0.8BAlibaba (Qwen) · 오픈 웨이트오픈25.3%02026-03-02자기보고 ↗

마커: 원 = 오픈 웨이트, 사각 = 상용 API, 빈 마커 = 검증되지 않은 값. 점을 누르면 모델 상세로 이동합니다. 백분위는 이 프로필 안에서의 상대 위치입니다.