主要 AI 能力基準(Benchmark)說明對照:滿天飛的 AI 跑分到底在測什麼
10 個主要 AI/大型語言模型能力基準(MMLU、GPQA、SWE-bench、HumanEval、AIME 等)的「測什麼、題型規模、評分方式、目前是否飽和」對照,幫你看懂各家模型宣稱的跑分。
| Benchmark | 測什麼 | 題型 / 規模 | 評分 | 現況 |
|---|---|---|---|---|
| MMLU | 57 學科多任務知識 | 多選,約 14,000 題 (test) | 準確率 % | 前沿模型已近飽和 |
| MMLU-Pro | MMLU 加難、更重推理 | 10 選 1,12,032 題 | 準確率 % | 仍具區分度 |
| GPQA (Diamond) | 研究生級生/物/化(防搜尋) | 4 選 1,Diamond 198 題 | 準確率 %(隨機 25%) | 最難知識推理之一 |
| SWE-bench (Verified) | 修真實 GitHub issue | Verified 500 個實例 | 解決率 % | 尚未飽和,主流工程基準 |
| HumanEval | Python 函式生成 | 164 題,執行單元測試 | pass@1 | 已飽和,有訓練污染疑慮 |
| AIME | 高難度競賽數學 | 每年 30 題(答案 0–999) | 精確匹配 % | 推理評測常用,未飽和 |
| MATH | 競賽難度數學解題 | 12,500 題,1–5 級難度 | 準確率 % | 已近飽和 |
| GSM8K | 小學多步應用題 | 約 1,000 題 (test) | 精確匹配 % | 已近飽和 |
| HellaSwag | 常識情境續寫 | 4 選 1,約 10,000 題 (val) | 準確率 % | 已飽和,漸失區分度 |
| MMMU | 大學級多模態(圖文) | 10,500 題 (test),30 學科 | 準確率 % | 多模態代表基準 |
方法與來源
每個 benchmark 的定義、題型與規模以其原始論文(arXiv)或官方 repo/官網描述為準(來源見各列引用)。⚠「現況/飽和」欄為定性描述——具體「已達 XX%」的飽和百分比多來自次級整理來源、非原始論文或官方即時數據,故本表不放那些百分比,只保留可查證的定性狀態(如「已近飽和」「尚未飽和」)。規模標明是哪個資料切分(如 MMLU test 約 14,000 題、SWE-bench Verified 500 個實例)。AIME 借用自數學競賽、無單一官方 AI-benchmark 論文,已註明。benchmark 定義相對穩定,但社群會推出更難的後續版本,以官方為準。
來源:https://arxiv.org/abs/2009.03300
擷取日期:2026-07-26