主要 AI 能力基準(Benchmark)說明對照:滿天飛的 AI 跑分到底在測什麼

10 個主要 AI/大型語言模型能力基準(MMLU、GPQA、SWE-bench、HumanEval、AIME 等)的「測什麼、題型規模、評分方式、目前是否飽和」對照,幫你看懂各家模型宣稱的跑分。

Benchmark測什麼題型 / 規模評分現況
MMLU57 學科多任務知識多選,約 14,000 題 (test)準確率 %前沿模型已近飽和
MMLU-ProMMLU 加難、更重推理10 選 1,12,032 題準確率 %仍具區分度
GPQA (Diamond)研究生級生/物/化(防搜尋)4 選 1,Diamond 198 題準確率 %(隨機 25%)最難知識推理之一
SWE-bench (Verified)修真實 GitHub issueVerified 500 個實例解決率 %尚未飽和,主流工程基準
HumanEvalPython 函式生成164 題,執行單元測試pass@1已飽和,有訓練污染疑慮
AIME高難度競賽數學每年 30 題(答案 0–999)精確匹配 %推理評測常用,未飽和
MATH競賽難度數學解題12,500 題,1–5 級難度準確率 %已近飽和
GSM8K小學多步應用題約 1,000 題 (test)精確匹配 %已近飽和
HellaSwag常識情境續寫4 選 1,約 10,000 題 (val)準確率 %已飽和,漸失區分度
MMMU大學級多模態(圖文)10,500 題 (test),30 學科準確率 %多模態代表基準

方法與來源

每個 benchmark 的定義、題型與規模以其原始論文(arXiv)或官方 repo/官網描述為準(來源見各列引用)。⚠「現況/飽和」欄為定性描述——具體「已達 XX%」的飽和百分比多來自次級整理來源、非原始論文或官方即時數據,故本表不放那些百分比,只保留可查證的定性狀態(如「已近飽和」「尚未飽和」)。規模標明是哪個資料切分(如 MMLU test 約 14,000 題、SWE-bench Verified 500 個實例)。AIME 借用自數學競賽、無單一官方 AI-benchmark 論文,已註明。benchmark 定義相對穩定,但社群會推出更難的後續版本,以官方為準。

來源:https://arxiv.org/abs/2009.03300

擷取日期:2026-07-26