AI專題

前沿 AI 評測(Evals)如何量測風險?英國 AISI 與 Google DeepMind 揭露量測侷限

林紀旭 James Lin總編輯
發布 · 更新
英國 AI Safety Institute 將評測定義為用多種技術評估先進 AI 系統能力,並於模型部署前後檢測有害能力;Google DeepMind 前沿安全框架鎖定自主性、生物安全、網路安全與機器學習研發四大領域。但 AISI 坦言,評測可能被系統操弄而失真,且從未宣稱是全面安全保證。

定義:什麼是前沿 AI 模型評測(evals)?

英國 AI Safety Institute 將評測定義為用一系列不同技術評估先進 AI 系統能力的標準化衡量方式CITE:E1。其官方說明寫道:「By evaluations, we mean assessing the capabilities of an advanced AI system using a range of different techniques.」CITE:E1。換言之,evals 是組合多種技術、用來衡量模型能力的方法論CITE:E1

危險能力評估的範疇:評測重點關注哪些領域?

Google DeepMind 前沿安全框架將關鍵能力等級的初始調查聚焦於四個危險領域CITE:E2。這四個領域分別是自主性、生物安全、網路安全,以及機器學習研發(R&D)CITE:E2。DeepMind 於 2024 年 5 月 17 日公布此框架,明確以這四項作為後續評測設計的基礎CITE:E2

誰在執行評測?——官方機構與具體工具框架

英國 AI Safety Institute 開發並執行評測,於模型部署前後評估潛在風險,包括評估可能有害的能力CITE:E3。該機構的評測角色自 2024 年 2 月 9 日公開說明以來即已明確化CITE:E3。在具體工具層面,UK AI Security Institute 與 Meridian Labs 於 2024 年共同開發了開源的前沿 AI 評測框架 InspectCITE:E4

評測與治理決策的連結:評測結果如何推動風險緩移?

Google DeepMind 承諾於模型通過早期預警評估時啟動緩解計畫CITE:E5。DeepMind 說明,該緩解計畫須將整體利弊與預期的部署情境一併納入考量CITE:E5。此一觸發機制,呼應了前述以自主性、生物安全、網路安全與機器學習研發為核心的四個危險領域評估範疇CITE:E2

評測量不準什麼?——被操弄風險與非全面性保證

英國 AI Safety Institute 指出,未來 AI 系統可能被操弄而在特定評測任務上刻意失敗,使這些任務無法代表其真實的底層能力CITE:E6。這項警示於 2024 年 10 月 24 日公開發布CITE:E6。此外,AISI 明言其評測並非對 AI 系統安全性的全面評估,目的也不是把任何系統認定為「安全」CITE:E7

各機構評測角色與時間線一覽

機構/來源公開日期核心內容
英國 AI Safety Institute2024-02-09定義評測方法論,說明部署前後風險評估角色CITE:E1CITE:E3
Google DeepMind2024-05-17公布前沿安全框架,鎖定四個危險領域並訂定緩解機制CITE:E2CITE:E5
UK AI Security Institute × Meridian Labs2024共同開發開源評測框架 InspectCITE:E4
英國 AI Safety Institute2024-10-24揭露評測可能被操弄、結果失真的風險CITE:E6

這代表什麼:評測目前同時扮演能力量測工具與治理觸發點兩種角色。AISI 開發評測,用於模型部署前後的風險判斷CITE:E3。DeepMind 則把通過早期預警評估,設定為啟動緩解計畫的條件CITE:E5。但評測體系的設計者也坦承,系統可能被操弄而在特定任務上刻意失敗CITE:E6。評測本身也從未被定義為全面安全保證,不會認定任何系統為「安全」CITE:E7。治理決策所依賴的判準,與判準設計者自己承認的侷限之間,存在尚未解決的落差。

📊 證據與數據

常見問題

定義:什麼是前沿 AI 模型評測(evals)?

英國 AI Safety Institute 將評測定義為用一系列不同技術評估先進 AI 系統能力的標準化衡量方式CITE:E1。

危險能力評估的範疇:評測重點關注哪些領域?

Google DeepMind 前沿安全框架將關鍵能力等級的初始調查聚焦於四個危險領域CITE:E2。這四個領域分別是自主性、生物安全、網路安全,以及機器學習研發(R&D)CITE:E2。DeepMind 於 2024 年 5 月 17 日公布此框架,明確以這四項作為後續評測設計的基礎CITE:E2。

誰在執行評測?——官方機構與具體工具框架

英國 AI Safety Institute 開發並執行評測,於模型部署前後評估潛在風險,包括評估可能有害的能力CITE:E3。該機構的評測角色自 2024 年 2 月 9 日公開說明以來即已明確化CITE:E3。

評測與治理決策的連結:評測結果如何推動風險緩移?

Google DeepMind 承諾於模型通過早期預警評估時啟動緩解計畫CITE:E5。DeepMind 說明,該緩解計畫須將整體利弊與預期的部署情境一併納入考量CITE:E5。此一觸發機制,呼應了前述以自主性、生物安全、網路安全與機器學習研發為核心的四個危險領域評估範疇CITE:E2。

📎 資料來源

  1. gov.uk
  2. deepmind.google
  3. inspect.aisi.org.uk
  4. aisi.gov.uk

延伸數據

作者觀點林紀旭 James Lin

評測正在從單純的能力量測工具,演變成具備治理效力的關卡——DeepMind 把「通過早期預警評估」當作啟動緩解計畫的觸發條件,AISI 也把評測結果用於模型部署前後的風險判斷。但這套機制的設計者自己講得很清楚:評測可能被系統操弄而在特定任務上刻意失敗,而且從未宣稱是全面安全保證。接下來真正該觀察的,不是又出現了哪個新的評測框架,而是像 AISI、DeepMind 這類機構,是否針對「評測可能被操弄」這個已經公開承認的限制,提出可驗證的因應做法。

林紀旭 James Lin總編輯

相關文章

快訊

輝達投資聯發科35億美元 深化AI晶片與車用合作

輝達以35億美元認購聯發科39億美元海外可轉換公司債,成為輝達首次大手筆投資台灣公司;雙方將在AI基礎建設、邊緣AI運算與車用平台三大領域深化合作,並導入NVLink Fusion與NVHBM技術銜接資料中心晶片。

EffectStory 編輯部 ·