World Labs執行長李飛飛(Fei-Fei Li)表示,先進人工智慧(AI)的評估不應只交由開發企業負責,應建立由學界、政府與產業共同參與的獨立監督機制。
彭博22日刊出的專訪指出,李飛飛認為有必要建立獨立基準測試及多方利害關係人參與的評估架構。若AI企業以自行制定的標準評估自家模型,將難以確保結果的客觀性與責任歸屬。
獨立基準測試與評估機構獨立是不同概念。基準測試是用來決定如何比較AI模型的測試制度;即使評估機構位於企業外部,只要開發商掌握測試標準與評估範圍,結果仍可能被用作性能宣傳工具。
這場爭論的直接背景,是有人提議讓外部評估人員進駐AI企業。Anthropic執行長達里奧·阿莫代伊(Dario Amodei)曾提議,給予外部評估人員相當於公司員工的系統存取權;OpenAI執行長山姆·奧特曼(Sam Altman)也表示支持這項構想。
這套方案將讓評估團隊使用企業辦公室、門禁卡與公司設備,檢查企業的安全作法。美聯社報導,讓外部評估人員存取企業內部系統與工作環境的方式,已成為相關討論內容。
反對意見則指出,若受評企業負責選定評估機構並支付費用,評估獨立性可能受損。Cohere執行長艾登·戈麥斯(Aidan Gomez)批評,不能由少數具有商業利益的企業制定AI規則;布魯金斯學會研究員艾爾哈姆·塔巴西(Elham Tabassi)也指出,僅靠企業自願承諾並不足夠。
塔巴西表示,需要具備科學可驗證性的評估方式。兩人的看法都指出,單純設置外部評估人員,仍不足以確保評估的客觀性與責任歸屬。
AI評估人員也持續提出公開要求。AI Evaluator Forum在18日發布、由逾100名研究人員與評估人員參與的公開信中主張,應保障第三方評估機構的獨立判斷權與編輯權,並提供評估所需的系統存取權與充足時間。
公開信也要求建立防止企業報復的機制,避免評估機構因企業不利結果而面臨解約或訴訟威脅,進而改變判斷。
AI Evaluator Forum於2025年發布的評估透明度原則,也將評估方法控制權、結果編輯權、系統存取程度,以及評估機構與開發商的利益衝突揭露列為核心條件。這些原則是否已落實為企業合約或法律義務,目前尚未獲確認。
李飛飛此前也曾提出包含第三方驗證的制度性做法。加州AI前沿模型聯合政策工作組在2025年報告中提出,將風險評估與第三方審計連結並擴大透明度;李飛飛是該報告的共同作者之一。
這場討論也延續了先前要求保障AI安全評估團隊系統存取權與結果編輯權的公開倡議。核心爭點不只在於是否存在外部評估人員,也在於誰有權制定評估標準,以及誰能公開或修改評估結果。
對台灣AI企業與政策制定者而言,這場爭論提供了檢視標準,包括評估機構由誰選定、費用由誰負擔、系統存取範圍如何設定,以及結果公開方式是否具備獨立性。僅將評估交給外部機構,並不代表評估結果自然具備獨立性。
目前尚未確定設立獨立監督機構或具約束力的監管制度。現階段已確認的是,AI企業與研究人員正要求建立具備獨立性、存取權與透明度的評估體系;相關提案能否進一步落實為企業合約與制度,仍有待後續討論。
留言 0