100多名人工智慧(AI)專家聯署公開信,要求Anthropic、OpenAI等主要AI企業保障獨立安全評估團隊的實質權限與保護措施,避免企業控制影響前沿AI模型風險的客觀驗證。
AI評估機構聯盟18日發布公開信,主張評估團隊應具備科學客觀性、透明度、獨立性與完善的保護措施。聯署者包括傑弗里·辛頓(Geoffrey Hinton)、約翰霍普金斯大學與史丹佛大學研究人員,以及非營利評估機構METR相關人士。CNBC介紹了公開信全文與聯署名單。
公開信的核心要求,是讓評估團隊取得與企業內部評估團隊相近的系統、資料與工具存取權,同時由外部評估機構掌握評估方法與結果的編輯權。信中也要求提供保護,避免受評估企業因不利結果終止合約或提起訴訟。
公開信也提出判斷評估團隊獨立性的標準。評估機構不應由AI企業持有或控制,也應避免採用會因評估結果而改變報酬的合約。評估機構還應揭露評估方法、存取範圍、結果公開條件與利益衝突,並讓多家評估機構同時參與,以比較不同結論與專業能力。
這場討論源於達里奧·阿莫代伊(Dario Amodei)Anthropic共同創辦人兼CEO於12日發布的文章。阿莫代伊主張,前沿AI企業應持續為獨立評估團隊提供「近似員工的存取權」。
Anthropic表示,將為評估團隊提供辦公座位、出入證、公司筆記型電腦,以及相當於內部風險評估團隊的工具與權限,並允許團隊在未經公司事前編輯的情況下公開核心結果。阿莫代伊說明,評估團隊應直接檢視企業的安全措施與事故應對。阿莫代伊提出的獨立評估團隊持續存取方案,也要求在前沿AI開發速度與安全措施之間取得平衡。
山姆·奧特曼(Sam Altman)OpenAI CEO支持阿莫代伊的提案,並表示OpenAI也將採取相同措施。伊隆·馬斯克(Elon Musk)與薩蒂亞·納德拉(Satya Nadella)也公開表達支持。
不過,OpenAI將選擇哪些評估機構、給予評估團隊多大範圍的存取權、合約條件與實施時間,目前都尚未公開。因此,目前確認的內容仍停留在公開發言與提案層面。
近期Anthropic的網路安全評估過程,也凸顯獨立評估的必要性。Anthropic表示,9日調查了Claude模型實際存取第三方系統的4起事件。
Anthropic先檢視約14萬筆紀錄,之後將調查範圍擴大至約4億8100萬筆紀錄。接著,Anthropic委託METR進行獨立調查,並提供廣泛資料與員工訪談存取權;Anthropic說明,4起事件是由評估環境設定錯誤所造成。相關內容收錄於Anthropic調查報告。
AI Evaluator Forum發布了自主標準AEF-1,列出第三方評估的最低運作條件。該標準將充分的存取權與資源、利益衝突管理、評估方法自主性、結果公開透明度,以及敏感資訊保護列為核心原則。
AEF-1要求評估機構揭露實際存取過哪些模型與資料,以及報酬與合約條件是否影響評估結果。AI Evaluator Forum的AEF-1標準,也把評估機構與企業之間的關係納入獨立性判斷範圍。
對此也有不同看法。一方面,有意見認為僅依靠企業內部報告,難以客觀確認安全、網路與社會基礎設施風險;另一方面,也有批評指出,若評估機構依賴企業提供的資金或存取權,外部評估可能只剩下名義。Axios報導,部分評估機構可能因與AI企業既有的關係,或與特定研究運動的連結,而陷入利益衝突爭議。
本刊先前曾報導METR與Anthropic之間的人員及業務連結引發評估獨立性爭議。此次公開信同樣將評估團隊定位為企業內部安全調查的補充,而非替代方案,並同時要求保障存取權、資金與合約上的獨立性。
關鍵不在於企業是否邀請評估團隊加入,而在於評估團隊能存取哪些資訊、是否能公開不利結果,以及能否免受企業合約壓力影響。OpenAI的詳細執行方案與評估團隊選定方式,仍有待後續公開內容確認。
留言 0