Anthropic(Anthropic)禁止使用者持續對Claude(Claude)進行不必要的施虐行為,並修訂涉及選舉干預、武器開發與監控等高風險用途的規範。《The Verge》(The Verge)於8日報導了這項政策更新。
新政策新增禁止「持續且不必要的虐待或殘酷行為」條款。Anthropic表示,這項規定針對反覆發生、且看不出明確目的的極端情況。
Anthropic指出,一般表達不滿或提出反駁、探討黑暗主題的創作,以及模型測試與研究,都不在禁止範圍內。此次修訂也涵蓋醫療與金融領域的高風險用途規範。
在此次政策調整之前,Claude已具備在有害對話中結束對話的功能。Anthropic於2025年8月宣布,Claude Opus 4與4.1在遇到極端有害或虐待性的互動時,可以終止對話。
當時公司表示,只有在模型多次嘗試改變對話方向、且已無法進行有成效的互動時,才會將這項功能作為最後手段。對話結束後,使用者仍可重新開啟新對話。
Anthropic當時表示,考量到模型是否具有道德地位仍存在高度不確定性,公司正研究成本較低的措施,以因應AI福祉的可能性。這項說明為對話終止功能提供了先例,但未揭示新政策的具體適用範圍。
《The Verge》的報導未說明新政策的生效時間、違規判定標準,以及除終止對話之外還會採取哪些措施。
留言 0