多項實驗觀察到,AI模型在評估其他模型的回答時,可能給予與自身相似系列的回答更高評價。研究者指出,這類偏誤可能累積並影響模型排名與效能測量結果。
CryptoBriefing介紹一項研究,稱AI評估者約有58%的機率偏好自己的回答。然而,該報導未提供研究論文名稱或原始資料連結,因此這項數據目前難以視為已驗證的研究結果。
Chatbot Arena是將兩個模型的回答匿名比較,再由使用者選出偏好回答的評估平台。相關研究以截至2024年1月的24萬3329筆對話及50個模型資料為基礎,說明依據人類偏好進行模型評估的架構。Chatbot Arena研究的評估者是人類使用者,與AI評估有所區別。
當評估者由人類改為AI模型時,問題可能更加明顯。KAIST與KRAFTON的研究分析指出,大型語言模型評估者不只會受到準確性的影響,也會受到回答長度、權威式文風等表面特徵影響。研究說明,在直接比較兩個回答的方式下,這類偏誤可能進一步擴大。相關研究
IOV Labs於6月6日公布一項控制實驗,針對4個前沿模型進行1152次成對比較。4個模型都相對偏好自身系列的回答,平均自我偏好指數為+0.14,GPT-4o的指數則為+0.21。IOV Labs研究
不過,4個模型中只有1個實際辨識出回答作者是自己。研究團隊分析,這未必是模型認出自己的回答後予以偏袒,更可能是模型將與自身相似的文風、結構及表達分布判斷為更自然或更優良。
實驗也顯示回答順序與長度會造成偏誤。第一個呈現的回答獲選比例為63%,回答長度與評估結果的相關係數則為0.98。這意味著,即使不考慮回答的實際品質,呈現順序與篇幅仍可能影響結果。
當AI評估者為模型回答評分,而結果再被納入模型排名或訓練資料時,評估者的偏好可能累積到排名中。若反覆使用單一評估模型,也可能形成有利於特定文風或回答結構的結果。
AAAI刊登的一項2026年研究指出,不同模型的偏好偏誤各異,因此各評估者產生的排名可能不一致。研究團隊提出整合多個評估者結果的方法,以降低評估者之間的不一致。AAAI研究
可能的因應方式包括將不同模型納入評估小組,並與人類評估樣本及結果交叉比對。此外,也有必要調換回答順序重新評估,分別測量回答長度與文風造成的影響。
社群實驗同樣反映出比較人類與AI評估結果的必要性。一項Reddit實驗由29名人類與13個AI評估者完成1181次成對比較,實驗發起人表示,在32個問題中有26個呈現相同方向的偏好。不過,這並非正式學術研究,結果難以直接推廣。實驗結果
自我偏好偏誤並不代表評估結果必然錯誤。模型偏好自身系列回答的部分原因,可能確實來自回答品質差異,因此仍需透過更多實驗,區分偏誤與品質差異。
關於評估獨立性與驗證基礎設施的討論,先前在要求保障AI評估者存取權、編輯權及免受報復的案例中也曾出現。受評估企業與評估者分享哪些資訊,以及如何公開結果,都可能影響評估制度的可信度。
目前可確認的研究顯示,AI評估者可能出現自我偏好,以及回答順序與長度偏誤。但這些結果不能以相同比率套用到所有模型與評估環境。
目前沒有資料顯示這些現象會直接影響加密貨幣價格或區塊鏈項目。這場討論的核心,是模型排名與基準測試不應只依賴單一評估者結果,而應同時採用多元評估者、人類樣本對照、回答順序交叉測試,以及長度與文風偏誤檢查。
留言 0