騰訊(Tencent)公開的AI程式編寫代理基準測試顯示,Anthropic旗下的Claude Code在28項同模型比較中,有17項領先騰訊自家的CodeBuddy Code。在程式領域,接受評測的7個模型全部在搭配Claude Code執行時取得更高分數。
騰訊優圖實驗室、混元安全實驗室(Keen Security Lab)、玄武實驗室(Xuanwu Lab)與WorkBuddy團隊共同公開了WorkBuddy Bench,這套基準測試由260項取材自實際業務、經逆向設計的任務組成。任務分為程式80題、網頁70題、辦公室應用50題、資安60題四大類。研究團隊將7個模型分別套用於CodeBuddy與Claude Code這兩種執行框架(harness)進行效能比較。
所謂執行框架,是指在模型之外負責上下文管理、工具呼叫與任務執行的代理執行層。此次評測顯示,即使底層模型相同,結果也會因執行框架不同而有所差異。在網頁與辦公室應用領域,CodeBuddy分別以4比3領先;在資安領域,則是Claude Code以4比3取得優勢。
細項分數也出現落差。GLM-5.2的網頁分數在兩套執行框架下分別為67.43與60.71,GPT-5.5的資安分數則分別為77.91與64.39。排行榜固定以CodeBuddy 2.109.3與Claude Code 2.1.187版本為基準,各項分數皆為在think模式下執行三次後取得的平均值。
此次結果顯示,評估AI程式編寫工具時,除了底層模型本身,執行架構與工具控制方式同樣需要一併檢視。如同Claude Code將原本在網頁上設定的連接器擴展至終端機與API的案例所示,能否將實際業務工具、權限與執行環境串連起來,往往左右著效能表現與應用範圍。
不過,此次評測任務每個領域僅50至80題,比較對象也僅限於兩種執行框架。BlockBeats報導指出,部分社群使用者認為,若加入更困難的題目,排名可能會出現變化,也有人指出Codex並未被納入比較對象。
WorkBuddy Bench已透過公開儲存庫與Hugging Face資料集釋出,資料集中包含每項任務的指示文字、作業環境與測試設定。騰訊表示,這是一份研究用的預覽版排行榜,未來將隨模型與執行框架的更新持續調整內容。
留言 0