Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

28項比較中17項領先 Claude Code程式領域7比0

騰訊(Tencent)公開的AI程式編寫代理基準測試顯示,Anthropic旗下的Claude Code在28項同模型比較中,有17項領先騰訊自家的CodeBuddy Code。在程式領域,接受評測的7個模型全部在搭配Claude Code執行時取得更高分數。

騰訊優圖實驗室、混元安全實驗室(Keen Security Lab)、玄武實驗室(Xuanwu Lab)與WorkBuddy團隊共同公開了WorkBuddy Bench,這套基準測試由260項取材自實際業務、經逆向設計的任務組成。任務分為程式80題、網頁70題、辦公室應用50題、資安60題四大類。研究團隊將7個模型分別套用於CodeBuddy與Claude Code這兩種執行框架(harness)進行效能比較。

所謂執行框架,是指在模型之外負責上下文管理、工具呼叫與任務執行的代理執行層。此次評測顯示,即使底層模型相同,結果也會因執行框架不同而有所差異。在網頁與辦公室應用領域,CodeBuddy分別以4比3領先;在資安領域,則是Claude Code以4比3取得優勢。

細項分數也出現落差。GLM-5.2的網頁分數在兩套執行框架下分別為67.43與60.71,GPT-5.5的資安分數則分別為77.91與64.39。排行榜固定以CodeBuddy 2.109.3與Claude Code 2.1.187版本為基準,各項分數皆為在think模式下執行三次後取得的平均值。

此次結果顯示,評估AI程式編寫工具時,除了底層模型本身,執行架構與工具控制方式同樣需要一併檢視。如同Claude Code將原本在網頁上設定的連接器擴展至終端機與API的案例所示,能否將實際業務工具、權限與執行環境串連起來,往往左右著效能表現與應用範圍。

不過,此次評測任務每個領域僅50至80題,比較對象也僅限於兩種執行框架。BlockBeats報導指出,部分社群使用者認為,若加入更困難的題目,排名可能會出現變化,也有人指出Codex並未被納入比較對象。

WorkBuddy Bench已透過公開儲存庫與Hugging Face資料集釋出,資料集中包含每項任務的指示文字、作業環境與測試設定。騰訊表示,這是一份研究用的預覽版排行榜,未來將隨模型與執行框架的更新持續調整內容。

查證來源:騰訊WorkBuddy BenchWorkBuddy Bench排行榜Hugging Face資料集

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1