史丹佛大學與NVIDIA Research開發的CLM-8B,在T-Rex遊戲基準測試中以16.5毫秒完成判斷,延遲時間較Jev的149.8毫秒低最多9倍。CLM-8B不是用來生成句子的模型,而是供AI代理從候選行動中選出一項行動。
官方儲存庫23日表示,CLM-8B是「Contrastive Language Model」系列首個公開模型。在電腦操作、遊戲與工具呼叫任務中,CLM-8B能達到與Jev相近的表現,同時將延遲時間最多降低9倍。
在T-Rex基準測試中,CLM-8B的判斷時間為16.5毫秒,Jev則需要149.8毫秒。不過,這項數據是在特定硬體與基準測試條件下測得,並不代表所有任務都會出現相同的速度差距。
CLM-8B的處理方式與傳統大型語言模型不同。模型會將目前狀態與候選行動分別轉換為向量,再選出距離最近的行動,並分開計算狀態與行動的嵌入。
對於反覆使用的行動嵌入,模型會先行快取,以縮短處理時間。由於不需要從頭生成句子,這種架構適合需要快速評估候選行動的AI代理任務。
該模型採用Qwen3-8B作為固定基礎模型,並加入約2000萬個參數的可訓練投影頭。訓練資料包括約6000萬組Nemotron問答配對、約3000萬組合成硬負樣本,以及約100萬條代理軌跡。
官方儲存庫說明,CLM-8B在零樣本評估中取得與Jev相近的結果。完成額外微調後,模型在DeepSWE取得81.6%,在Terminal-Bench 2.1取得87.6%。
不過,這兩項數據來自微調後的驗證器頭,而不是公開的基礎模型本身。因此,基礎模型的零樣本表現與微調模型的基準測試結果,難以用同一標準直接比較。
Jev被介紹為一種根據輸入狀態回傳選項與分數、布林值及機率的模型,而非著重生成長篇內容。正如先前分享的Jev應用案例所示,CLM-8B同樣將重點放在判斷與選擇,而非內容生成。
CLM-8B不是通用聊天機器人。它的設計是計算既定候選行動的分數並選出其中一項,無法產生候選清單以外的新答案,也不是用來獨立生成句子的模型。
兩個模型的效能比較可能因評估方式而異。JevEmbed儲存庫的部分評估顯示,CLM-v0.1-8B在JevBench的231項任務中取得41.99%準確率,但其任務組成與測量方式不同於開發團隊所稱的「與Jev相近表現」。
模型權重與程式碼以Apache 2.0授權公開。Hugging Face模型卡指出,完成Qwen3-8B嵌入伺服器與執行環境配置後,使用單張NVIDIA GPU即可自行運行。
開放權重與單一GPU運行支援,讓希望建置自有AI代理的開發者能直接測試模型。不過,這是否能降低實際服務成本或提升代理效能,仍需另行驗證。
社群對官方資料的反應不一。Reddit的LocalLLaMA社群有使用者肯定其開放權重與低延遲表現,也有人指出,CLM-8B在通用知識與長上下文處理方面,可能不如Jev完整。
開發團隊在模型卡中表示,計畫於10月初公開多模態後續模型CLM-35B。目前實際發布日期與效能仍未公布。
留言 0