微軟(Microsoft,$MSFT)公開 Microsoft-Decision-1,這款模型會為預先設定的選項評分,可用於分類、排序優先事項及控制 AI 代理。模型直接提供判斷結果與機率,不必生成長篇回答,目標是自動化重複性的業務判斷。
微軟於 2026 年 10 月 9 日在開發者刊物介紹這款模型,並表示可透過 Microsoft Foundry 使用,預計也會在 OpenRouter 上提供。使用者可預先設定選項,再依評分決定是否進入下一步、重試工作或交由人工審查。
微軟列出的應用場景包括請求分類、工作排序、AI 回覆驗證、模型選擇與代理行為控制。例如,依照評分標準判斷 AI 生成的回覆應接受、修改或拒絕;也可依緊急程度將事件報告轉交給負責團隊。
Microsoft-Decision-1 以阿里巴巴的 Qwen3.5-9B 為基礎進一步訓練,設計目標是透過單次推論為判斷評分。微軟表示,未來計畫推出以 Microsoft AI 和 OpenAI 其他模型為基礎的更新版本。
微軟公布的效能數據來自公司自行評估。微軟表示,模型在 36 項基準測試中取得最高準確度,測試涵蓋約 15 萬個問題;測得速度比 Quyet-1.0-Large 快 4.5 倍,比 GPT-6 Sol 快 35 倍。輸入內容變化所造成的決策變化率平均為 1.3%。此外,微軟也評估了 11 項基準測試中的 5,250 個請求,內容包括有害請求、越獄嘗試與提示注入。
微軟也分享內部測試案例:Xbox Research 將問卷,以及 Steam 和 X 上超過 1 萬則遊戲相關意見依主題分類。微軟表示,這項測試達到與 GPT-6 Sol 相近的品質,速度快逾 14 倍,成本約為其二百分之一。
微軟表示,在 Copilot 團隊的回覆品質評估中,模型以快 100 倍的速度產生可與 GPT-5.6 Luna 相抗衡的結果。公司也公布了事件應變知識搜尋和科學研究工作流程的測試結果;這些數據同樣來自微軟自行評估。
機率評分可作為區分自動處理與人工審查的依據。不過,分數本身無法保證判斷正確,實際導入時仍須一併評估誤判造成的重工、審查負擔與營運成本。目前公布的應用案例主要來自微軟內部測試。
留言 0