優步(UBER)在把AI代理每週請求量拉高到9.4倍之後,整體AI支出卻在4月以後大致穩定下來,這被視為企業在AI導入競賽中,重心正從「用得多」轉向「花得巧」的訊號。
優步「傑出工程師」尤代·基蘭·梅迪塞蒂(Uday Kiran Medisetty)27日(當地時間)在公司工程部落格撰文指出,從2026年2月到8月中旬,優步內部AI代理的每週請求量成長了9.4倍。他也提到,同一期間使用AI工具的員工人數增加逾4倍,但整體AI支出自4月起相對穩定。
成本控制的關鍵不是單純限制使用量,而是任務分配與代幣(Token)管理。優步表示,以同一款AI模型計算,每千次請求的成本較高峰時期下降近34%,每個會話(Session)的成本則比6月的高點下滑52%。
目前逾七成的程式碼變更提交,是由本地或雲端AI代理完成,優步工程師每天執行的AI代理任務量超過3萬件。
AI代理是一種能根據使用者指令,自動完成程式碼審查、除錯、任務執行等工作的軟體工具。與單純一問一答的聊天機器人不同,AI代理會不斷讀取、寫入、執行,直到達成目標為止,因此呼叫次數與代幣用量都可能快速攀升。
優步這次強調的重點,是「用什麼任務配什麼模型」。公司表示,選擇模型時會同時考慮各項任務的成本、產出品質與模型可靠度。
具體做法是由主要模型負責拆解任務與評估結果,範圍明確的子任務則交給相對便宜的模型處理。換句話說,優步減少了把小型任務也塞給高性能模型的做法,藉此壓低每次請求的成本。
代幣管理同樣是成本控制的重要一環。優步指出,即使使用可處理高達100萬代幣的模型,對話型會話仍會在累積到40萬代幣時自動觸發壓縮。
梅迪塞蒂說明,由於多數主流模型的輸出代幣與推理代幣收費,往往高於輸入代幣,優步已把預設推理強度設定為中等水準。模型思考得越久、回答得越長,成本就可能越高,這項考量已經納入日常營運標準。
提示詞快取(Prompt Cache)的保留時間也做了調整。優步觀察到工程師經常在對話型會話開著的狀態下,離開座位超過5分鐘,因此把原本5分鐘的快取時間延長為1小時。
快取機制的作用,是降低重複傳送相同上下文所產生的費用。此外,優步也讓工程師能在終端機(Terminal)即時查看各會話的成本,作為培養「成本意識」的另一項工具。
科技媒體Axios報導,優步在今年第一季就已用盡原訂的2026年AI預算,之後才轉向控管成本。優步技術長普拉文·內帕利·納加(Praveen Neppalli Naga)在X平台上表示,開放權重(Open Weight)模型的實驗是成本下降的原因之一,他寫道「我們持續評估並部署適合各種使用情境的模型」,說明公司仍在為不同任務尋找最適合的模型組合。
開放權重模型指的是模型權重公開,企業可依自身環境調整並運行的AI模型。企業若不完全依賴外部商用模型的呼叫,同時搭配內部基礎設施或特定用途模型,就能在成本與控管方式上取得更多彈性。
隨著AI代理型應用增加,成本管理也成為平台重要課題的趨勢持續發展,優步這次的案例顯示,企業內部檢視的重點正從「用量成長」提前轉向「單位成本與營運控管」。
在把AI節省的工時效益換算為成本價值的討論逐漸擴大之際,優步案例被視為呈現實際營運階段成本結構的企業實例。隨著AI更深入融入開發工作,企業面對的課題已不只是處理更多請求,而是如何用穩定的成本完成同樣的工作。
留言 0