TypeSafe AI推出Jev模型,以機率與結構化判斷取代文字回覆,鎖定電子郵件分類、請求路由與風險判定等由軟體直接處理的自動化工作。
TypeSafe AI於9月15日宣布,旗下首個「System One模型」Jev以早期存取形式發布。Jev不生成自由文字,而是回傳開發者預先設定的選項、分數或布林值,以及各項判斷的機率與信心度。
Jev並非用於撰寫程式或提供對話式回答,而是根據輸入狀態與問題,判斷是否核准、風險程度及應交由哪個處理系統負責,同時支援一次處理多個問題的平行取樣。
傳統大型語言模型(LLM)主要為生成自然語言而設計,軟體要使用其結果時,通常還需要額外解析與驗證。Jev則限制輸出格式,主打讓分類、評分與驗證結果直接串接至程式。
Jev的名稱取自19世紀經濟學家威廉·斯坦利·傑文斯(William Stanley Jevons)提出的「傑文斯悖論」。TypeSafe AI表示,名稱反映一項構想:當使用智慧的成本下降時,智慧型軟體的使用量反而可能增加。
TypeSafe AI表示,Jev採用名為「校準決策強化學習(RLCD)」的自有訓練方法。公司宣稱,Jev回應時間介於70至500毫秒,在特定System One工作中,速度可能比既有前沿模型快40至200倍。
TypeSafe AI官網公布的自有工作流程評估顯示,Jev速度為既有模型的193.6倍,成本則低444.6倍。評估比較四種示例工作流程中的模型準確度、成本與處理時間,涵蓋安全事故應對、客服與發票處理等場景。
不過,這項比較並非獨立機構的大規模驗證,而是以公司設計的評估條件為基礎。TypeSafe AI表示,評估沒有採用一般基準測試,而是拆解實際自動化工作;比較對象LLM則套用了結構化輸出包裝器。
Jev定價為每輸入100萬個代幣0.042美元(約58韓元),輸出代幣不另收費。Vercel AI Gateway則標示每輸入100萬個代幣0.04美元(約55韓元)。
Vercel將Jev介紹為可由軟體直接使用的結構化判斷模型,並列出分類、路由與驗證等主要用途。Pydantic AI文件也說明,Jev會針對輸入回傳結構化判斷與機率,而非自由文字。
TypeSafe AI表示,Jev只回傳結構化定義的結果,因此不會產生類型錯誤。不過,公司服務條款也載明,服務可能產生不準確或錯誤的結果,使用者應獨立評估輸出內容。
因此,「沒有幻覺」應理解為不生成自由文字或出現格式錯誤,不能擴大解讀為輸入理解或分類判斷永遠正確。
開發者反應不一。有開發者關注Jev的低成本與快速處理速度,也有人指出,仍需確認公司提出的結果能否在實際程式碼庫中重現。
普拉尼特·夏爾馬(Pranit Sharma)Vercel軟體工程師表示,在安全審查分類工作中,將OpenAI模型換成Jev後,速度快了5至18倍,準確度也較高。不過,完整比較環境與準確度原始資料尚未公開。
尼基爾·穆多爾卡爾(Nikhil Mudholkar)Bryo AI技術長表示,在商務電子郵件分類測試中,Gemini準確度略高,但成本是Jev的10至20倍。Earendil技術長阿明·羅納赫(Armin Ronacher)則評估,Jev輸出的機率可作為決定是否交由人工審查的依據,但低機率判斷應如何捨棄,仍須由使用者自行訂定標準。
TypeSafe AI創辦人迪奧戈·阿爾梅達(Diogo Almeida)表示,他曾在OpenAI參與提升語言模型指令執行與對話能力的研究,相關研究成為ChatGPT的基礎。Jev的架構、訓練資料規模與標準基準測試成績尚未公開,公司提出的效能與成本能否在實際自動化環境中維持,仍有待進一步驗證。
留言 0