人工智慧公司PrismML在搭載高通(QCOM) Snapdragon的智慧眼鏡上,成功運行20億參數規模的視覺語言模型,讓裝置即時理解使用者注視的物體並回答問題。
PrismML於23日在高通Snapdragon Summit上,展示搭載1位元「Bonsai」模型的Snapdragon AR1 Gen 1平台。TechCrunch報導了這項消息。
智慧眼鏡版本的Bonsai由17億參數的1位元語言模型,以及3億參數的4位元視覺編碼器組成,合計為20億參數的視覺語言模型。使用者可根據眼鏡拍攝到的物體,即時提出問題。
視覺語言模型能同時處理影像、影片等視覺資訊與文字。Bonsai結合負責解讀視覺資訊的編碼器與語言模型,設計為直接在裝置內生成回應。
1位元模型以較低精度表示各項權重,藉此降低記憶體用量。權重是模型處理輸入並生成結果時使用的數值資訊。
高通技術公司表示,根據2026年9月在Snapdragon AR1 Gen 1平台進行的測試,1位元語言模型的權重記憶體用量為0.43GB,較相應4位元模型的1.66GB少3.83倍。代幣生成速度方面,1位元模型每秒生成15.36個代幣,4位元模型為7.44個,兩者相差2.06倍。
上述數據來自高通技術公司於2026年9月在Snapdragon AR1 Gen 1平台進行的記憶體用量與代幣生成速度比較。
PrismML持續開發在大幅縮小模型規模的同時,維持大部分標準基準測試效能的技術。TechCrunch指出,PrismML主打將模型規模縮減至約四分之一,並保留大部分效能。
巴巴克·哈西比(Babak Hassibi) PrismML共同創辦人兼CEO表示:「如果強大的人工智慧要進入人們每天使用的裝置,就必須能夠放進裝置裡。」這意味著,將人工智慧導入智慧眼鏡時,必須同時降低模型規模與運算負擔。
智慧眼鏡可透過相機與麥克風處理周遭的視覺與語音資訊,但在記憶體、電力及散熱空間方面,受到的限制比智慧型手機或伺服器更大。因此,縮小模型並直接在裝置上運行,成為重要課題。
PrismML表示,公司與高通技術公司合作,針對高通Hexagon NPU最佳化Bonsai的權重與結構。NPU是專門處理人工智慧運算的半導體裝置。
在裝置內運行人工智慧,能縮短回應延遲,並減少視覺資訊傳送至外部伺服器的情況。這也有助於在網路連線不穩定的環境中使用模型。
高通先前曾公開用於開發邊緣AI應用的多媒體軟體開發套件,擴大在裝置上處理影像、語音與感測器數據的開發環境。此次Bonsai展示,也顯示裝置端AI的應用範圍正延伸至穿戴式裝置。
PrismML的目標是打造不依賴雲端資料中心、運用裝置自身運算能力的開放權重人工智慧。不過,目前尚未公布搭載PrismML模型的商用智慧眼鏡產品。
留言 0