泰達(Tether)旗下泰達數據(Tether Data)已開源約 4.6 億個參數的端側視覺語言 AI 模型「VisionPsy-Nano」,主打在智慧型手機等裝置內直接處理影像與文字的「小型多模態模型」。
根據 PANews 報導,泰達數據旗下 AI 研究項目 QVAC 表示,VisionPsy-Nano 在 5 億個參數以下的視覺語言模型中,以整體正規化分數 62.3 取得業界領先成績。QVAC 稱,其表現整體優於 Liquid AI 與 Hugging Face 的同級模型。
這次公開的版本包括標準版「VisionPsy-Nano-460M」,以及降低延遲的「VisionPsy-Nano-460M-Flash」。資料顯示,Flash 版本在 Pixel 9、Galaxy S23、Galaxy S25 Ultra、iPhone 15 等裝置上,首個 token 生成速度最高約比 SmolVLM2-500M 快 19 至 36 倍。
兩款模型的權重均以 Apache 2.0 授權釋出,並支援 Transformers、基於 llama.cpp GGUF 量化的本機部署,以及 vLLM 高吞吐量伺服器推論。對開發者而言,這代表「端側 AI」應用可在更小模型與更低延遲條件下進一步測試落地。
留言 0