Perplexity 的語境型嵌入模型在文件搜尋基準測試中取得 nDCG@10 81.96%,可透過整份文件的上下文提升檢索增強生成(RAG)系統的搜尋品質。
Perplexity 於2026年2月26日公布標準搜尋模型「pplx-embed-v1」與語境型搜尋模型「pplx-embed-context-v1」。兩個模型系列均提供0.6B與4B參數版本,並支援 MIT 授權與 API。
語境型模型將長文件切分成多個片段時,不會獨立處理每個片段,而是同時參考前後文與整份文件資訊,藉此辨識代名詞或企業名稱等僅看片段難以判斷的表述。
例如,若單獨處理「他在1804年成為皇帝」這句話,便難以確認指涉對象;若一併納入文件前文出現的人物資訊,搜尋流程便能更準確掌握句意。
這項方法在評估整份文件脈絡需求的 ConTEB 基準測試中表現突出。Perplexity 表示,「pplx-embed-context-v1-4B」的 nDCG@10 達到81.96%。
Perplexity 表示,同一比較中,Voyage 的「voyage-context-3」為79.45%,Anthropic 模型為72.4%。這項比較由 Perplexity 提出,相關研究也討論了不同模型系列的效能比較。
OpenReview 公開的比較表顯示,標準搜尋模型「pplx-embed-v1-4B」在多語言 MTEB 搜尋項目的 nDCG@10 為69.66%,Qwen3-Embedding-4B 為69.60%,「gemini-embedding-001」則為67.71%。
標準型與語境型模型的適用對象和評估條件不同,因此不能將 ConTEB 的81.96%與 MTEB 的69.66%視為同一條件下的效能。
這些模型支援32K token 上下文窗口與雙向注意力,也支援 INT8 和二進位量化。Perplexity 說明,採用二進位量化最多可將儲存空間需求降低32倍。
API 價格方面,4B 標準模型每100萬 token 收費0.03美元(約41韓元),4B 語境型模型每100萬 token 收費0.05美元(約68韓元)。上述價格來自 Perplexity 的官方公告。
ConTEB 的設計目的,是評估答案並未完整包含在單一文件片段中、必須依靠整份文件資訊的情境。ConTEB 研究指出,若獨立處理文件片段,文件內的語意連結可能減弱。
檢索增強生成系統通常會將長文件切分成多個片段,再儲存到向量資料庫。若每個片段分開嵌入,文件主題與前後文可能無法充分反映在搜尋結果中。
開發者社群除了關注模型效能,也開始留意實際運行速度與 API 用量。一名開發者分享個人測試結果指出,在相同 A100 環境下,「pplx-embed-v1-4B」的索引速度約比 Qwen3-Embedding-4B 慢7至8倍,但這項結果不能視為一般性效能表現。
Perplexity 開發者論壇也有使用者反映,API 用量似乎不是按文件請求計算,而是按文件片段數量計算。Perplexity 方面回覆稱,這屬於正常運作方式;論壇貼文並指出,文件中的「QPS」標示已改為「每秒可處理的片段數量」。
截至2026年10月1日,官方 Hugging Face 模型集合已列出「pplx-embed-v1」與「pplx-embed-context-v1」系列。採訪線索中出現的「pplx-embed-v2-context-9b-preview」則未在官方公告或模型卡中獲得確認,相關說法曾出現在 Crypto Briefing 的報導中。
考慮導入的開發者,除了基準測試分數,也應分別測試索引速度、記憶體用量、API 的文件片段處理量,以及繁體中文搜尋效能。Perplexity 對標準搜尋與語境型搜尋用途的說明已整理於研究論文中,Perplexity 搜尋 API 的效能比較也曾在本報先前報導中提及。
留言 0