在54名視訊通話參與者中,26人認為對方是真人。這是Tavus公布的一項1分鐘實驗結果,並不代表一般視訊通話中AI被誤認為真人的比例。
Tavus於10月1日發布對話模型Griffin。實驗採用的Griffin-Lite是研究預覽模型,可即時接收語音與影像,並生成說話內容、表情、視線和動作。Decrypt報導了Tavus的發布消息與實驗結果。
Tavus告知參與者,他們將與另一名參與者進行1分鐘視訊通話,話題是今年期待的事。通話結束後,公司詢問參與者是否認為對方是真人;54人中有26人回答是。Tavus公布的比例為48%。
Tavus表示,在先前一項系統實驗中,41名參與者有1人(2.4%)認為對方是真人。先前的系統結合了分別負責影像生成、對話和感知功能的三個模型。兩次實驗的參與者人數不同;僅憑已公開的說明,無法得知兩者是否以同一組參與者進行對照測試。
48%是Tavus自行進行的實驗結果:參與者事先未獲告知對方可能是AI,並就單一話題交談1分鐘。目前尚未公開由獨立機構驗證實驗設計與結果的資料。
Griffin-Lite的設計方式,是在對話進行時持續分析語音和影像並生成回應,而非等對方說完才回答。Tavus將此設計與依序串接語音辨識、語言模型及語音與影像生成模型的做法區分。該公司主打的特色,是模型能在聆聽的同時掌握對話脈絡與非語言訊號。
在NVIDIA的VideoFDB評測中,Griffin-Lite的生成項目獲得3.83分,滿分為5分。公開表格中的人類基準分數為3.92分;排名其後的Gemini 2.5與Anam組合得分為2.80分。Griffin-Lite在感知項目獲得3.73分,低於人類基準的4.20分。
VideoFDB以237段取自真實視訊通話的對話片段,以及11種非語言互動類型為基礎,分別評估AI的感知與生成能力,並透過語言模型評審方式計分。這項評測與Tavus實驗測量的「參與者是否認為通話對象是真人」並非同一指標。
Tavus尚未向一般客戶推出Griffin-Lite。該公司表示,在建立安全措施與AI揭露功能、並與相關安全團體合作期間,將以研究預覽形式提供給部分可信任的測試者。
留言 0