TwelveLabs推出生成式模型 Pegasus 1.6,可分析工作者視角拍攝的影片,將操作動作與場景資訊整理成文字,供機器人與實體 AI 影片分類及審查使用。
TwelveLabs於6日發布公告,將 Pegasus 1.6介紹為支援第一人稱影片理解的模型。第一人稱影片是從工作者或操作者視角拍攝的影像。公司列出的應用情境包括烹飪、工廠組裝與遠端操作機器人。
模型可辨識工作步驟,以及手部與物體的互動,並附上時間資訊;也能生成描述空間關係與場景脈絡的文字。功能還包括評估影片清晰度、構圖與穩定性,以篩選待審查素材,以及透過自然語言搜尋。公告也提到,模型能偵測並標示人臉、周遭人物,以及畫面或文件中呈現的敏感資訊。
TwelveLabs官方開發者文件將第一人稱影片理解、影像分析、改進的物件辨識與中繼資料擷取,以及片段內帶時間戳記的事件擷取列為新功能。文件也說明,模型可用於檢查機器人影片品質,並根據遠端操作影片預測下一步動作。這些是公司公布的功能與應用範例。
此次推出是將影片理解模型應用於機器人與實體 AI 資料處理的嘗試。本刊先前曾報導機器人與實體 AI 領域的投資趨勢。截至目前,公告與官方文件未提供獨立評估或客戶導入案例,證明 Pegasus 1.6 能提升實際機器人訓練成效或改善現場安全。
留言 0