人形機器人在30個從未接觸過的家庭中執行整理臥室、摺毛巾與整理客廳等任務,成功率達56%。不過,仍有44%的任務未能完成,實際家用機器人所需的可靠性與安全性仍有待進一步驗證。
Figure於17日公布Helix 2.5,表示機器人未針對評估住宅或物體額外收集資料、微調或適應,便完成三項長時間任務。
Figure所稱的「零樣本泛化」,是指機器人進入新環境後,無需額外學習,便能運用既有知識執行任務的能力。此次評估中,機器人沒有事先針對作業場所重新訓練。
家庭是機器人難以適應的工作環境,因為每個家庭的家具配置、通道,以及床品和毛巾的形狀都不相同。
Helix 2.5的設計可在同一工作流程中處理移動、物體辨識、雙手操作與姿勢控制。三項任務都要求機器人同時移動並操作物體,且屬於長時間任務。
Figure將性能提升的關鍵歸因於人類行為資料集「Index」的預訓練。在採用相同任務資料與模型架構的比較中,從零開始訓練的策略零樣本成功率為9%,採用Index預訓練的策略則達到56%。
Figure表示,預訓練是造成兩種策略性能差異的主要因素。該公司說明,透過人類在真實環境中執行任務的資料,機器人得以取得處理陌生空間與物體所需的先備知識。
成功標準不只是完成部分動作。機器人必須把所有玩具放入籃子、摺好並搬運所有毛巾,或完成整理床鋪,才會被認定為成功。
因此,56%不是機器人在陌生空間開始任務或完成部分步驟的比例,而是從頭到尾完成指定任務的比例。其餘44%未達到完成標準。
Figure表示,Helix 2.5在維持與先前Helix 02相同成功率的同時,將任務指定所需的適應資料減少一半。適應資料是指為讓機器人適應新任務或新環境而額外使用的資料。
Helix 02是Figure於2026年1月公布的全身自主控制模型。Figure表示,該模型是為執行洗碗機操作與物流作業等長時間任務而開發。
此次發布的重點不在機器人硬體本身,而是人類行為資料預訓練與控制模型的結合。Figure此前曾公布Index平台,收集人類行為資料並用於人形機器人訓練。
一般而言,若要提升家用機器人的實用性,不能只展示其在特定空間運作,還必須應對多種住宅結構與物體。若每次都要收集不同環境的資料,部署與維護成本也可能增加。
此次結果難以直接與其他機器人平台的性能比較。Helix 2.5的56%成功率是根據Figure自行設計的評估與標準得出的數值,目前尚未確認在相同條件下進行的獨立測試結果。
目前也未確認有獨立企業發布或專家評估資料,能單獨驗證Helix 2.5的成功率。若要判斷其是否達到實際服務應用水準,仍需針對多種住宅結構與物體種類進行後續評估,並公開失敗率與安全介入頻率。
留言 0