
商傳媒|林昭衡/綜合外電報導
人工智慧公司 Twelve Labs, Inc.(TwelveLabs)於週二宣布推出 Pegasus 1.6 模型,這款新模型旨在透過影片理解,賦予機器人與物理AI(Physical AI)在現實世界中執行任務的能力。物理AI是一種讓機器能夠在現實世界中感知、推理並執行任務的人工智慧,而 Pegasus 1.6 的目標便是協助這些應用。
Twelve Labs 的共同創辦人暨執行長 Jae Lee 表示,機器過去難以從人類執行的實體工作中學習,例如掌握物品的施力變化或意外滑落後的調整動作。Pegasus 1.6 模型的發布,讓團隊能將原始影片素材轉化為結構化且可供檢視的知識,使機器人與物理AI團隊能從實際的人類經驗中學習,而非從零開始。
Pegasus 1.6 最大的特色是首度專為理解「第一人稱視角影片(egocentric video)」而設計。這類影片是從操作者的視角拍攝,能捕捉人體行動與環境互動的細節。與傳統的遙控操作數據相比,第一人稱視角影片更容易收集與擴展,且不需要特殊的攝影機或專有硬體,只要能從操作者的角度捕捉動作和互動即可。
該模型能夠精確識別影片中的動作,將其細分為精確的時間片段,並捕捉更細微的行為細節。Pegasus 1.6 支援五種工作流程,包含動作分割與標註、稠密字幕標註、品質評分、搜尋與策展,以及同意與合規標記。這些功能讓模型能將大量影片資料轉化為機器學習所需的有效訓練數據,同時也能分析靜態圖片。
此技術擴展了 Pegasus 1.5 模型現有功能,例如時間基礎元數據(Time-Based Metadata),並改進了實體辨識能力,使機器能更一致地追蹤影片中的手部、物體和工具。透過 Pegasus 1.6,Twelve Labs 期望能與更多機器人開發商合作,擴展用於機器人訓練的數據量,尤其在靈巧操作任務,如包裝、組裝、清潔,以及半導體品質控制等專業工業應用上,這項技術將提供關鍵的影片理解能力。


