
商傳媒|葉安庭/綜合外電報導
輝達(NVIDIA)今日宣布推出 Metropolis Blueprint for Video Search and Summarization (VSS) 3.3,旨在大幅降低開發與運行視覺AI代理的成本。視覺AI代理是能夠理解並依據影像資訊執行任務的智慧程式,其應用廣泛,從智慧城市的車輛偵測到倉儲業的物流追蹤,均有巨大潛力。
VSS 藍圖工具能協助開發者更快速地建構視覺AI代理,它整合了多種人工智慧技術,包括輝達 Cosmos 等視覺語言模型(VLM,一種能同時處理影像與文字資訊的AI模型)、輝達 Nemotron 等大型語言模型(LLM)、檢索增強生成(RAG,一種讓大型語言模型在生成回應前先檢索外部知識庫的技術),以及模型上下文協議(MCP)工具。這些技術共同作用,能將影片內容轉化為自然語言搜尋、視覺問答、驗證警報及自動化報告等功能。
VSS 3.3 版本引入兩大關鍵功能以降低成本:一是 Build Vision Agent skill,能加速應用程式的組建;二是 Adaptive Efficient Video Sampling (EVS),大幅減少運行時 VLM 的處理成本。透過 Build Vision Agent skill,開發者只需一個提示詞,即可在不到 30 分鐘內建立並部署視覺AI代理,且所需的程式碼編寫工作量極少,部署一個此類代理僅需花費數美元的編程代理使用費。
另一方面,Adaptive EVS 能顯著優化視覺語言模型的運行效率,例如在處理一段 60 分鐘的影片摘要時,可減少高達 80% 的 VLM 輸入 Token(模型處理資訊的基本單位),並在相同的 GPU 上增加 46% 的併發串流處理量。此外,Adaptive EVS 還能將警報情境化延遲從 1,021 毫秒縮短至 844 毫秒,降低 17%。這項技術透過動態修剪未變動的影像 Token,以及針對顯著事件進行批次處理,有效減少了重複的 VLM 運算。
輝達將於明日(10月1日)上午9時(太平洋時間)舉辦一場直播活動,展示如何從單一提示詞建立視覺AI代理。這些技術更新將有效解決視覺AI代理開發中常見的成本挑戰,包括開發、運行及後續變更維護的費用,對全球的AI開發者來說,意味著更高的效率與更低的進入門檻。


