感謝您閱讀本篇文章11 次瀏覽
從第一視角走向AI世界模型,呼應NVIDIA Cosmos 3實體AI新浪潮,慧谷科技前瞻布局人類行動資料
1 min read

從第一視角走向AI世界模型,呼應NVIDIA Cosmos 3實體AI新浪潮,慧谷科技前瞻布局人類行動資料

【台北訊】繼今年5月底發布Cosmos 3世界基礎模型後,NVIDIA於2026年7月20日在美國洛杉磯SIGGRAPH大會上,進一步公開Cosmos 3 Edge與Cosmos-Dreams等技術,呈現AI如何從理解文字與影像,跨入感知環境、推理行動、模擬世界及預測下一個狀態的「Physical AI(實體AI)」階段。 NVIDIA指出,Cosmos 3可以整合文字、影像、影片、環境聲音及行動軌跡,理解物體互動、動作及時空關係;世界模型也能依據目前狀態與行動條件,推演環境接下來可能發生的變化。

7月20日新公開的Cosmos 3 Edge,更可在邊緣運算設備上,即時處理攝影機、機器人與感測器所取得的資料。 這項發展,也印證台灣慧谷科技近年持續推動的研發方向:未來最具價值的影像資料,不只是拍到某個人或某個物件,而是能夠說明「一個人在什麼時間、什麼地點、看見什麼情境、採取什麼行動,以及行動之後產生什麼改變」。

Cosmos 3可同時處理第一人稱與第三人稱視角

NVIDIA執行長黃仁勳此前曾指出,語言模型主要學習人類書寫的文字,但機器人需要從自身視角取得資料。Cosmos 3因此同時處理第一人稱與第三人稱視角,並結合遠端操作、模擬環境及轉換後的第三人稱影片進行學習。這顯示第一視角行動影像,正逐漸由影音內容轉變為AI理解物理世界的重要資料形式。

慧谷科技也認為,傳統影片多以第三人稱記錄事件結果,第一視角影片則接近行動者當下所接收的環境訊息。當網紅、小網紅或一般創作者配戴AI智慧眼鏡探索真實世界時,攝影機所記錄的不只是畫面,也包含行動順序、空間移動、物件操作、人物互動與情境變化。

以前沒用的網紅做菜影片,現在都變成機器人的頂級教材

HIM、HIAM 人類影響力模型 (Human Impact Assessment Model)

慧谷科技總經理朱騏表示:「過去我們把影片當成作品,未來AI會把影片理解為一段世界狀態的改變過程。真正稀缺的不是更多畫面,而是具有情境、行動、結果與證據關係的資料。」 基於這項觀察,慧谷科技正持續研發HIM與HIAM相關架構,嘗試將人、事、時、地、物,以及其屬性、關係、作用和變化,轉換為AI可以讀取、比較與分析的事件資料。 其中,HIM著重於描述事件發生前後的人物、環境、資源與關係狀態;HIAM則進一步分析不同選擇、行動或介入條件,可能造成何種結果。

這項研究並非單純進行影像辨識,而是希望建立一套從真實行動紀錄、世界狀態描述到影響分析的完整方法。 慧谷科技強調,推動AI智慧眼鏡、第一視角創作及短片選拔,其核心仍是鼓勵參與者主動觀察、探索與理解真實世界,而不是將參與者視為替特定AI模型蒐集資料的工具。 未來涉及研究與模型運用時,仍應建立明確告知、主動授權、個人資料保護、用途分級、去識別化與退出機制。

AI智慧眼鏡、邊緣AI、第一視角短片、HIM世界狀態模型與HIAM分析架構

慧谷科技將持續結合AI智慧眼鏡、邊緣AI、第一視角短片、HIM世界狀態模型與HIAM分析架構,發展以人類真實行動為核心的資料方法,讓AI不只能辨識世界中的物體,也能理解人類如何參與世界、改變世界,以及產生何種影響。此稿刻意沒有將慧谷科技描述為NVIDIA合作夥伴或Cosmos 3資料供應商,而是定位為:NVIDIA的發布,驗證了慧谷科技先前對第一視角、人類行動資料與世界模型發展方向的判斷。

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *