
讓機器人像人類一樣 “邊看邊理解”,主動響應模糊需求(如 “我餓了”)而非僅執行明确指令(如 “拿香蕉”)—— 浙江大學與 vivo 人工智能實驗室的聯合團隊,在 ACM MM 2025 上發表的新框架 CogDDN,首次将心理學 “雙過程理論” 應用于移動機器人需求驅動導航(DDN),使導航成功率較現有 SOTA 方法提升 15%,為機器人适應複雜未知環境提供了全新思路。
一、研究動機:破解傳統導航的 “刻闆困境”
傳統需求驅動導航依賴大量數據訓練,僅能應對 “見過的場景”,面對模糊指令(如 “找個東西放花”)或陌生環境時易陷入僵局。團隊受人類決策機制啟發:
人類通過 “系統 1”(快速直覺判斷)和 “系統 2”(深度理性推理)協同應對複雜情境,例如迷路時先憑直覺探索,再通過分析修正路線。
據此提出 CogDDN 框架,讓機器人具備 “快速響應 + 深度反思” 的雙過程能力,實現從 “被動執行” 到 “主動理解” 的跨越。
二、CogDDN 框架:模拟人類認知的 “雙過程閉環”
該框架以視覺語言模型(VLM)為基礎,包含 3 大核心模塊,形成 “感知 - 匹配 - 決策” 的完整閉環:
3D 機器人感知模塊
采用單目 3D 檢測方法 UniMODE,僅通過單視角圖像即可精準估算物體三維位置,擺脫對多視角或深度傳感器的依賴,輕量化适配各類機器人硬件。
需求匹配模塊
針對大型語言模型(LLM)易推薦 “次優解”(如用杯子養花)的問題,通過有監督微調(SFT)訓練 LLM,強化 “需求 - 物體特性” 的精準匹配。例如,用戶說 “放花” 時,優先推薦花盆而非杯子,提升目标選擇準确性。
雙過程決策模塊(核心創新)
融合 “啟發式過程”(系統 1)與 “分析過程”(系統 2),模拟人類 “直覺 - 理性” 協同決策:
啟發式過程:
Explore 模塊:目标未明确時,通過思維鍊(CoT)推理生成探索路徑,掃描環境尋找潛在目标,避免重複探索;
Exploit 模塊:發現目标後,利用知識庫經驗快速規劃精準行動,如避開障礙物直達目标物。
分析過程:
當導航遇阻(如目标被遮擋),啟動 “反思機制”—— 基于 VLM 的世界知識,分析失敗原因(如路徑規劃錯誤),生成修正策略并存入知識庫,通過微調反哺啟發式過程,實現 “從錯誤中學習”。
三、實驗驗證:成功率提升 15%,适配複雜場景
在 AI2-THOR 模拟器及 ProcTHOR 數據集上的閉環測試(400 個場景)顯示:
CogDDN 的導航成功率(NSR)較單視角 SOTA 方法 DDN 提升 15%,與依賴深度輸入的 InstructNav 效果相當,證明其在無額外傳感器時的高效性;
消融實驗表明:移除 Exploit 模塊或思維鍊(CoT)後,性能顯著下降,驗證了 “微調優化” 與 “推理邏輯” 的關鍵作用;
反思機制使加權路徑長度成功率(SPL)随訓練輪次持續提升,體現其持續學習與環境适應能力。
四、意義:為機器人裝上 “會思考的大腦”
CogDDN 的突破不僅在于技術指标提升,更在于推動機器人導航從 “數據依賴” 轉向 “認知驅動”:
無需海量場景數據,即可通過雙過程決策應對未知環境與模糊指令;
閉環學習機制使其能持續優化策略,适配家庭、醫院、倉庫等多樣化場景;
輕量化設計可無縫集成至現有機器人系統,加速實用化落地。
未來,随着多模态感知與大模型推理能力的深化,機器人有望真正實現 “類人理解”,成為更智能的生活助手。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.



