浙大 & vivo 聯手突破機器人導航技術:CogDDN 框架憑 “雙過程決策” 提升成功率 15%

2025-08-08 09:13:53 來源:太平洋
        【每日科技網】
 浙大 & vivo 聯手突破機器人導航技術:CogDDN 框架憑 “雙過程決策” 提升成功率 15%

  讓機器人像人類一樣 “邊看邊理解”,主動響應模糊需求(如 “我餓了”)而非僅執行明确指令(如 “拿香蕉”)—— 浙江大學與 vivo 人工智能實驗室的聯合團隊,在 ACM MM 2025 上發表的新框架 CogDDN,首次将心理學 “雙過程理論” 應用于移動機器人需求驅動導航(DDN),使導航成功率較現有 SOTA 方法提升 15%,為機器人适應複雜未知環境提供了全新思路。

  一、研究動機:破解傳統導航的 “刻闆困境”

  傳統需求驅動導航依賴大量數據訓練,僅能應對 “見過的場景”,面對模糊指令(如 “找個東西放花”)或陌生環境時易陷入僵局。團隊受人類決策機制啟發:

  人類通過 “系統 1”(快速直覺判斷)和 “系統 2”(深度理性推理)協同應對複雜情境,例如迷路時先憑直覺探索,再通過分析修正路線。

  據此提出 CogDDN 框架,讓機器人具備 “快速響應 + 深度反思” 的雙過程能力,實現從 “被動執行” 到 “主動理解” 的跨越。

  二、CogDDN 框架:模拟人類認知的 “雙過程閉環”

  該框架以視覺語言模型(VLM)為基礎,包含 3 大核心模塊,形成 “感知 - 匹配 - 決策” 的完整閉環:

  3D 機器人感知模塊

  采用單目 3D 檢測方法 UniMODE,僅通過單視角圖像即可精準估算物體三維位置,擺脫對多視角或深度傳感器的依賴,輕量化适配各類機器人硬件。

  需求匹配模塊

  針對大型語言模型(LLM)易推薦 “次優解”(如用杯子養花)的問題,通過有監督微調(SFT)訓練 LLM,強化 “需求 - 物體特性” 的精準匹配。例如,用戶說 “放花” 時,優先推薦花盆而非杯子,提升目标選擇準确性。

  雙過程決策模塊(核心創新)

  融合 “啟發式過程”(系統 1)與 “分析過程”(系統 2),模拟人類 “直覺 - 理性” 協同決策:

  啟發式過程

  Explore 模塊:目标未明确時,通過思維鍊(CoT)推理生成探索路徑,掃描環境尋找潛在目标,避免重複探索;

  Exploit 模塊:發現目标後,利用知識庫經驗快速規劃精準行動,如避開障礙物直達目标物。

  分析過程

  當導航遇阻(如目标被遮擋),啟動 “反思機制”—— 基于 VLM 的世界知識,分析失敗原因(如路徑規劃錯誤),生成修正策略并存入知識庫,通過微調反哺啟發式過程,實現 “從錯誤中學習”。

  三、實驗驗證:成功率提升 15%,适配複雜場景

  在 AI2-THOR 模拟器及 ProcTHOR 數據集上的閉環測試(400 個場景)顯示:

  CogDDN 的導航成功率(NSR)較單視角 SOTA 方法 DDN 提升 15%,與依賴深度輸入的 InstructNav 效果相當,證明其在無額外傳感器時的高效性;

  消融實驗表明:移除 Exploit 模塊或思維鍊(CoT)後,性能顯著下降,驗證了 “微調優化” 與 “推理邏輯” 的關鍵作用;

  反思機制使加權路徑長度成功率(SPL)随訓練輪次持續提升,體現其持續學習與環境适應能力。

  四、意義:為機器人裝上 “會思考的大腦”

  CogDDN 的突破不僅在于技術指标提升,更在于推動機器人導航從 “數據依賴” 轉向 “認知驅動”:

  無需海量場景數據,即可通過雙過程決策應對未知環境與模糊指令;

  閉環學習機制使其能持續優化策略,适配家庭、醫院、倉庫等多樣化場景;

  輕量化設計可無縫集成至現有機器人系統,加速實用化落地。

  未來,随着多模态感知與大模型推理能力的深化,機器人有望真正實現 “類人理解”,成為更智能的生活助手。

免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
    本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

猜你喜歡

OpenAI發布GPT-5.6系列模型,旗艦版Sol編程測試創SOTA,但僅限小範圍預覽

OpenAI于6月27日發布新一代GPT-5.6系列模型,一次性推出三款不同定位的産品:旗艦版Sol(太陽)、均衡版Terra(地球)和輕量高速版Luna(月亮)。三款模型均以“有限預覽”形式向部分合

OpenAI

3周前

深度機智再獲數億元融資,“人類學習”全棧物理AI體系加速落地

物理AI企業深度機智近日宣布完成新一輪數億元融資,由國壽長三角科創基金領投,老股東普華資本、誠通科創基金持續加注,藍湖資本、博彥科技、磐谷創投等十餘家機構共同參與。這是公司近兩個月内完成的第二輪數億元

3周前

微軟2026工作趨勢指數:員工AI就緒度領先組織,組織環境成價值釋放關鍵

微軟日前發布《2026工作趨勢指數年度報告》(WorkTrendIndex),基于對全球10個市場、20,000名AI使用者的調研,以及數萬億條經匿名化處理的Microsoft365生産力信号分析。報

3周前

高通加速“物理AI”落地:艙駕融合芯片已量産,發布車端AI Claw生态計劃

近日,在江蘇無錫舉行的高通汽車技術與合作峰會上,這家全球最大的智能座艙芯片供應商對外釋放了一個明确信号:從“智能座艙之王”向“物理AI基礎計算層”延伸。艙駕融合芯片已進入量産階段。2023年1月,高通

4周前

字節跳動發布豆包Seed 2.1系列模型,編程與Agent能力比肩國際頭部産品

字節跳動在火山引擎官網上線了豆包Seed2.1系列模型,包含Doubao-Seed-2.1-Pro和Doubao-Seed-2.1-Turbo兩個版本,API服務已全量上線火山方舟。該系列被官方定位為

Agent

4周前

英偉達發布DSX平台:從賣芯片轉向定義“AI工廠标準”

英偉達CEO黃仁勳在6月1日GTCTaipei2026主題演講中宣布推出NVIDIADSX平台,标志着公司戰略重心從單一芯片銷售升級為AI基礎設施的全棧方案提供者。DSX是英偉達繼RTX和DGX之後的

1個月前