卓世科技具身智能大腦Tri-Core:從“端到端”到“三核協同”的架構演進

2026-03-13 11:27:48 來源:中華網
        【每日科技網】

  在具身智能的落地進程中,行業長期受困于泛化能力與控制精度的權衡。傳統的控制論方法精度高但缺乏語義理解,而基于大模型的端到端方案雖然具備了一定的效果,卻往往受限于推理延遲,難以應對物理世界的瞬态變化。卓世科技構建了行業首個集成直覺(System 1)、邏輯(System 2)、共情(System 3)的“三核協同”具身大腦解決方案Tri-Core。本文将從架構設計、核心算法實現及數據訓練策略三個維度進行深度解析。

211.jpg

  一、架構總覽:三核閉環

  相比于目前主流的單一VLA(Vision-Language-Action)模型架構,我們采用了類腦的模塊化設計,受認知心理學中雙系統理論的啟發,并構建了以下三核協同的層次化的系統:

  ●System 1 (小腦): 基于VLA的反應式控制,負責實時生成高頻率動作。

  ●System 2 (大腦): 基于VLM的長程規劃,負責因果推演和複雜任務拆解。

  ●System 3 (共情系統): 負責情感計算與倫理安全,賦予系統“拟人化”的思考。

  這種架構的核心優勢在于異步計算,即System 1在邊緣側高頻運行以保證實時性,而System 2在雲端或高算力單元低頻運行以保證邏輯正确性以及深度推理。

  二、System 1:基于流匹配的VLA模型

  System 1的定位是“小腦”,負責動作的執行,其核心指标是響應速度與魯棒性。

  該VLA模型采用了Mixture-of-Transformers (MoT) 架構,将視覺語言模型(VLM)和動作專家(Action Expert)統一建模。

  動作專家:早期的VLA模型(如 RT-2)通常采用離散化的Token進行自回歸生成。然而,這種方式在處理連續的人型臂動作時,往往會出現動作不平滑的問題,且推理速度較慢。我們在 System 1 的動作專家中引入了 Flow Matching(流匹配) 生成範式。不同于擴散模型需要繁瑣的去噪步數,Flow Matching 通過學習從高斯噪聲到目标動作分布的向量場,能夠以更少的推理步數生成高質量的連續動作軌迹。

  視覺專家:System 1的小尺寸VLM由System 2的大尺寸VLM通過知識蒸餾獲得。

  訓練策略:為了使得VLA模型獲得足夠的泛化能力,我們進行了2階段的訓練

  (1)Stage 1: 跨具身預訓練。這一階段使用開源具身數據集,包含多種形态機器人的數據。雖然這些數據對應的動作空間不一緻,但能極大提升模型的泛化認知能力。

  (2)Stage 2: 單一具身後訓練。這一階段使用目标機型的任務導向數據,針對特定的垂直場景進行微調,進一步強化模型在目标機型上的穩定性和準确性。

  三、System 2:具備物理世界能力的邏輯規劃器

  System 2是基于璇玑玉衡大模型構建的“大腦皮層”,是一個大尺寸的視覺語言模型(VLM)。它的核心任務是将用戶的自然語言指令以及捕捉的視覺圖像轉化為System 1可執行的原子動作序列。

  為了使其具備物理世界能力,我們在通用多模态理解、具身規劃、空間感知等數據集上進行多階段微調。

  此外,為了提升“大腦”的思考能力,我們并未直接讓System 2輸出指令,而是強制其進行隐空間模拟。在執行不可逆操作(如“打碎雞蛋”)前,System 2會基于物理常識預測後果。

  例如,面對“清理桌面”的指令,System 2 會構建如下思維鍊:

  識别物體(水杯, 書) -> 判定物理約束(書在水杯下) -> 預測風險(直接抽書導緻水杯傾倒) -> 生成修正計劃(先移開水杯,再拿書)。

  這種具備物理一緻性的推理能力,是目前通用大模型所不具備的。

  四、System 3:情感中樞

  這是卓世科技架構中最為獨特的一環。在傳統的機器人學中,人機交互通常是基于規則的硬編碼。而我們将其提升到了模型層面。

  System 3是一個并行的輕量級多模态模型,負責多模态情感感知,它實時處理視覺(面部微表情、姿态)和音頻(語調、語速)信号。

  通過對這些非語義信息的分析,系統能夠計算用戶的情感狀态向量,如[焦慮, 放松, 憤怒, 快樂]。從而影響System 2的推理決策。

  此外,System 3還充當了倫理安全過濾器的作用,它擁有比System 2更高的中斷權限。一旦 System 2 的規劃路徑觸犯了預設的倫理邊界(如檢測到路徑上存在生物體且存在碰撞風險),System 3 會直接在底層熔斷控制信号,确保絕對安全。

  五、Benchmark

222.jpg

  在具身行業權威基準測試SimplerEnv和LIBERO中,卓世具身大腦Tri-Core均取得了SOTA水平,超過了π0、英偉達GROOT N1.5等前沿模型。

  基準測試介紹:SimplerEnv 是一個專為評估機器人真機策略而設計的閉環仿真環境,旨在解決“Sim-to-Real(仿真到真機)”和“Real-to-Sim(真機到仿真)”之間的鴻溝。LIBERO是專為終身學習和知識遷移而設計的基準測試集。

  六、結語

  卓世科技具身智能大腦的研發初衷,是試圖回答一個核心問題:如何讓AI不僅具備“智能”,更具備“本能”與“人性”。

  通過System 1的極緻快思考、System 2的深度慢思考以及System 3的價值對齊,我們正在重新定義智能體與物理世界的交互方式。這不僅僅是算法的創新,更是系統工程的突破。

  探索永無止境。未來,卓世科技将進一步加快具身大腦的疊代進程,堅定不移地加大對 VLA 模型與世界模型的研發投入。我們将持續深化模型對複雜物理規律的理解與泛化,引領具身智能邁向更加通用、智能與安全的新紀元。

免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
    本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

猜你喜歡

海能達發布全新專業防爆PDT對講機CH690Ex

随着我國應急管理體系持續完善,消防救援任務正在從傳統火災處置,向化工園區事故、危險品洩漏、地下空間救援、大型綜合災害等多風險、多場景方向發展。在這些複雜環境中,救援現場往往面臨爆炸性氣體、可燃性粉塵、

2周前

海能達CCW 2026載譽收官:AI與融合通信引領專用通信新未來

6月16日至18日,2026年全球關鍵通信展(CCW2026)在英國倫敦舉行。展會期間,海能達集中展示了從終端到系統、從感知到決策的全鍊路創新版圖,AI與融合通信産品及解決方案貫穿三天展期,持續獲得高

4周前

登陸歐洲 Intersolar!遠景AI電力系統支撐全球 AI 算力發展

慕尼黑,2026年6月23日——在IntersolarEurope2026上,遠景科技集團發布面向AI數據中心的下一代電力基礎設施——融合風光儲一體化方案、固态變壓器(SST)、800V直流供電、儲能

4周前

海能達六度問鼎ICCAs,PDC650與西安機場方案摘得雙獎

6月17日,2026年國際關鍵通信獎(InternationalCriticalCommunicationsAwards,ICCAs)在英國倫敦舉行的全球關鍵通信展(CCW2026)期間正式揭曉。海能

4周前

海能達即将亮相2026年CCW全球關鍵通信展: 攜AI與融合通信解決方案登陸倫敦

6月16日至18日,2026年CCW全球關鍵通信展将在英國倫敦啟幕。作為全球領先的專用通信解決方案提供商,海能達将以全場景關鍵通信産品矩陣亮相F25展位,集中展示面向公共安全、應急救援、城市治理等領域

1個月前

海能達再獲第十一屆廣東專利獎:持續自主創新,構築專用通信知識産權高地

近日,廣東省市場監督管理局正式公示第十一屆廣東專利獎評選結果。海能達通信股份有限公司申報的“一種集群通信系統的組派接方法、通信系統及存儲介質”(專利号:ZL201811296617.7)榮獲廣東專利優

1個月前