SentiPulse攜手人大高瓴:開源交互式3D數字人框架SentiAvatar,領跑行業主流模型

2026-04-08 17:35:39 來源:中華網
        【每日科技網】

  3D數字人行業已陷入發展怪圈:全行業的競争維度,始終困在“視覺上夠不夠像人”的顔值内卷裡。但行業集體忽略的是,再精緻的建模、再逼真的渲染,都無法成為用戶長期深度交互的核心理由。

  真正卡住數字人産業發展天花闆的,從來不是視覺層面的“不像人”,而是其始終未能構建起與人類相似自然的表達能力和更流暢的動作。很多時候,數字人看似嘴在動、手在揮,肢體動作卻與對話語義完全脫鈎,面部表情和台詞情緒徹底割裂,這種深入骨髓的機械感與違和感,直接斬斷了人與數字人之間建立情感聯結、實現深度交互的所有可能。

  人類真實溝通中,超70%的信息與情緒都藏在非語言信号裡,聳肩的無奈、挑眉的質疑,這些細節才是對話的靈魂。但這背後是行業面臨的三個瓶頸:一是中文對話場景高質量數據荒,覆蓋全身動作的高質量數據集近乎空白;二是複合語義下動作漂移,面對融合情緒的複雜表達,模型語義理解能力急劇退化;三是音畫節奏錯位,動作機械生硬,與語音重音、停頓完全脫節。

  這三道枷鎖,把數字人困在“預設腳本播放機器”的定位裡,始終邁不開從“能說話”、“能動”到“懂交流”的關鍵一步。而SentiPulse(思維光譜)聯合中國人民大學高瓴人工智能學院推出的SentiAvatar交互式3D數字人框架,正是為打破這些瓶頸而來。面向全球開源的3D動作生成完整解決方案,讓數字人跳出預設動作桎梏,實現貼合語境與情緒的自然實時交互,真正告别“提線木偶”式交互。

  國内首個交互式3D數字人框架,讓3D數字人動作有“靈魂”

  針對行業底層痛點,SentiAvatar打造了3D動作生成新範式。

5--.png

  在數據底座層,SuSuInterActs數據集圍繞單一角色SUSU(22歲,溫柔活潑,情感豐富)構建。包含2.1萬段片段、37小時的多模态對話語料,涵蓋同步語音、行為标注文本、全身動作與面部表情,填補中文高質量數據的空白。

  為打破場景限制,讓數字人交互擺脫“腳本化”,團隊在預訓練階段引入了自研的Motion Foundation Model動作基礎模型,在200K+條異質動作序列(約676小時)上訓練通用運動先驗,讓數字人的能力遠超對話場景本身。

  此外,SentiAvatar創新提出plan-then-infill雙通道并行架構,在動作生成時,将身體動作與面部表情分開處理,先規劃“做什麼動作”,再插入“如何逐幀執行”,讓整體動作生成效果更流暢。

  具體而言,第一階段,LLM語義規劃器接收行為标簽文本和稀疏音頻Token,輸出稀疏關鍵幀動作Token序列。為支持多輪流式連續生成,模型以前一句話的最後兩個關鍵幀音頻-動作Token對作為上下文前綴,從下一個關鍵幀位置續寫,實現無縫跨句過渡;第二階段,Body Infill Transformer在相鄰關鍵幀之間填入中間3幀,以逐幀 HuBERT連續特征(768維,20FPS)作為條件信号。模型采用5幀滑動窗口,首尾幀已知,預測中間3幀(12個動作Token)。推理時使用疊代置信度解碼策略(默認6步),逐步接受高置信度預測,避免一次性預測的質量退化。

  權威實驗結果顯示,SentiAvatar在SuSuInterActs和行業通用BEATv2兩個數據集上,多項核心指标均達到當前國際最優水平(SOTA),性能全面領跑行業主流模型。

6-.png

  在自建的SuSuInterActs測試集上,SentiAvatar的文本-動作檢索召回率R@1達到43.64%,幾乎是行業次優基線的2倍;在跨數據集、跨語言的BEATv2評測集上,SentiAvatar以FGD 4.941、BC 8.078的成績,同時刷新兩項指标的SOTA紀錄,超越此前行業最優方案,充分驗證了模型的跨場景、跨語言泛化能力。

  基于自研高質量數據集、動作基礎模型與核心架構,SentiAvatar實現了在0.3秒内生成6秒動作序列,支持無限輪次的流式交互。這意味着數字人可以在實時對話中持續生成連貫的動作與表情,無需等待整句結束再批量處理,能直接解決數字人“交互卡頓”的問題。

  構建認知-表達閉環,夯實數字人“交互底座”

  SentiAvatar已正式上線GitHub開源平台,面向全球科研機構與開發者全面開放,相關技術報告也已同步發布于arXiv。開發者可基于這套開源框架,低成本打造專屬的3D數字人,也可拓展其在遊戲交互、影視制作、機器人等領域的應用。

  當數字人不再是冰冷機械的交互工具,它能讀懂你面部表情的隐喻并反饋同樣稀缺的情緒價值,變成能感知語境、理解情緒、主動表達的交互主體,下一代“數字生命”即将誕生。

免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
    本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

猜你喜歡

海能達發布全新專業防爆PDT對講機CH690Ex

随着我國應急管理體系持續完善,消防救援任務正在從傳統火災處置,向化工園區事故、危險品洩漏、地下空間救援、大型綜合災害等多風險、多場景方向發展。在這些複雜環境中,救援現場往往面臨爆炸性氣體、可燃性粉塵、

2周前

海能達CCW 2026載譽收官:AI與融合通信引領專用通信新未來

6月16日至18日,2026年全球關鍵通信展(CCW2026)在英國倫敦舉行。展會期間,海能達集中展示了從終端到系統、從感知到決策的全鍊路創新版圖,AI與融合通信産品及解決方案貫穿三天展期,持續獲得高

4周前

登陸歐洲 Intersolar!遠景AI電力系統支撐全球 AI 算力發展

慕尼黑,2026年6月23日——在IntersolarEurope2026上,遠景科技集團發布面向AI數據中心的下一代電力基礎設施——融合風光儲一體化方案、固态變壓器(SST)、800V直流供電、儲能

4周前

海能達六度問鼎ICCAs,PDC650與西安機場方案摘得雙獎

6月17日,2026年國際關鍵通信獎(InternationalCriticalCommunicationsAwards,ICCAs)在英國倫敦舉行的全球關鍵通信展(CCW2026)期間正式揭曉。海能

4周前

海能達即将亮相2026年CCW全球關鍵通信展: 攜AI與融合通信解決方案登陸倫敦

6月16日至18日,2026年CCW全球關鍵通信展将在英國倫敦啟幕。作為全球領先的專用通信解決方案提供商,海能達将以全場景關鍵通信産品矩陣亮相F25展位,集中展示面向公共安全、應急救援、城市治理等領域

1個月前

海能達再獲第十一屆廣東專利獎:持續自主創新,構築專用通信知識産權高地

近日,廣東省市場監督管理局正式公示第十一屆廣東專利獎評選結果。海能達通信股份有限公司申報的“一種集群通信系統的組派接方法、通信系統及存儲介質”(專利号:ZL201811296617.7)榮獲廣東專利優

1個月前