
2025年11月10日,斯坦福大學教授、AI領域泰鬥李飛飛發表長篇博客《From Words to Worlds: Spatial Intelligence is AI’s Next Frontier》(從語言到世界:空間智能是AI的下一個前沿),為全球AI發展指明新方向。這位ImageNet數據集的締造者、現代計算機視覺的奠基人,在深耕AI領域25年後明确提出:以大語言模型(LLM)為代表的現有AI技術已觸及瓶頸,而“空間智能”将成為突破這一局限、重塑未來十年AI發展的核心引擎。
破題:現有AI的“緻命短闆”——脫離現實的“黑暗文匠”
李飛飛在文中對當前AI發展現狀作出精準判讀:生成式AI雖已滲透至數十億人的生活,能生成連貫文本、逼真圖像乃至短視頻,但其本質仍是“黑暗中的文匠”——精通語言表達卻缺乏對物理世界的真實感知,掌握海量知識卻無法與現實場景深度互動。這一短闆直接導緻三大核心目标難以實現:自主機器人未能走進日常生活、AI加速科研的願景尚未落地、賦能人類創造者的智能工具仍顯稚嫩。
這種局限的根源,在于現有AI缺乏人類認知的核心腳手架——空間智能。李飛飛以日常場景舉例:停車時判斷車尾與路緣的距離、半睡半醒間精準倒咖啡、消防員在坍塌建築中判斷險境,這些看似本能的行為,背後是人類通過感知與行動構建的空間認知體系。而當前最先進的多模态模型,在距離估算、物理規律預測等基礎任務上表現僅略高于随機水平,生成的視頻數秒後便會失去邏輯連貫性,根本無法支撐複雜的現實交互。
核心定義:空間智能——連接感知、想象與行動的認知根基
在李飛飛的研究框架中,空間智能并非簡單的“視覺識别+空間定位”,而是支撐人類與世界互動的底層認知能力,其核心價值體現在三個維度:
生存與交互的基礎能力
從生物進化視角看,空間智能是智能演化的起點。早在語言出現前,原始生物通過感知光線、觸感構建的空間認知,便搭建起生存與環境互動的橋梁。人類嬰兒在學會說話前,正是通過觸摸、爬行、玩耍等空間互動認識世界,這種“感知-行動”循環構成了智能發展的核心鍊路。
想象力與創造力的源泉
空間智能是人類創造活動的底層支撐。從史前洞穴壁畫到現代電影、電子遊戲,所有叙事性創作都依賴于腦海中構建的虛拟空間;工程師通過三維建模發明珍妮紡紗機,沃森和克裡克借助物理模型發現DNA雙螺旋結構,這些突破都源于對空間關系的精準把控與想象。
文明進步的關鍵驅動力
曆史上重大科學突破往往離不開空間智能的賦能。古希臘學者埃拉托色尼通過測量不同地區的日影角度,僅用幾何推理便計算出地球周長;工業革命時期的機械發明、當代的數字孿生技術,本質都是空間智能在不同時代的技術具象化。
破局路徑:構建具備三大核心能力的“世界模型”
李飛飛指出,實現空間智能的關鍵,是構建超越現有LLM的“世界模型”——一種能理解、推理、生成并交互虛拟與現實世界的新型生成式模型。這種模型必須具備三大核心能力,才能真正模拟人類的空間認知邏輯。
生成性:創造邏輯自洽的世界
世界模型需能生成在感知、幾何、物理層面保持一緻的虛拟世界,無論是還原現實場景還是創造奇幻空間,都必須遵循内在的物理規律與動态邏輯。例如生成一段“杯子掉落”的視頻,不僅要呈現視覺上的逼真效果,還需符合重力作用下的運動軌迹、碰撞後的破碎形态等物理規則。更重要的是,模型對當前世界狀态的理解,必須與曆史狀态保持連貫,避免出現邏輯斷層。
多模态性:融合全維度感知輸入
與人類通過視覺、聽覺、觸覺等多渠道感知世界一緻,世界模型需具備處理圖像、視頻、文本、手勢、動作等多模态輸入的能力。當輸入信息不完整時(如僅提供文本描述“紅色圓形物體”),模型應能補全缺失信息,生成符合語義與物理規則的完整世界狀态。這種多模态交互能力,讓AI能通過人類熟悉的方式理解指令,打破單一輸入形式的局限。
交互性:實現“動作-狀态”的動态反饋
世界模型的核心突破在于動态交互——當輸入包含動作指令(如“推動桌子”)時,模型需能精準生成世界的下一狀态(桌子移動的距離、姿态變化及可能的連鎖反應)。進階階段,模型還需具備“目标導向”的推理能力,例如輸入“将杯子放到書架上”,模型不僅要預測動作後的世界狀态,還需規劃出實現目标的具體步驟(伸手、抓取、移動、放置等)。
攻堅方向:三大技術壁壘與前沿探索
構建世界模型的難度遠超現有AI技術,李飛飛結合其創立的World Labs研究實踐,提出了當前亟需突破的三大技術方向:
通用訓練任務函數研發
現有LLM以“下一token預測”為核心任務函數,簡潔且高效,但世界模型需處理幾何、物理等多維信息,亟需一種能反映空間規律的通用任務函數。例如通過“場景連貫性預測”任務,讓模型學習不同物體間的空間關系與物理約束,為多模态信息融合提供統一目标。
複雜訓練數據體系構建
世界模型需要的不僅是互聯網上海量的圖像視頻數據,更關鍵的是從中提取深層空間信息的算法。例如從二維視頻幀中還原三維空間結構、解析物體運動的物理參數。此外,高質量合成數據、深度信息、觸覺數據等特殊模态數據,将在模型訓練的關鍵階段發揮重要作用。
新型模型架構創新
現有MLLM和視頻擴散模型将數據離散為一維或二維序列,難以處理三維空間關系。李飛飛團隊研發的實時生成幀模型(RTFM)已展現新方向——以空間錨定的幀作為記憶單元,在保證生成連貫性的同時實現實時交互。未來還需探索具備三維感知能力的分詞機制、動态記憶模塊,讓模型能高效處理空間信息。
結語:空間智能開啟AI的“現實聯結”時代
李飛飛在文末重申,空間智能的價值遠超技術突破本身——它将讓AI從“語言世界”走進“物理現實”,實現從“輔助創作”到“深度交互”的跨越。當機器人能精準理解家居空間完成家務、AI能模拟分子結構加速新藥研發、創作者能在虛拟空間中直觀構建創意,AI才能真正成為賦能人類的夥伴。
正如ImageNet推動計算機視覺爆發一樣,李飛飛相信,空間智能的突破将開啟AI的下一個黃金十年。而這一切的起點,正是對“世界模型”的持續探索——讓機器像人類一樣,通過感知、想象與行動,真正理解我們所處的世界。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

