今天,商湯科技正式發布并全面開源日日新 SenseNova-Vision理解生成統一視覺大模型,這是商湯日日新大模型體系的重要視覺能力升級。
行業以往的 "統一視覺" 多是把檢測、分割、深度預測等多個專家模型打包封裝,本質還是割裂的。SenseNova-Vision 的核心變革是:讓視覺成為通用基礎模型的原生能力,徹底融入大模型體系。所有經典視覺任務如目标檢測、圖像分割、深度預測、3D重建等,由此都實現了原生統一。
這種 "原生融入" 帶來了雙向增益:
• 數據反哺:視覺領域幾十年的高質量數據直接提升大模型底座的視覺理解能力。 • 思維賦能:大語言模型的推理能力反過來讓視覺任務融會貫通,甚至能用語言直接定義新視覺任務。
在視覺 AI 領域,商湯已連續十年蟬聯中國視覺AI市場份額第一,并在2025年首次登頂視頻分析賽道全球市場份額第一,及亞太地區市場份額第一。SenseNova-Vision将這種行業領先的視覺能力,融入統一多模态大模型體系,代表了視覺 AI 能力的跨越式演進。依托原生統一的技術路線,模型實現了從“執行工具”向“世界理解模型”的本質蛻變,不僅真正看懂物理世界的邏輯,更為AI在物理世界的廣泛應用與深度交互構建全新的通用底座。

商湯日日新SenseNova-Vision能夠原生統一地實現結構化視覺理解、稠密幾何預測、圖像分割以及多視角視覺幾何等多項核心任務能力。
複雜場景實測:自由指令下的“視覺讀心術”
傳統的視覺模型往往隻能“各司其職”,而且遇到複雜、有幹擾的場景就會“抓瞎”。得益于原生通用底座帶來的智能湧現,SenseNova-Vision在面對人類視覺都容易犯錯的極端場景時,展現出了驚人的泛化能力:
1、零樣本泛化:未知遊戲“一秒讀懂”。
面對訓練集中從未出現過的遊戲畫面,模型展現出了強悍的跨域适應力。在語言推理與原生視覺能力的交織下,它無需任何針對性重訓,就能在一瞬間同時對畫面中的表面法向、實例分割以及角色關鍵點檢測進行無縫且精細化的處理。影視、遊戲和數字内容創作者可以直接将其投入工作流。




以遊戲《黑神話:悟空》的一張場景圖為例,模型能對法向、分割、關鍵點等進行較好的處理
2、超稠密物體分割:重疊魚群各顯其形
面對密密麻麻、高度重疊的魚群、羊群,或是貨架商品、俯拍車輛等極度稠密的場景,模型能夠像外科手術般精準地将每個獨立個體剝離出來。即使顔色極度相近、邊緣深度交織,也能準确區分。這為工業計數、智慧倉儲等場景提供了全新的解法。


以顔色重疊的魚群、貨架上東倒西歪的商品為例,模型能進行清晰、準确的分割
3、看穿鏡面反射:正确還原空間幾何
在包含鏡子、玻璃的複雜室内環境中,傳統視覺模型極易被鏡中的倒影誤導。而SenseNova-Vision能夠自動過濾反射影像的迷局,準确估計出鏡中物體的真實空間方向與深度關系。它不被虛拟的反射所欺騙,展現出對三維空間幾何本質的深刻理解。






以鏡面為例,模型能準确估計鏡子裡人的方向和深度
4、突破視覺錯覺:不看表象,洞察空間本質
在充斥着視覺錯覺幹擾的圖像中(例如經典的借位攝影),模型不僅能準确摳出被遮擋物體的完整輪廓,還能輸出完全正确的表面法向估計。它不被圖案和借位欺騙,正是語言模型的推理能力與稠密幾何預測完美融合、看懂物理世界的具象體現。



模型能正确判斷紋理形成的視覺欺騙



模型對于透視成像的近大遠小現象領悟的非常透徹,完全沒有被誤導



前景棉花人物和後景雲朵成功分離
核心任務領跑:多項指标比肩專用專家模型
當視覺任務融入通用多模态生成後,不僅沒有削弱專項能力,反而通過跨任務知識互補實現了性能飛躍。在多項權威評測中,SenseNova-Vision以“單模型”在四大核心視覺領域大範圍領跑,比肩甚至超越了各領域的專用“專家模型”:
• 結構化視覺理解:在目标檢測、指代檢測(Referring)、OCR、關鍵點定位等任務上全面領先同類型通用模型。在稠密小目标檢測、長尾類别識别等複雜場景下表現尤為突出。 • 稠密幾何預測:深度估計、表面法向(Surface Normal)估計精度達到幾何專用模型水準,在室内外多場景下均能保持極高的穩定性。 • 分割能力:涵蓋通用分割、推理分割、交互式分割等。得益于強大的多模态理解力,其在推理分割(Reasoning Segmentation)與對話式分割(GCG Segmentation)表現上驚豔。 • 多視角3D幾何:僅通過單模型即可高質量完成多視角點雲重建與相機位姿估計,性能在通用視覺路線中處于領先位置。

核心指标評測:SenseNova-Vision(深紫色柱狀)在各項視覺任務中均處于領跑地位
橫向相比優勢顯著:
• 對比語義導向模型(如Youtu-VL等):SenseNova-Vision在檢測、分割、深度等對細節要求極高的視覺任務上實現全面領先。 • 對比生成導向模型(如Vision Banana等):展現出全面的代際優勢。 一、核心指标超越: 在各項權威評測的硬核對決中,SenseNova-Vision 在絕大多數指标上均實現了對 Vision Banana 的超越與領跑。 二、任務能力倍增,且全面開源: 展現出更強的多任務泛化實力。如 Vision Banana 僅能應對四大核心闆塊中的“兩類”問題,而 SenseNova-Vision 卻能同時将結構化理解、稠密幾何、全景分割、多視角 3D 等全任務一網打盡。在此基礎上SenseNova-Vision還做到模型、數據全面開源。

重構底層邏輯:從拼接到原生統一
長期以來,視覺AI沿着“一個任務對應一個模型”的路徑演進,各個任務是彼此割裂的孤島。SenseNova-Vision徹底打破了這種結構性瓶頸,首次将全部視覺任務,統一表述為通用基礎模型可理解的多模态生成問題。它不需要為不同任務設計專屬預測頭,而是直接在同一個共享的表征空間内,對文本、像素、語義信息和幾何特征進行統一建模。

這種“大一統”的設計,帶來了颠覆性的變化:
• 跨任務知識互補,實現1+1>2。模型聯合訓練,激活了不同任務間的内在互補。深度估計的知識能強化語義分割的空間理解,分割能力又能輔助檢測任務的邊界判斷,從而獲得了單任務模型難以企及的抽象推理能力,從容應對未見過的任務與場景。 • 從“工具執行者”升級為“通用理解者”。統一範式重新定義了視覺智能的形态。模型不再是隻能執行特定指令的工具,而是作為大模型的原生能力,成長為對視覺世界擁有通用、深刻認知的基礎多模态底座。
商湯SenseNova-Vision的發布和開源,成功驗證了“統一多模态生成”這一全新技術路線的巨大潛能。它顯著降低了視覺AI的應用門檻,開發者無需再為不同任務維護多套模型體系,單個模型即可覆蓋高頻視覺需求,從而大幅縮短研發周期、降低部署成本,尤其适合複雜圖像、開放場景下的視覺應用開發。
同時,商湯也同步開源了包含5000萬條高質量樣本的視覺指令語料庫SenseNova-Vision Corpus-50M,為全球AI生态注入強勁動力。
未來,商湯将把SenseNova-Vision的核心技術全面融入日日新U系列大模型中,持續探索構建更加強大的統一多模态基座模型,邁向能夠更深刻感知、推理和交互物理世界的通用人工智能(AGI)與世界模型。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

