超越 Vision Banana,商湯開源 SenseNova-Vision:視覺任務大統一,經典視覺并入大模型

2026-07-13 17:57:39 來源:中華網
        【每日科技網】

  今天,商湯科技正式發布并全面開源日日新 SenseNova-Vision理解生成統一視覺大模型,這是商湯日日新大模型體系的重要視覺能力升級。

  行業以往的 "統一視覺" 多是把檢測、分割、深度預測等多個專家模型打包封裝,本質還是割裂的。SenseNova-Vision 的核心變革是:讓視覺成為通用基礎模型的原生能力,徹底融入大模型體系。所有經典視覺任務如目标檢測、圖像分割、深度預測、3D重建等,由此都實現了原生統一。

  這種 "原生融入" 帶來了雙向增益:

  • 數據反哺:視覺領域幾十年的高質量數據直接提升大模型底座的視覺理解能力。 • 思維賦能:大語言模型的推理能力反過來讓視覺任務融會貫通,甚至能用語言直接定義新視覺任務。

  在視覺 AI 領域,商湯已連續十年蟬聯中國視覺AI市場份額第一,并在2025年首次登頂視頻分析賽道全球市場份額第一,及亞太地區市場份額第一。SenseNova-Vision将這種行業領先的視覺能力,融入統一多模态大模型體系,代表了視覺 AI 能力的跨越式演進。依托原生統一的技術路線,模型實現了從“執行工具”向“世界理解模型”的本質蛻變,不僅真正看懂物理世界的邏輯,更為AI在物理世界的廣泛應用與深度交互構建全新的通用底座。

  商湯日日新SenseNova-Vision能夠原生統一地實現結構化視覺理解、稠密幾何預測、圖像分割以及多視角視覺幾何等多項核心任務能力。

  複雜場景實測:自由指令下的“視覺讀心術”

  傳統的視覺模型往往隻能“各司其職”,而且遇到複雜、有幹擾的場景就會“抓瞎”。得益于原生通用底座帶來的智能湧現,SenseNova-Vision在面對人類視覺都容易犯錯的極端場景時,展現出了驚人的泛化能力:

  1、零樣本泛化:未知遊戲“一秒讀懂”。

  面對訓練集中從未出現過的遊戲畫面,模型展現出了強悍的跨域适應力。在語言推理與原生視覺能力的交織下,它無需任何針對性重訓,就能在一瞬間同時對畫面中的表面法向、實例分割以及角色關鍵點檢測進行無縫且精細化的處理。影視、遊戲和數字内容創作者可以直接将其投入工作流。

  以遊戲《黑神話:悟空》的一張場景圖為例,模型能對法向、分割、關鍵點等進行較好的處理

  2、超稠密物體分割:重疊魚群各顯其形

  面對密密麻麻、高度重疊的魚群、羊群,或是貨架商品、俯拍車輛等極度稠密的場景,模型能夠像外科手術般精準地将每個獨立個體剝離出來。即使顔色極度相近、邊緣深度交織,也能準确區分。這為工業計數、智慧倉儲等場景提供了全新的解法。

  以顔色重疊的魚群、貨架上東倒西歪的商品為例,模型能進行清晰、準确的分割

  3、看穿鏡面反射:正确還原空間幾何

  在包含鏡子、玻璃的複雜室内環境中,傳統視覺模型極易被鏡中的倒影誤導。而SenseNova-Vision能夠自動過濾反射影像的迷局,準确估計出鏡中物體的真實空間方向與深度關系。它不被虛拟的反射所欺騙,展現出對三維空間幾何本質的深刻理解。

  以鏡面為例,模型能準确估計鏡子裡人的方向和深度

  4、突破視覺錯覺:不看表象,洞察空間本質

  在充斥着視覺錯覺幹擾的圖像中(例如經典的借位攝影),模型不僅能準确摳出被遮擋物體的完整輪廓,還能輸出完全正确的表面法向估計。它不被圖案和借位欺騙,正是語言模型的推理能力與稠密幾何預測完美融合、看懂物理世界的具象體現。

  模型能正确判斷紋理形成的視覺欺騙

  模型對于透視成像的近大遠小現象領悟的非常透徹,完全沒有被誤導

  前景棉花人物和後景雲朵成功分離

  核心任務領跑:多項指标比肩專用專家模型

  當視覺任務融入通用多模态生成後,不僅沒有削弱專項能力,反而通過跨任務知識互補實現了性能飛躍。在多項權威評測中,SenseNova-Vision以“單模型”在四大核心視覺領域大範圍領跑,比肩甚至超越了各領域的專用“專家模型”:

  • 結構化視覺理解:在目标檢測、指代檢測(Referring)、OCR、關鍵點定位等任務上全面領先同類型通用模型。在稠密小目标檢測、長尾類别識别等複雜場景下表現尤為突出。 • 稠密幾何預測:深度估計、表面法向(Surface Normal)估計精度達到幾何專用模型水準,在室内外多場景下均能保持極高的穩定性。 • 分割能力:涵蓋通用分割、推理分割、交互式分割等。得益于強大的多模态理解力,其在推理分割(Reasoning Segmentation)與對話式分割(GCG Segmentation)表現上驚豔。 • 多視角3D幾何:僅通過單模型即可高質量完成多視角點雲重建與相機位姿估計,性能在通用視覺路線中處于領先位置。

  核心指标評測:SenseNova-Vision(深紫色柱狀)在各項視覺任務中均處于領跑地位

  橫向相比優勢顯著:

  • 對比語義導向模型(如Youtu-VL等):SenseNova-Vision在檢測、分割、深度等對細節要求極高的視覺任務上實現全面領先。 • 對比生成導向模型(如Vision Banana等):展現出全面的代際優勢。 一、核心指标超越: 在各項權威評測的硬核對決中,SenseNova-Vision 在絕大多數指标上均實現了對 Vision Banana 的超越與領跑。 二、任務能力倍增,且全面開源: 展現出更強的多任務泛化實力。如 Vision Banana 僅能應對四大核心闆塊中的“兩類”問題,而 SenseNova-Vision 卻能同時将結構化理解、稠密幾何、全景分割、多視角 3D 等全任務一網打盡。在此基礎上SenseNova-Vision還做到模型、數據全面開源。

  重構底層邏輯:從拼接到原生統一

  長期以來,視覺AI沿着“一個任務對應一個模型”的路徑演進,各個任務是彼此割裂的孤島。SenseNova-Vision徹底打破了這種結構性瓶頸,首次将全部視覺任務,統一表述為通用基礎模型可理解的多模态生成問題。它不需要為不同任務設計專屬預測頭,而是直接在同一個共享的表征空間内,對文本、像素、語義信息和幾何特征進行統一建模。

  這種“大一統”的設計,帶來了颠覆性的變化:

  • 跨任務知識互補,實現1+1>2。模型聯合訓練,激活了不同任務間的内在互補。深度估計的知識能強化語義分割的空間理解,分割能力又能輔助檢測任務的邊界判斷,從而獲得了單任務模型難以企及的抽象推理能力,從容應對未見過的任務與場景。 • 從“工具執行者”升級為“通用理解者”。統一範式重新定義了視覺智能的形态。模型不再是隻能執行特定指令的工具,而是作為大模型的原生能力,成長為對視覺世界擁有通用、深刻認知的基礎多模态底座。

  商湯SenseNova-Vision的發布和開源,成功驗證了“統一多模态生成”這一全新技術路線的巨大潛能。它顯著降低了視覺AI的應用門檻,開發者無需再為不同任務維護多套模型體系,單個模型即可覆蓋高頻視覺需求,從而大幅縮短研發周期、降低部署成本,尤其适合複雜圖像、開放場景下的視覺應用開發。

  同時,商湯也同步開源了包含5000萬條高質量樣本的視覺指令語料庫SenseNova-Vision Corpus-50M,為全球AI生态注入強勁動力。

  未來,商湯将把SenseNova-Vision的核心技術全面融入日日新U系列大模型中,持續探索構建更加強大的統一多模态基座模型,邁向能夠更深刻感知、推理和交互物理世界的通用人工智能(AGI)與世界模型。

免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
    本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

猜你喜歡

海能達發布全新專業防爆PDT對講機CH690Ex

随着我國應急管理體系持續完善,消防救援任務正在從傳統火災處置,向化工園區事故、危險品洩漏、地下空間救援、大型綜合災害等多風險、多場景方向發展。在這些複雜環境中,救援現場往往面臨爆炸性氣體、可燃性粉塵、

2周前

海能達CCW 2026載譽收官:AI與融合通信引領專用通信新未來

6月16日至18日,2026年全球關鍵通信展(CCW2026)在英國倫敦舉行。展會期間,海能達集中展示了從終端到系統、從感知到決策的全鍊路創新版圖,AI與融合通信産品及解決方案貫穿三天展期,持續獲得高

4周前

登陸歐洲 Intersolar!遠景AI電力系統支撐全球 AI 算力發展

慕尼黑,2026年6月23日——在IntersolarEurope2026上,遠景科技集團發布面向AI數據中心的下一代電力基礎設施——融合風光儲一體化方案、固态變壓器(SST)、800V直流供電、儲能

4周前

海能達六度問鼎ICCAs,PDC650與西安機場方案摘得雙獎

6月17日,2026年國際關鍵通信獎(InternationalCriticalCommunicationsAwards,ICCAs)在英國倫敦舉行的全球關鍵通信展(CCW2026)期間正式揭曉。海能

4周前

海能達即将亮相2026年CCW全球關鍵通信展: 攜AI與融合通信解決方案登陸倫敦

6月16日至18日,2026年CCW全球關鍵通信展将在英國倫敦啟幕。作為全球領先的專用通信解決方案提供商,海能達将以全場景關鍵通信産品矩陣亮相F25展位,集中展示面向公共安全、應急救援、城市治理等領域

1個月前

海能達再獲第十一屆廣東專利獎:持續自主創新,構築專用通信知識産權高地

近日,廣東省市場監督管理局正式公示第十一屆廣東專利獎評選結果。海能達通信股份有限公司申報的“一種集群通信系統的組派接方法、通信系統及存儲介質”(專利号:ZL201811296617.7)榮獲廣東專利優

1個月前