英偉達在FMS 2026峰會上宣布,将旗下的GPU存儲加速API cuFile全面開源,同時公布SCADA全新存儲架構,徹底打破傳統CPU主導IO的傳輸瓶頸,實測場景下GPU存儲IOPS最高實現5倍提升。
長期以來,GPU讀取數據必須通過CPU進行調度,這種宿主模式在處理AI推理産生的大量512字節微小請求時,會造成嚴重的微秒級延遲。
雖然之前的GPUDirect Storage(GDS)實現了數據鍊路的CPU繞過,但指令控制仍需CPU參與,使得系統在小粒度讀寫任務中提前觸發性能瓶頸、IO資源率先耗盡。

此次推出的SCADA技術徹底解決了這一難題,SCADA允許GPU直接發起存儲I/O請求,管理NVMe硬盤的隊列深度,實測數據顯示,在處理數據分析任務時,SCADA的速度是CPU觸發模式的5.3倍,而硬件成本最高可降低21.7倍。
在美光展示的參考設計中,使用3顆H100顯卡成功驅動了44塊PCIe Gen6 SSD,實現了驚人的2.3億次随機讀IOPS。這意味着單台服務器的存儲吞吐達到了118GB/s,且負責調度的單顆CPU在整個過程中幾乎處于空閑狀态。

同時針對AI推理中KV緩存頻繁産生的小數據讀寫,英偉達正式推出Storage-Next産業聯盟計劃,重點優化512字節扇區的讀寫表現,以解決傳統硬盤在4KB扇區下造成的8倍讀取放大問題。
該構想最早在2025年GTC大會提出,目前聯盟成員已超40家閃存與存儲廠商,包含DDN、铠俠、美光,還有存儲控制器企業、散熱廠商以及标準化組織,各方将共同制定一套新标準:當GPU取代CPU成為存儲訪問主體時,固态硬盤應當如何适配運行。
硬件層面上,為承載cuFile開源生态與SCADA全新存儲架構的落地,英偉達打造了新一代基于Vera BlueField-4存儲處理器的STX架構系統,并計劃在2026年下半年正式推出商用整機。

雖然目前英特爾也已加入開源組織并參與代碼維護,标志着傳統CPU主導IO調度的格局被颠覆,cuFile與SCADA也從英偉達私有技術,升級為全行業通用開源标準,有效改善了跨平台兼容性。
但該技術的規模化普及仍受兩大核心條件制約,一是STX+SCADA新架構的跨硬件、跨平台适配優化進度。二是美光、三星等廠商能否針對512字節小包場景完成主控與固件的底層重寫。
這兩點最終決定了這套新一代AI存儲架構的商用普及節奏。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.



