從電路模拟的複雜推演到量子化學的微觀分析,大規模稀疏線性方程組的高效求解是科學計算領域的核心需求。但傳統稀疏直接求解器因數據非零元分布稀疏且不規則,導緻運算低效、算力浪費等問題。近日,中國科學技術大學計算機科學與技術學院特任副研究員陳俊仕團隊,在鲲鵬昇騰科教創新卓越中心的算力支持下,創新研發出面向鲲鵬處理器矩陣算力基于密集kernel的LU直接求解器,以密集運算方式實現了稀疏計算的高效求解,成功突破傳統運算瓶頸。

該研究創新構建了一種面向稀疏矩陣計算的密集計算範式,系統化解構了傳統稀疏直接求解器的性能瓶頸。團隊通過将分散的非零元整合為更加規整的密集數據塊,将不規則稀疏矩陣映射為統一稠密的大塊結構,進而采用基于稠密矩陣運算的數值分解算法,取代傳統稀疏運算中聚合非零小分塊的碎片化計算模式,顯著降低了由不規則内存訪問引發的計算與調度開銷,最終實現了計算效率與硬件利用率的協同優化。
該方案的順利落地,深度依賴于鲲鵬平台的計算特性。硬件層面,鲲鵬920新型号集成專用矩陣運算單元,原生具備高密度數值分解運算的高效承載能力,可精準匹配密集數據塊的集中化處理需求;其多核架構為大規模密集數據塊的并行運算提供了堅實基礎,避免算力閑置或過載。軟件層面,鲲鵬 KML 數學庫針對密集型矩陣運算進行深度優化,通過底層算法與硬件架構的協同,進一步放大了密集運算模式的性能潛力。經 70 餘個跨領域測試集驗證,該方案性能較SuperLU 求解器平均加速32.2倍,在基礎硬件配置下實現了平均 9.6 倍性能加速,大幅壓縮了科學計算的時間成本。
目前,相關研究成果已發表于 CCF B 類國際會議 Euro-Par 2025,其核心技術已申請中國發明專利并獲得授權。此次成果是鲲鵬平台在科學計算領域的典型實踐,該方法對于現代高性能處理器上稀疏計算問題的高效求解、充分地發揮處理器上的矩陣運算單元具有很好的應用價值。未來,随着鲲鵬生态的持續完善,其在高性能計算領域的賦能作用将進一步凸顯,助力更多科研團隊突破技術難關,推動科研成果加速落地轉化。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

