第四範式推出業界首個基于持久内存、支持毫秒級恢複的萬億維線上預估系統

2020-06-30 15:25:39 來源:中國網科學
        【每日科技網】

  線上預估服務是AI在企業應用落地的關鍵環節,企業通常會采用分布式計算架構在内存中完成實時數據處理和高達萬億維的模型特征存儲,并通過多集群副本解決傳統純内存(DRAM)天生的易“失”性隐患,以達到線上實時服務質量(Quality of Service)效果。然而,随着企業AI應用模型大小和數量的增長,線上預估服務所需要的硬件資源也呈幾何倍數增加。

  為進一步滿足企業線上預估需求,第四範式定制開發了基于持久内存技術、支持實時恢複的萬億維線上預估系統,為企業提供高可用性、毫秒級恢複的在線預估服務,同時将企業總擁有成本降低80%。該系統基于第四範式AI算力平台SageOne的持久内存進行了軟硬一體設計,與其他預估系統相比,可實現每秒億級KV查詢的高性能,并能夠與第四範式自研的高維機器學習框架以及TensorFlow等AI開源框架無縫對接。保證了在線預估服務無論在發生物理故障或者程序崩潰的情況下,均具備毫秒級故障實時恢複特性,是企業低成本實現高可用AI線上預估服務的選擇。

  第四範式自研的基于持久内存的萬億維級參數服務器 – HyperPS是該線上預估系統的關鍵基礎組件。HyperPS參數服務器具備高性能底層序列化框架、鍊路共享、多級訪存優化、雙端參數合并及動态擴縮容等特性。基于持久内存設計和優化後,HyperPS在保持與基于純内存參數服務器幾乎一緻性能的同時,展現出在線上預估應用中數據實時恢複和應用成本低的巨大優勢。

  持久内存加持 參數服務器性能升級

  參數服務器通常将所有數據放在純内存中處理,AI模型越大,分布式參數服務器的内存需求越大。此外,純内存雖然性能,但因其易失性(volatile)特性,一旦硬件或者軟件發生故障,内存丢失的全部數據必須從持久性存儲設備(HDD/SSD)中讀取日志恢複,恢複速度慢,嚴重影響線上性能服務質量。

  持久内存的大容量、高性能、非易失性屬性,為其帶來了高安全性、低成本等優勢,改善了目前純内存容量小、成本高、災備恢複慢等問題。針對持久内存這些應用優點,第四範式針對HyperPS參數服務器的底層系統架構和存取性能等進行了軟硬一體設計。首先,針對節點内的shard重新設計了新的存儲引擎,采用持久化哈希表為底層數據結構儲存特征,保證高并行度性能的同時,對持久内存數據組織格式進行優化,達到接近于純内存哈希表的性能;其次,對參數服務器災難恢複機制調優,使用持久化智能指針記錄哈希表的核心數據結構和根指針,實現業界首創的參數服務器實時恢複能力;再次,利用PMDK的transaction機制,使用pmempool分配和管理持久内存空間,确保持久内存數據一緻性;最後,針對影響性能的持久化操作進行策略性的降低,進一步提高性能。

  在實際測試環境中,基于持久内存的HyperPS表現出更低的擁有成本和巨大的實時恢複優勢,以及與純内存近乎一緻的性能表現。

  01. 企業AI應用内存預估:

  AI為企業帶來出衆的業務效果,同時企業也要承擔AI産生的成本壓力,特别是當AI規模化應用時。以某手機終端廠商為例,分别采用配備384GB 純内存服務器和配備2TB持久内存的服務器為預估單節點基準。每上線一個模型在在純内存的參數服務器上占用内存空間大概是128GB。基于持久内存的數據結構由于其有額外的持久化邏輯,在空間複雜度上會略高于純内存數據結構,其空間占用大概是204GB。在此基礎上,估算企業上線1-100個模型參數服務器所需的純内存物理節點數和配備持久内存的物理節點數量。

  從預估結果來看,企業需要采用持久内存的物理節點數量和純内存的物理節點數量比為1:3.4-4,而持久内存的參數服務器總成本最多下降80%。

  02. 數據恢複速度測試:

  當系統節點出現故障時,采用純内存的參數服務器需要從數據存儲集群(如HDFS)重新申請模型參數數據恢複,耗時長,嚴重影響線上服務質量。采用持久内存的HyperPS則完全不同,節點發生故障或者程序崩潰後,數據依然保存在持久内存中,服務重啟後隻需要調用優化過的數據一緻性檢查函數,即可實現毫秒級實時恢複。

  以恢複6千萬維參數模型為例,純内存參數服務器恢複模型需要花費58秒,而持久性内存參數服務器隻需要0.03秒,故障恢複時長縮短将近2000倍。

  恢複20個模型總計12億維參數測試中,純内存參數服務器數據恢複時間随着數據總量增加而大幅增長,而持久内存的參數服務器幾乎沒有受到影響,隻需檢查哈希表元數據後即可提供服務,其恢複時長縮短17114倍。

  03. 預估性能測試:

  HyperPS不僅大幅降低了總擁有成本并提升數據恢複速度,也展現出和純内存模式下同水準的性能表現。在非高壓(1個請求線程)和高壓(56個并發請求線程)的情況下的請求延遲(TP99)。結果表明,基于持久内存的HyperPS參數服務器在延遲上,與采用純内存的參數服務器性能相近。單線程和56線程兩個測試中,持久内存的參數服務器均僅比采用純内存的參數服務器延遲多1毫秒。

  在吞吐性能對比測試項目中,基于持久内存的參數服務器在56線程的高壓負載測試中的QPS僅比純内存參數服務器低3.5%。

  此次,通過 “軟件定義算力”的全新方式,第四範式将自研HyperPS萬億維參數服務器與英特爾傲騰持久内存進行軟硬一體優化設計,保證線上推理服務超高性能的同時,大幅降低企業AI整體投入成本,提升線上服務質量,進一步掃清了企業AI規模化應用的前進障礙。

免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
    本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

猜你喜歡

海能達發布全新專業防爆PDT對講機CH690Ex

随着我國應急管理體系持續完善,消防救援任務正在從傳統火災處置,向化工園區事故、危險品洩漏、地下空間救援、大型綜合災害等多風險、多場景方向發展。在這些複雜環境中,救援現場往往面臨爆炸性氣體、可燃性粉塵、

2周前

海能達CCW 2026載譽收官:AI與融合通信引領專用通信新未來

6月16日至18日,2026年全球關鍵通信展(CCW2026)在英國倫敦舉行。展會期間,海能達集中展示了從終端到系統、從感知到決策的全鍊路創新版圖,AI與融合通信産品及解決方案貫穿三天展期,持續獲得高

4周前

登陸歐洲 Intersolar!遠景AI電力系統支撐全球 AI 算力發展

慕尼黑,2026年6月23日——在IntersolarEurope2026上,遠景科技集團發布面向AI數據中心的下一代電力基礎設施——融合風光儲一體化方案、固态變壓器(SST)、800V直流供電、儲能

4周前

海能達六度問鼎ICCAs,PDC650與西安機場方案摘得雙獎

6月17日,2026年國際關鍵通信獎(InternationalCriticalCommunicationsAwards,ICCAs)在英國倫敦舉行的全球關鍵通信展(CCW2026)期間正式揭曉。海能

4周前

海能達即将亮相2026年CCW全球關鍵通信展: 攜AI與融合通信解決方案登陸倫敦

6月16日至18日,2026年CCW全球關鍵通信展将在英國倫敦啟幕。作為全球領先的專用通信解決方案提供商,海能達将以全場景關鍵通信産品矩陣亮相F25展位,集中展示面向公共安全、應急救援、城市治理等領域

1個月前

海能達再獲第十一屆廣東專利獎:持續自主創新,構築專用通信知識産權高地

近日,廣東省市場監督管理局正式公示第十一屆廣東專利獎評選結果。海能達通信股份有限公司申報的“一種集群通信系統的組派接方法、通信系統及存儲介質”(專利号:ZL201811296617.7)榮獲廣東專利優

1個月前