據“華為數據存儲”公衆号消息,在2026 MWC上海展期間,華為與中國移動通信集團湖北有限公司(以下簡稱“湖北移動”)聯合宣布,雙方已成功完成全國運營商首個AI推理加速解決方案現網測試。
此次測試基于華為OceanStor A800存儲與昇騰A3超節點架構,并搭載UCM(Unified Cache Manager,推理記憶數據管理)能力,在長序列AI推理場景下,實現Token吞吐率最高提升372%的突破性成果,為運營商智算業務的高效部署提供了重要技術支撐。
據介紹,本次測試在湖北移動現網環境中部署vLLM-Ascend框架,面向MiniMax M2.5、GLM-5.1等主流大模型,模拟了8K至190K長序列輸入場景。
測試結果顯示,在MiniMax M2.5模型場景下,啟用UCM後,首Token延遲(TTFT)優化26%至62%,單NPU卡Token輸出效率(TPS)也獲得明顯提升。
其中,在64K序列長度下,TPS提升58%;在128K序列長度下,TPS提升78%。
在GLM-5.1模型場景下,UCM帶來的加速效果更加明顯,TTFT優化幅度達到51%至93%,TPS提升56%至372%。
具體來看,在64K序列長度下,TPS提升313%;在128K序列環境下,TPS最高提升372%。
華為表示,測試結果表明,随着上下文長度不斷增加,AI推理加速方案的優勢将持續放大,有效解決了長序列推理中的KV Cache容量瓶頸。
對于運營商而言,這意味着在大模型推理、智能客服、内容生成、行業智能體等長序列AI業務場景中,現網智算資源有望獲得更高利用效率,同時降低長上下文推理帶來的性能壓力。

免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

