高通在其官網介紹了全新一代NPU,即Hexagon NPU,這款NPU專為下一代AI智能體打造。
據悉,高通第六代骁龍8至尊版系列引入了全新的Hexagon NPU和兩項關鍵特性,包括全新Element Accelerator和更大的共享内存系統。
Element Accelerator專為賦能當今生成式AI和智能體AI的Transformer工作負載而打造。結合向量計算單元和标量計算單元,它能夠加速大模型中最關鍵的運算,幫助智能體更快地響應、更高效地推理,并在保證移動端能效的前提下,提供更豐富的體驗。
同樣重要的是,Hexagon NPU大幅擴展了大容量共享内存。通過讓多模型狀态、上下文信息和KV-cache數據存儲在更靠近加速器的位置,該平台能夠緩解内存瓶頸,讓智能體在處理更長上下文、調用更多工具以及執行更多并發任務時,始終保持流暢響應。
上述技術創新共同定義了新一代Hexagon NPU的角色,即直接在終端側運行更多智能體AI體驗。
Element Accelerator、向量與标量擴展單元和更大的共享内存,組成一套協同架構,助力NPU加速Transformer工作負載、處理控制邏輯複雜的智能體任務.
并将更多上下文數據保留在靠近計算單元的位置。值得注意的是,Hexagon NPU同樣面向下一代模型架構而打造。
高通表示,公司正與領先的内存和模型廠商合作,引入混合專家模型(Mixture-of-Experts,MoE)構建新一代終端側AI架構。這意味着一個300億參數的MoE模型在保持數百億參數可用的同時,在NPU上每次生成一個詞元僅需激活約30億個被路由選中的參數。
與每次推理都需要更大部分網絡參與的密集模型不同,MoE會根據輸入動态選擇專用專家網絡,從而減少實際計算負載和内存帶寬需求。
結合智能的專家模塊閃存到内存加載管理機制與緩存技術,這種方法能夠以低功耗和低内存需求的方式實現更大模型級别的AI體驗,為智能手機帶來響應迅速且注重隐私保護的生成式AI。
混合專家模型通過選擇性激活專用專家網絡,能夠提升效率和質量,無需每次請求都調用整個模型。

免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

