北大團隊提出2比特複數模型iFairy{±1, ±i},精度反超量化前,可手機部署

2025-08-15 16:39:48 來源:全景網
        【每日科技網】

摘要:為破解大模型部署與推理成本高昂的困境,北京大學楊仝老師團隊首次提出名為iFairy的超低比特量化方案。該方案創新性地利用複數{±1, ±i}對模型權重進行2-bit量化,在實現1/8極緻壓縮與“無乘法”推理加速的同時,語言建模能力和下遊任務表現甚至反超了其全精度的LLaMA基座模型。

  當下,大語言模型(LLM)的研究熱潮席卷全球,技術疊代日新月異。然而,在這片繁榮之下,一個嚴峻的現實不容忽視:LLM在真實世界中産生的商業價值,很大程度上仍無法覆蓋其高昂的訓練與推理成本。

  究其根源,大模型走向産業落地的道路上,橫亘着兩大“攔路虎”:空間瓶頸和時間瓶頸。

  為了追求更高的模型性能,業界普遍的策略是不斷堆疊參數量,這使得模型部署成本高昂。

  同時,龐大的參數量帶來了計算量的激增,盡管學界和業界已湧現出如gpt-oss的MXFP4訓練等優秀的量化方案,但其核心計算邏輯依然沒有消除對硬件資源消耗巨大的“乘法”運算的依賴,推理延遲沒有實現根本性的降低。

  能否同時攻克這兩大瓶頸,實現模型的輕量化和推理加速,已成為推動大模型發展從“技術奇觀”邁向“生産力工具”新階段的關鍵。

  為解決這一難題,北京大學楊仝老師團隊在一篇名為“iFairy: the First 2-bit Complex LLM with All Parameters in {±1,±i}”的論文中,提出了一個腦洞大開的方案:跳出實數軸的束縛,進入複數平面!

  這看似簡單的維度提升,卻蘊含着破解瓶頸的深刻智慧。

  一、空間魔法:極緻壓縮,體積僅為1/8

  在“空間”上,iFairy實現了極緻的壓縮。

  傳統的全精度(FP16)權重需要16比特,而iFairy方案僅用2比特,就完成了對一個權重信息的編碼。

  這意味着,相較于流行的FP16模型,其模型體積可以直接壓縮至原來的1/8。這種“史詩級”的壓縮率,為大模型在手機、汽車等邊緣設備上的部署掃清了最大的存儲障礙。

  二、時間魔法:“無乘法”計算的革命

  在“時間”上,iFairy實現了“無乘法”計算的革命。這個魔法是如何實現的呢?

  1. PhaseQuant算法的神來之筆

  這一切,都源于團隊提出的全新量化算法PhaseQuant。它不再将權重映射到實數軸上的點,而是基于參數的相位将其映射到複平面上的四個單位根{±1, ±i}。

全景網

  這一操作堪稱神來之筆,一舉多得:

  信息密度拉滿:用{±1, ±i} 四個值,徹底利用了2-bit的全部信息容量,信息熵從傳統三元量化(如BitNet b1.58)的log₂(3)≈1.58-bit,提升到滿格的log₂(4)=2-bit。

  優雅的對稱性:這四個點在複平面上關于原點中心對稱,保持了模型訓練所需的良好性質。

  隐含的稀疏性:每個量化後的複數權重,其實部或虛部必有一個為零,這在高維度上保留了稀疏性的優勢。

  2. 驚豔的“無乘法”運算

  最令人拍案叫絕的是,引入複數,計算仍然高效!一個标準的複數乘法 (a+ib)(c+id) 需要4次實數乘法和2次加法,計算量不小。

  但在iFairy模型中,當一個複數激活值與量化後的權重 {±1, ±i} 相乘時,運算發生了奇妙的“退化”:所有乘法都消失了。

全景網

  看!整個模型中最核心、最龐大的矩陣乘法(GEMM),被徹底重構了!原本昂貴的浮點乘法運算,被完全替換為硬件成本幾乎為零的加法、減法和數據交換(shuffle)操作。這從根本上消除了計算瓶頸,為實現數量級的推理加速提供了可能。

  三、架構革新:一個全面“複數化”的Transformer

  為了讓這個魔法完美落地,研究團隊還将整個Transformer架構都進行了“複數化”改造。

全景網

  複數注意力機制:傳統注意力計算Q和K的點積,這裡則巧妙地使用了Hermitian内積的實部作為相似度分數,既利用了所有複數信息,又自然地得到了實數分數用于Softmax。

全景網

  複數旋轉位置編碼(RoPE):在複數域,位置編碼的旋轉操作變得異常簡潔和統一,一個簡單的複數乘法即可實現。

全景網

  四、驚豔成果:PPL降低10%,性能反超全精度!

  理論如此優雅,實踐效果如何呢?結果同樣令人矚目。

  iFairy 不僅沒有出現超低比特量化常見的性能懸崖,反而實現了驚人的性能反超。

  在LLM的語言建模能力方面,模型的困惑度(PPL)越低,代表模型對文本的理解和預測能力越強。在對PPL的測試中,基于相同數據集訓練(注:為保證對比的嚴謹性,所有對比模型的訓練數據均保持一緻,具體信息可參見論文)的2-bit的iFairy 模型取得了比全精度(FP16)模型更低的困惑度(PPL),降幅高達 10%。

全景網

  而在下遊任務評測方面,iFairy 模型更是在多個任務的評分反超了全精度的Llama基座模型。

全景網

  這意味着,一個體積隻有原來1/8、計算幾乎“零”乘法的模型,其能力反而更強了。這徹底颠覆了我們的傳統認知。

  對量化後權重的分析還發現,模型在訓練後,這四個複數值 {±1, ±i} 的分布非常均勻,證明模型确實學會了充分利用這套全新的“編碼系統”。

全景網

  總而言之,這項工作開創性地将複數神經網絡的思想與超低比特量化相結合,通過利用“相位”這一被忽略的信息維度,在不增加任何存儲成本的前提下,顯著提升了模型的表達能力和最終性能,真正實現了“魚與熊掌兼得”。

  它為設計下一代超高效、高性能的大語言模型,打開了一扇全新的大門。或許,我們離在普通手機上流暢運行GPT-5級别的模型,又近了一步。 相關論文、訓練代碼、模型權重與實驗腳本已全部開源,配套提供從訓練、評測到可複現實驗的完整流程,人人皆可複現訓練。

全景網

免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
    本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

猜你喜歡

海能達發布全新專業防爆PDT對講機CH690Ex

随着我國應急管理體系持續完善,消防救援任務正在從傳統火災處置,向化工園區事故、危險品洩漏、地下空間救援、大型綜合災害等多風險、多場景方向發展。在這些複雜環境中,救援現場往往面臨爆炸性氣體、可燃性粉塵、

2周前

海能達CCW 2026載譽收官:AI與融合通信引領專用通信新未來

6月16日至18日,2026年全球關鍵通信展(CCW2026)在英國倫敦舉行。展會期間,海能達集中展示了從終端到系統、從感知到決策的全鍊路創新版圖,AI與融合通信産品及解決方案貫穿三天展期,持續獲得高

4周前

登陸歐洲 Intersolar!遠景AI電力系統支撐全球 AI 算力發展

慕尼黑,2026年6月23日——在IntersolarEurope2026上,遠景科技集團發布面向AI數據中心的下一代電力基礎設施——融合風光儲一體化方案、固态變壓器(SST)、800V直流供電、儲能

4周前

海能達六度問鼎ICCAs,PDC650與西安機場方案摘得雙獎

6月17日,2026年國際關鍵通信獎(InternationalCriticalCommunicationsAwards,ICCAs)在英國倫敦舉行的全球關鍵通信展(CCW2026)期間正式揭曉。海能

4周前

海能達即将亮相2026年CCW全球關鍵通信展: 攜AI與融合通信解決方案登陸倫敦

6月16日至18日,2026年CCW全球關鍵通信展将在英國倫敦啟幕。作為全球領先的專用通信解決方案提供商,海能達将以全場景關鍵通信産品矩陣亮相F25展位,集中展示面向公共安全、應急救援、城市治理等領域

1個月前

海能達再獲第十一屆廣東專利獎:持續自主創新,構築專用通信知識産權高地

近日,廣東省市場監督管理局正式公示第十一屆廣東專利獎評選結果。海能達通信股份有限公司申報的“一種集群通信系統的組派接方法、通信系統及存儲介質”(專利号:ZL201811296617.7)榮獲廣東專利優

1個月前