這兩天國産AI芯片最重磅的消息,沒有之一。

6月5日上午,深圳發布官方賬号率先發布通報,正式确認了這個讓整個行業振奮的消息。近日,深圳河套學院AI訓練平台項目團隊,聯合哈爾濱工業大學(深圳)、深圳市大數據研究院、華為有關團隊,協同深智城AI算力平台,面向國産算力大模型訓練開展聯合攻關。依托昇騰910C國産AI算力集群,完成1.6萬億參數大模型DeepSeek-V4-Pro全參數後訓練。
消息一出,國内科技媒體第一時間跟進。當天,南華早報等海外主流科技媒體也跟進報道,稱這一進展标志着在美國制裁持續收緊的背景下,中國半導體行業正努力從支持基礎AI推理,邁向更複雜的模型訓練階段。

深圳發布在報道中明确指出,"此次實踐為全球第三方機構在國産算力平台上完成該級别模型訓練的相關探索,積累了重要經驗,也印證了國産AI芯片可支撐世界級超大參數模型訓練工作"。
但在我看來,這不是一次試探性的嘗試,而是一次裡程碑式的技術突破。它用無可辯駁的工程結果證明,國産AI芯片已經跨過了那條最難的門檻。
先搞懂這幾個詞
很多人看新聞隻記住了"1.6萬億參數"這個數字,卻沒搞懂"全參數後訓練"這六個字的分量。
AI大模型從誕生到能用,其實就兩個核心階段:訓練和推理。
推理:運行一個已經訓練完成的模型來處理用戶請求。這個過程中模型的所有參數都是固定不變的,隻是利用已學到的知識生成輸出。推理對算力的要求相對較低,更看重延遲、吞吐量和能效比。這也是國産芯片此前最擅長的領域,國内市場上已有大量AI應用采用國産推理芯片部署。
訓練:通過輸入海量數據,不斷調整模型内部參數,讓模型學會新知識和新技能的過程。訓練的難度和算力需求與推理不在一個量級,通常需要數千甚至數萬張芯片組成的集群連續運行數周甚至數月。
訓練又分為兩個關鍵階段:
預訓練:大模型的基礎階段。給模型喂入萬億級别的文本、圖像等多模态數據,讓它掌握基本的語言能力、世界知識和通用邏輯。
後訓練:在預訓練的基礎上,通過人類反饋強化學習(RLHF)、監督微調(SFT)等技術,讓模型學會遵循人類指令、遵守安全規則、完成特定任務。這是決定大模型實際使用體驗的關鍵環節。
全參數後訓練:指在訓練過程中更新模型的全部參數,而不是隻更新其中一小部分。對于DeepSeek-V4-Pro來說,就是要同時調整它的1.6萬億個參數。與之相對的是"部分參數微調",隻更新模型的最後幾層或者少量适配器參數。全參數訓練能夠最大限度地提升模型性能,但也對算力、存儲、通信和系統穩定性提出了近乎苛刻的要求。
深圳發布的那個比喻特别形象:如果把訓練一個萬億級參數的AI大模型比作解一道超級複雜的數學題,那麼每一張計算卡就像一名解題員。他們不僅要分工明确、日夜不停地連軸轉,還不能有人偷懶、不能有人出錯,更不能有人掉隊。
"以前的國産算力更多是讓大模型'能用',也就是推理部署,就像給模型修了一條單行道,輸入一個問題,輸出一個答案。"
而全參數後訓練,"是要讓模型學會自我反思和調整,相當于在單行道的基礎上,又增加了複雜的立交橋和多條反饋回路,計算量和通信量瞬間翻了好幾倍。"
而且DeepSeek-V4-Pro用的還是現在最主流的混合專家(MoE)架構,這就更難了。可以把它想象成一個龐大的“專家團”,平時推理的時候,隻需要激活少數幾個"專家"來回答問題。但訓練的時候,所有專家都要同時學習,還要互相通信同步信息。光是專家之間的數據交換量,就是普通模型的幾十倍。
這也是為什麼之前業内普遍認為,國産芯片根本扛不住這麼大的全參數訓練。

這次能成靠的是三個實打實的工程突破
面對這麼大的挑戰,這次團隊沒有搞什麼花裡胡哨的概念,就是靠三個紮紮實實的工程突破,把不可能變成了可能。
第一個是"顯存拼圖"。1.6萬億個參數的數據量極其龐大,不可能塞進任何一張單獨的計算卡。團隊設計了一套極其精密的分布式承載方案,把整個模型像拼圖一樣,拆成一小塊一小塊,精确地分配到每一張芯片上。哪塊卡負責哪部分參數,什麼時候需要和其他卡交換數據,都算得絲毫不差。
第二個是"負載均衡"。混合專家模型最頭疼的問題就是忙閑不均。有的專家任務排成長隊,有的專家卻閑得沒事幹。之前很多國産集群跑MoE模型,算力利用率普遍偏低。這次團隊專門針對MoE架構優化了調度算法,動态給每個專家分配任務,徹底解決了跨卡通信擁堵的問題。
第三個是"全程不掉線"。做過大模型訓練的人都知道,最怕的就是跑了幾天幾夜,突然一個硬件故障或軟件錯誤,整個訓練直接崩潰,前面所有的時間和算力都打了水漂。這次訓練一共跑了1500多步,全程沒有出現一次中斷或者報錯。這背後是一整套完整的全鍊路監控和容錯體系,是無數個日夜調試出來的結果。
最後官方公布的數據是,模型算力利用率超過30%,關鍵訓練算子效率提升14%。可能有人覺得30%不高,但在大模型訓練領域,這已經是非常不錯的工業級水平。要知道,就算用最頂級的海外芯片,很多團隊的實際利用率也就在40%左右。

比技術突破更重要的是我們終于有了自己的練兵場
很多人讨論這次突破,都隻盯着芯片本身。但在我看來,這次事件最被低估的價值,其實是人才培養。
深圳河套學院這次沒有把這個項目當成一個單純的技術攻關,而是把它變成了一個活生生的課堂。他們讓學生直接進入真實的訓練場景,從最基礎的環境搭建開始,全程參與整個訓練過程。
截至目前,這個項目已經培養了42名學生,形成了青年教師指導、博士生核心攻堅、工程團隊支撐的完整梯隊。這些人不是在課本上學大模型訓練,而是真刀真槍地跑過萬億級模型的全流程。他們知道哪裡會出問題,知道怎麼解決問題,這才是國産AI産業最寶貴的财富。
很多人說國産AI缺芯片,其實更缺的是真正有實戰經驗的工程師。大模型訓練是一門工程科學,很多東西是書本上學不到的,必須親手跑過才能明白。之前我們沒有自己的高端算力平台,很多年輕人連摸一下萬億級集群的機會都沒有。現在這個局面,終于被打破了。
寫在最後
當然,我們必須清醒地認識到,國産算力和世界頂尖水平之間還有不小的差距。無論是單卡性能,還是整個軟件生态的完善程度,我們都還有很長的路要走。
但這次突破的意義,怎麼強調都不為過。它證明了一件事:在大模型訓練這個曾經被海外壟斷的領域,我們不僅能做,而且能做得很好。它給整個行業注入了信心,也給所有正在這條路上努力的人,點亮了一盞燈。
深圳發布在通報的最後說,接下來,深圳河套學院将聯合生态夥伴持續優化算力集群性能,圍繞長文本處理、AI智能體等方向開展技術探索,持續挖掘國産算力應用潛力。
我相信,這隻是一個開始。當越來越多的團隊開始用國産芯片訓練大模型,當整個生态慢慢成熟起來,國産AI産業一定會迎來屬于自己的時代。

免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

