
7 月 14 日消息,亞馬遜 AWS 在 6 月 24 日發布的一篇文章中,正式介紹了其大型分布式集群 Project Rainier。該項目憑借龐大的規模與先進的架構設計,有望成為目前世界上最強大的 AI 模型訓練計算機,為大型語言模型、生成式 AI 等前沿領域的研發提供強勁算力支撐。
集群架構:分布式布局與 Trainium2 芯片核心
Project Rainier 并非局限于單一數據中心,而是分布在美國境内的多個不同數據中心,通過高效互聯技術形成跨地域的超級計算網絡。其核心硬件基礎是 AWS 旗下 Annapurna Labs 芯片部門自主研發的 AI 芯片 Trainium2.這款芯片專為大規模 AI 訓練場景優化,具備高算力密度與能效比優勢。
具體架構設計上,每個服務器單元配備 16 顆 Trainium2 芯片,每 4 個服務器整合為一個 “UltraServer” 模塊。在此基礎上,數以萬計的 UltraServer 通過高速互聯技術連接,最終構成 Project Rainier 這一 “UltraCluster” 超級集群,形成規模化的算力池,可滿足千億參數甚至更大規模 AI 模型的訓練需求。
互聯技術:分層設計保障高效通信
為實現海量計算單元的協同工作,Project Rainier 采用了分層互聯方案:
内部互聯:Tn2 UltraServer 内部的芯片與服務器之間,通過藍色電纜的 NeuronLinks 技術實現高速通信,确保模塊内數據傳輸的低延遲與高帶寬;
跨域互聯:單一數據中心内部的不同 UltraServer,以及跨數據中心的集群節點,則由黃色電纜的 Elastic Fabric Adapter(EFA)技術負責連接。EFA 作為 AWS 專為高性能計算(HPC)和 AI 訓練打造的網絡适配器,可提供低抖動、低延遲的通信能力,支撐跨地域集群的高效協同。
應用場景與算力優勢
AI 領域知名公司 Anthropic 已确定将使用 Project Rainier 集群,用于構建和部署其旗艦大模型 Claude 的未來版本。Annapurna Labs 産品和客戶工程總監 Gadi Hutt 表示,Project Rainier 提供的算力是 Anthropic 目前最大訓練集群的五倍,這意味着模型訓練時間将大幅縮短,或能支持更複雜的模型結構與更豐富的訓練數據。
對于 AWS 而言,Project Rainier 的推出不僅強化了其在 AI 基礎設施領域的競争力,也為企業客戶提供了更強大的算力選擇 —— 無論是科技巨頭的大模型研發,還是中小企業的 AI 應用創新,都能借助這一超級集群降低算力門檻,加速 AI 技術落地。随着生成式 AI 的持續爆發,這類分布式超級訓練集群的重要性将愈發凸顯,而 Project Rainier 的表現也将成為業界關注的焦點。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.



