如果說過去兩年AI算力賽道的主角是GPU,那麼現在,CPU正在強勢“搶戲”。随着AI從訓練驅動轉向推理驅動,CPU在AI基礎設施中的權重不斷攀升,CPU:GPU比值持續走高。
英特爾最新白皮書揭示了這一變化的兩大核心引擎:推理工作負載的爆發式增長,以及強化學習與仿真系統的加速落地。當Agentic AI成為主流,大模型進入規模化推理階段,CPU不再是“配角”,而是決定AI系統效率與成本的關鍵。
推理反超訓練,AI算力結構迎反轉
AI 行業的算力投入,正在經曆從 “重訓練” 到 “重推理” 的根本性轉變,這是推高 CPU 需求的首要原因。
過去,AI 發展以模型研發、訓練為核心,海量數據的密集線性代數計算讓 GPU 成為絕對主力,CPU 僅負責數據加載、簡單編排等輔助工作,CPU:GPU 比值維持在低位。但如今,企業紛紛從 AI “實驗階段” 走向 “落地部署階段”,推理成為算力支出的核心。
推理與訓練的算力邏輯截然不同,推理的數據編排與管理對 CPU 有極強依賴 。。如果說訓練的核心瓶頸是 GPU 的浮點算力,那麼推理的核心瓶頸,早已轉移到 CPU 側的請求處理、編排調度與數據加工。

CPU 在推理流程中扮演着 “空中交通管制員” 的角色:從用戶提交請求開始,數據攝入、清洗、轉換、批處理、格式轉換等全流程核心環節,CPU 占比普遍超過60%,在多個場景下達到100%的峰值 ;即便是 GPU 完成的輕量化推理計算,前後的令牌流處理、KV 緩存的數據調度、檢索路由、結果格式化,也全部由 CPU 主導。

行業實測數據更能說明問題:優化後的 GPU 單推理請求計算量極小,而 CPU 的數倉流水線耗時,往往超過 GPU 的前向傳播時間;即便是 高端 GPU,搭配以至強6性能核為代表的高性能CPU 後,推理吞吐量也能大幅提升 ——如今,CPU 的編排效率比 GPU 的原始浮點算力,更能決定 AI 推理的實際吞吐量。
更重要的是,Agentic AI的普及進一步放大了CPU的需求。企業正在從 “問答式 AI” 轉向 “任務式智能體”,RAG、嵌入搜索、多智能體鍊、多步工作流成為标配,這些場景需要大量的 CPU 側邏輯處理;而智能體的 “規劃 - 工具使用 - 反思 - 優化” 循環,還能通過 CPU 主導的代碼生成 / 沙箱執行,降低對超大參數模型的依賴。優化整個系統層面的算力結構。

An increased CPU:GPU ratio can benefit multi-agent architectures, where execution agents use VMs as sandboxes to execute code[1].
對于雲廠商的多租戶 GPU 集群而言,GPU 密度越高,對 CPU 的需求就越大 —— 隊列管理、安全隔離、MIG 切片分配、資源調度等核心管理工作均由 CPU 完成,增加每 GPU 對應的 CPU 數量,成為避免 GPU 閑置、降低高成本浪費的關鍵。
強化學習工業化,CPU成仿真與調度核心
如果說推理增長是 CPU 需求的 “基本盤”,那麼強化學習(RL)的工業化落地,就是推動 CPU:GPU 比值走高的 “增量引擎”。
曾經,RL 隻是視頻遊戲領域的小衆技術,而如今,随着自動駕駛、機器人、精密醫療、算法交易等領域的發展,RL 已進入複雜 3D 仿真環境的工業化應用階段,而這一過程,對 CPU 有着極緻的需求 ——RL 的核心框架中,環境步進、控制邏輯、搜索、軌迹管理等核心環節,均由 CPU 主導,高保真的仿真環境更是需要海量的 CPU 算力支撐。

Reinforcement learning (RL) framework[2].
從行業應用來看,RL 的落地場景已全面鋪開,而這些場景無一例外都依賴 CPU 的大規模支撐:
•自動駕駛與機器人:特斯拉 Autopilot 的實時決策、機器人的靈巧操作,均需在 CARLA、Isaac Gym 等仿真器中完成訓練,多智能體場景、傳感器管道、物理仿真邏輯均由 CPU 實現;
•工業與金融:供應鍊路由、電網負荷調節、算法交易、市場仿真等場景,需要 RL 完成序貫決策優化,而并行環境推演、數據處理均依賴 CPU;
•大模型對齊:RLHF(人類反饋強化學習)成為大模型安全對齊的标準方案,獎勵評估、采樣、GPU 集群編排等工作,進一步增加了 CPU 的調度壓力;
•智能體 AI:自改進 AI 智能體的多步規劃、工具使用決策框架,将 RL 作為核心基礎,讓 CPU 成為智能體決策的算力底座。
RL 的訓練架構,更是天生決定了 CPU 的核心地位。主流的 RL 架構均采用 “Actor-Learner 分離” 設計:Actor(環境步進、推理調用)負責樣本收集,幾乎全部運行在 CPU;Learner(優化器更新)負責梯度計算,運行在 GPU / 加速器。無論是 IMPALA 架構的數千台 CPU 并行收集經驗,還是 Ray RLlib 為每個 EnvRunner 顯式分配 CPU 資源,亦或是 AlphaZero 的蒙特卡洛樹搜索(MCTS)在 CPU 上的大規模并行推演, CPU都決定了RL 過程的性能上限 。
而随着 RL 環境的複雜度不斷提升 —— 高保真物理仿真、多傳感器融合、多智能體協作,CPU 的需求還在持續攀升:CPU 的核心數和内存直接決定了并行仿真環境的數量,在 PPO 等主流 RL 算法中,CPU 的仿真速率主導了整體的吞吐,GPU 僅負責後續的梯度更新。
不是GPU失寵,而是AI基建走向協同
CPU:GPU 比值走高,并非意味着 GPU 的核心地位被削弱,更不是“此消彼長”的零和博弈。恰恰相反,這是 AI 基礎設施從“單維算力堆疊”走向“系統級協同優化”的必然結果。
GPU 依然是 AI 計算中密集浮點運算的絕對核心。但新一代 GPU 架構(NVIDIA、AMD、英特爾)對 CPUGPU 之間的協同效率提出了更高要求——糟糕的協調會直接導緻延遲飙升、GPU 空轉。與此同時,AI 數據中心的千兆瓦級功耗壓力,也讓“通過 CPU 優化 GPU 利用率”成為剛需。擴展 CPU(尤其是英特爾至強6這類高能效、高帶寬處理器)比單純增加 GPU 更節能:将數據預處理、調度、編排等輔助任務卸載到 CPU,能顯著減少 GPU 空閑時間,大幅提升單位 token 的能效,緩解數據中心的能源與冷卻壓力。
如今的 AI 系統,早已不是“GPU 單獨發力”的時代:
超大規模 GPU 集群的互連協調、分布式調度,需要 CPU 完成;
Agentic AI 的多階段流水線、複雜編排,需要 CPU 支撐;
強化學習的工業化仿真、并行推演,更需要 CPU 主導。
對于企業和雲廠商而言,未來的 AI 基建規劃,必須将 CPU 作為優化成本、性能、能效的第一等考量因素—— 不再是簡單的 “配多少 GPU”,而是 “如何通過 CPU與GPU的聯動與優化,讓 GPU 的價值最大化”。
[1].Figure 1 is adapted from"From Mind to Machine: The Rise of Manus Al as a Fully Autonomous Digital Agent" by Minjie Shen et al,used under CC BY 4.0.
[2].Figure 2 is adapted from the following source: Nikolopoulou, K. (August 15, 2023).Easy Introduction to Reinforcement Learning. Scribbr. Retrieved March 13, 2026, from https://www.scribbr.com/ai-tools/reinforcement-learning/.
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

