重點摘要: Nvidia 悄悄重啟了一項市場已放棄下架的晶片計畫,此次重新設計瞄準的是 AI 推理中最昂貴的階段。
重點摘要: Nvidia 悄悄重啟了一項市場已放棄下架的晶片計畫,此次重新設計瞄準的是 AI 推理中最昂貴的階段。

Nvidia 已重啟其 Rubin CPX 預填充加速器,針對長上下文 AI 推理的成本瓶頸,量產時程鎖定 2027 年第一季。
「正當市場開始相信 Rubin CPX 已從 Nvidia 產品藍圖中移除之際,我最新的產業調查顯示 Nvidia 已重啟此計畫。」供應鏈分析師郭明錤週一在 X 平台發文表示。
重新設計後的晶片每顆 GPU 搭載 168GB 的 HBM4 記憶體,高於先前設計的 128GB GDDR7,但低於標準 Rubin GPU 的 288GB HBM4。每個八卡運算托盤約搭載 1.34TB HBM4,足以涵蓋大多數長上下文預填充工作負載及其 KV 快取需求。該晶片功耗最高達 2,300 瓦,與標準 Rubin 功耗一致,其運算效能亦接近標準 Rubin GPU。
此次重啟之所以重要,是因為預填充——模型在生成輸出前讀取並處理輸入的階段——目前占 AI 推理工作負載的比重已超過五成,且隨上下文窗口持續擴大。Nvidia 建議以 1:1 的比例將 CPX 與 Vera Rubin NVL72 系統搭配部署,由 CPX 負責預填充並生成 KV 快取,再透過以太網路 RDMA 傳輸至 Rubin 執行解碼階段。
新款 CPX 移至獨立的 MGX ETL 機櫃中,而非與 Rubin GPU 共用空間,讓客戶得以獨立擴充預填充容量。配置範圍涵蓋 64 至 256 顆 CPX GPU,每個 64-GPU 模組由八個八卡運算托盤加上一個交換托盤組成。
互連採用分層設計,以峰值頻寬換取成本。每個托盤內,八顆 CPX GPU 透過 NVLink 以每 GPU 1 至 1.5 TB/s 的速度連接——遠低於標準 Rubin 的 3.6TB/s。在托盤之間及機櫃模組之間,Nvidia 使用 Spectrum-6 乙太網路,機櫃內採用全銅 L1 鏈路,跨模組則使用 OSFP 光纖。
此架構反映了 AI 推理運作方式上的根本性分野。預填充屬於運算密集型:GPU 並行處理整個輸入,生成儲存注意力狀態的 KV 快取。解碼則屬記憶體頻寬密集型:模型逐個 token 生成輸出,反覆載入權重與快取上下文。在同一顆 GPU 上同時執行兩者勢必妥協——在預填充階段為用不到的頻寬付費,在解碼階段為用不到的運算付費。
Nvidia 建議 CPX 與 Rubin 以 1:1 比例搭配,意味著部署 Vera Rubin NVL72 系統的客戶,在給定推理工作負載下所需的 GPU 數量將約倍增。隨著長上下文模型持續擴展,此一配置邏輯將支撐資料中心資本支出的持續成長。
該公司在 8 月公布的第二季財報顯示,營收達 962.2 億美元,年增 106%,高於市場共識的 921.8 億美元。Vera Rubin 正與 CoreWeave、Nebius、Microsoft Azure、Google Cloud 及 Oracle Cloud 等合作夥伴全面量產中。
Nvidia 股價週一收在 220.50 美元,上漲 1.36%。該股在 Benzinga Edge Rankings 的成長性排名位居第 98 百分位,短期、中期及長期價格趨勢評級均為正面。
CPX 重啟亦對 Nvidia 的代工廠台積電產生影響。從 GDDR7 轉向 HBM4 增加了對高頻寬記憶體及先進封裝的需求,可能同時收緊兩者的供給。此外,Nvidia 在 GTC 2026 上重點展示 Groq 3 LPU 及 LPX 機櫃——而 CPX 明顯缺席該藍圖——顯示即便 Nvidia 全力押注預填充專業化,仍在多種推理架構之間進行避險布局。
對投資人而言,關鍵問題在於 1:1 的部署比例是否會轉化為更高的單櫃平均售價,抑或僅是更多單位銷售。Nvidia 尚未公布 CPX 定價,但該晶片較低的記憶體容量及基於乙太網路的擴充架構,暗示其每顆 GPU 成本低於標準 Rubin——有望擴大推理密集型工作負載的可觸及市場。
本文僅供參考,不構成投資建議。