輝達Blackwell平台在三個月內僅透過軟體實現4倍能效提升,延長了已部署硬體的經濟壽命,而繼任者Rubin架構已開始出貨。
輝達Blackwell平台在三個月內僅透過軟體實現4倍能效提升,延長了已部署硬體的經濟壽命,而繼任者Rubin架構已開始出貨。

輝達(Nvidia)GB200 NVL72機櫃系統在運行DeepSeek R1 0528時,於三個月內實現了每百萬瓦每秒Token數(tokens per second per megawatt)4倍的提升,而這完全歸功於軟體優化。該公司表示,這些優化適用於超過90%的AI模型。
輝達在一篇詳細介紹該基準測試結果的技術部落格文章中表示:「這些成果來自一個硬體、互連與軟體共同設計且持續優化的平台。今日創紀錄的表現,僅是為明日更高性能奠定基礎。」
這些提升源自38項重大優化,這些優化在25萬個模擬配置中進行了測試,總計耗費140萬GPU小時。在訓練方面,GB300 NVL72——輝達的Blackwell Ultra機櫃——在256顆GPU上針對DeepSeek-V3 671B預訓練創下了每顆GPU 1,648 TFLOPs的世界紀錄,幾乎是前一代GB200所達到的606 TFLOPs的三倍。同一硬體僅透過軟體更新,便在六個月內提升了1.5倍。
這種雙世代策略——在推出Vera Rubin(其Token吞吐量在同功耗下約為前代的10倍)的同時,從已部署的Blackwell系統中挖掘更多價值——強化了輝達相對於超微半導體(AMD)以及Google TPU、亞馬遜Trainium等客製化ASIC競爭對手的競爭地位。輝達股價目前約為預期本益比的35倍。隨著客戶看到投資資本回報(ROIC)的延長,持續的軟體驅動性能提升可能推高分析師的預估值。
軟體優化跨框架疊加
這些性能提升並非僅限於輝達專有的Megatron Core框架。在PyTorch的原生訓練堆疊TorchTitan上,GB300 NVL72在DeepSeek-V3 671B上實現了每顆GPU 1,197 TFLOPs——相較於未優化的基線199 TFLOPs,提升了6倍。在研究領域廣受歡迎的Google支援框架JAX,其成長曲線更為陡峭:吞吐量從1月的每秒每顆GPU 418個Token,躍升至2026年7月的每秒每顆GPU 4,082個Token,實現了10倍的增長,相當於每顆GPU 1,025 TFLOPs。
輝達的工程師直接為這兩個開源框架做出了貢獻,所實現的優化隨著時間推移而疊加。該公司表示,他們已經運行了超過25萬個模擬配置以找出最有效的變更,而38項優化中有超過90%適用於不同的AI模型——這意味著運行Llama、GPT或其他架構的客戶無需額外的工程工作即可受益。
擴展效率逼近理論極限
隨著前沿模型轉向混合專家(MoE)架構——每個Token僅激活一部分參數——GPU之間的溝通已成為主要瓶頸。輝達的GB300 NVL72透過第五代NVLink解決了這個問題,為每顆GPU提供1.8 TB/s的頻寬,並在72顆GPU的機櫃內提供130 TB/s的非阻塞全雙工頻寬。
結果是從256顆GPU到1,024顆GPU實現了接近線性的擴展:Megatron Core保持了98.5%的效率,而TorchTitan和JAX均保持了97%的效率。每個NVL72機櫃內的800 Gb/s Scale-Out網路晶片確保了梯度通訊流量隱藏在運算之後,因此增加GPU只會提高總吞吐量,而不會使網路飽和。
輝達的下一代架構Vera Rubin已開始全球部署,在150百萬瓦功耗下可實現約每秒80萬個Token——約為同等功耗下GB200 NVL72每秒8萬個Token的10倍。但該公司並未放棄Blackwell。此策略與Hopper世代如出一轍:即使在新版架構出貨的同時,仍持續針對已部署的硬體進行軟體優化,延長客戶的投資回報,並加深該平台的軟體護城河。
對於已在Blackwell基礎設施上投資數十億美元的超大規模雲端供應商和企業客戶而言,4倍的能效提升直接轉化為更低的每個Token成本和更高的使用率。隨著AI訓練工作負載持續擴大——DeepSeek-V3 671B擁有6,710億個總參數,每個Token啟動370億個參數——這種經濟效益至關重要。該模型正是最能從輝達緊密耦合的擴展架構中受益的類型。
本文僅供參考,不構成投資建議。