NVIDIA 的 Groq 3 LPX 推論加速器已全面量產,每秒輸出 3,400 個 Token——比最接近的競爭對手快 4 倍。
NVIDIA 的 Groq 3 LPX 推論加速器已全面量產,每秒輸出 3,400 個 Token——比最接近的競爭對手快 4 倍。

NVIDIA 的 Groq 3 LPX 推論加速器已達全面量產階段,在 Gemma 4 31B 模型搭配 10 萬 Token 上下文情境下,達到每秒輸出 3,400 個 Token 的效能——比最接近的替代平台快 4 倍,專為代理型 AI(agentic AI)工作負載而設計。該基準測試透過 Artificial Analysis 執行,是該模型歷來測得的最快效能紀錄。
「推論是 AI 的成長引擎。」NVIDIA 創辦人暨執行長黃仁勳表示:「Vera Rubin 以專為代理型 AI 時代設計的工作負載優化 AI 工廠配置,延伸了這項願景,並以 LPX 推進效能前沿,實現超高速 Token 生成。」
Groq 3 LPX 延伸了 Vera Rubin NVL72 平台,將 Rubin GPU 用於大規模上下文處理,LPU 則用於延遲敏感的解碼(decode)工作負載。機架級部署可容納 256 顆 LP30 加速器,透過直接晶片對晶片互連連結。Nebius 是首家採用此晶片的 AI 雲端業者,將其整合至 Nebius Token Factory 生產級推論平台。而專為 AI 推論打造的雲端服務商 Groq 也計畫成為最早採用的業者之一。NVIDIA 並未揭露 4 倍比較中所使用的具體平台。
此量產里程碑的到來,正值 NVIDIA 在 AI 推論領域面臨來自 Cerebras、AMD 以及超大規模雲端業者客製化晶片的日益激烈競爭。NVIDIA 資料中心業務在 2027 財年第一季(會計年度)營收達 816 億美元,年增 85%。隨著 AI 工作負載從訓練階段轉向推論階段,該公司能否透過專業化推論加速來延伸 Vera Rubin 平台,將是決定其能否維持主導地位的關鍵。
代理型 AI 系統在數百甚至數千個推論步驟中生成海量 Token,因此 Token 生成速度對於代理能否即時推理、行動並完成複雜任務至關重要。Groq 3 LPX 專為解決解碼延遲而設計——即為單一使用者生成 Token 的速率——這決定了代理完成每個工作步驟的速度。更快的生成速度讓代理有更多時間檢查檔案、撰寫與測試程式碼、呼叫工具、驗證結果並反覆迭代,同時維持流暢的使用者體驗。
LPX 架構是 NVIDIA 更廣泛 Vera Rubin 平台的一部分,該平台橫跨七款晶片與五款專用機架。這些機架平台配備 BlueField-4 DPU,並與 Vera CPU 機架、Vera BlueField-4 STX 儲存以及 Spectrum-6 SPX 乙太網路協作,以最高每瓦吞吐量與最低延遲推論來優化多代理系統。
Nebius 計畫將 Groq 3 LPX 導入其 Nebius Token Factory,讓開發者能夠獲得極致 Token 生成速度,以打造高度即時的代理型 AI 應用。「生成是推論階段中決定 AI 系統實際反應速度的關鍵,而這正是 NVIDIA Groq 3 LPX 所專注加速的部分。」Nebius 技術長 Danila Shtan 表示:「作為首家透過 Nebius Token Factory 將其導入生產的 AI 雲端業者,我們確保代理迴圈的每個步驟都能瞬間完成——透過開發者已在使用的同一套 API,無需遷移至新技術棧。」
這項採用證實了市場對新晶片的真實需求,但 NVIDIA 在推論市場仍面臨來自競爭對手的壓力。Cerebras 近期推出其 CS-4 晶圓級引擎,號稱一秒鐘內即可完成 GPU 機架需要 30 秒才能完成的生成任務。AMD 則持續將其 MI300X 與 MI400 系列推進 AI 資料中心。與此同時,包括 Amazon 與 Google 在內的超大規模雲端業者,正積極開發客製化推論晶片以降低對 NVIDIA 的依賴。
NVIDIA 股價一直受惠於其在 AI 加速器領域的主導地位,分析師給予的中位目標價為 308.50 美元。該公司 2027 財年第一季營收達 816 億美元,年增 85%。Groq 3 LPX 的量產里程碑,加上 Vera Rubin 平台的逐步推出,可望協助 NVIDIA 在推論工作負載成為 AI 基礎設施支出主要成長動能之際,維持其定價能力。
本文僅供資訊參考之用,不構成投資建議。