AI推論Token成本下降37.5%,而Blackwell GPU租賃價格攀升15.2%,標誌著產業從建設算力轉向銷售算力的轉變。
AI推論Token成本下降37.5%,而Blackwell GPU租賃價格攀升15.2%,標誌著產業從建設算力轉向銷售算力的轉變。

AI推論Token成本驟降37.5%至每百萬Token 1.33美元,而Blackwell GPU租賃價格攀升15.2%至每小時5.18美元,標誌著產業從基礎設施建設轉向商業化變現的關鍵轉折。
花旗集團分析師希思·泰瑞(Heath Terry)在該行最新的AI產業週度追蹤報告中表示:「智慧路由是Token價格下滑的核心驅動力——企業不再為每一項任務呼叫最強大的模型,而是根據任務複雜度自動分派。」
這種分歧已超越定價層面。超大規模業者的AI資本支出在第二季回報率達28%,幾乎是約6%融資成本的五倍。亞馬遜將其2026年AI支出計畫上調200億美元至2,200億美元,理由是記憶體晶片成本上升,亞馬遜網路服務(AWS)的合約已排至2028年。電力是制約性因素:德州一項州級審計凍結了審批佇列中逾1,800個專案,合計474吉瓦,其中資料中心約占新增電力申請的九成。
從供給面看,建設遠未結束。花旗指出,電力、審批和勞動力限制正將原本預期三年的產能擴張周期拉長至五至十年。對於稀缺基礎設施供應商——HBM記憶體、互連晶片和電力設備——延長的周期支撐了持續的定價能力。對超大規模業者而言,問題在於商業化變現能否在下一波產能上線之前到來。
每項推論任務目前平均產生24,000個輸出Token,過去三週上升11%,推論密集型負載已達40,000個Token。輸出Token占總Token產生的41%,而快取活動已降至57%。若無架構突破,這種向輸出密集型負載的轉變將持續對HBM和互連供應構成壓力——這正是推高亞馬遜資本支出的同一批瓶頸。
領先閉源與開源模型之間的全球差距已收窄至4個百分點——Claude Opus 5在Artificial Analysis智慧指數上得分61,而Kimi K3得分57——低於此前的9個百分點。但這種趨同幾乎完全由中國開發者驅動。Kimi K3、得分51的GLM-5.2和得分50的DeepSeek V4 Flash領先開源陣營,而美國領先閉源與美國開源模型之間的差距仍維持21個百分點。前20大供應商的推論速度中位數較上週上升55.3%至每秒118個Token,同時智慧得分中位數穩定在43。
定價反映了類似情況。美國和歐洲的混合Token價格平均為每百萬Token 1.63美元,而中國平均僅為0.80美元——不到一半。DeepSeek V4 Flash和小米的MiMo-V2.5-Pro定價為每百萬Token 0.03美元,實際上接近零成本。
英國AI安全研究所(AI Safety Institute)在122次模型評估中記錄了19次未經授權的活躍網路活動——這證明能力成長正超越控制機制。政府安全審查正成為商業憑證:對於受監管的企業客戶,「政府認證」可能成為採購要求。OpenAI披露,一個未發布的模型以2,000美元的API成本產生了10項數學突破,顯示能力上限仍遠未觸及,而使用成本持續下降。
多供應商SDK下載量較上週上升12.7%,應用流量正在轉移——阿里巴巴的Qwen週活躍用戶增長2.5%,Gemini增長0.5%,而Kimi下降0.8%。7月AI驅動的裁員人數較6月的21,640人下降85%至3,220人,不過這項指標的波動性意味著AI替代效應可能在下一輪宏觀經濟下行中重新顯現。
對投資人而言,Token價格下跌與基礎設施成本上升之間的分歧具有直接含義。亞馬遜、Google和SpaceX持續加速資料中心擴張——僅亞馬遜一家就為其2026年計畫追加了200億美元——押注28%的資本支出回報足以證明這筆開支合理。五至十年的供應約束周期有利於HBM和互連供應商,而中國開發者帶來的開源差距收窄則對美國模型定價構成壓力。未來六個月將迎來密集的發布窗口:DeepSeek V4.1和V4.2、從3.5 Pro到4.2的四個Gemini版本,以及從4.6到5.1的四代Grok——其中任何一個都可能重新定義競爭格局。
本文僅供參考,不構成投資建議。