關鍵要點: DeepSeek 的 V4 Flash 單一編碼工具單日消耗 8 兆個 token——超過 OpenRouter 整個平台每日的處理量。
關鍵要點: DeepSeek 的 V4 Flash 單一編碼工具單日消耗 8 兆個 token——超過 OpenRouter 整個平台每日的處理量。

DeepSeek 的 V4 Flash 正在重塑 AI 推論經濟學,每百萬個輸出 token 收費 0.28 美元——比 Anthropic 的 Claude Opus 4.8 便宜約 85 倍——同時在關鍵智慧基準測試中僅落後六分。
「V4 Flash 的平均測試成本為 3 美分,相較之下 Kimi K3 為 86 美分、OpenAI 的 GPT-5.6 Sol 為 1.86 美元、Claude Fable 5 為 3.15 美元,」Intelligence Index 基準測試套件的研發機構 Artificial Analysis 表示。
該模型在 Intelligence Index 上獲得 50 分(滿分 100 分),與 Google 的 Gemini 3.6 Flash 持平,落後 Meta 的 Muse Spark 1.1 和 Z.AI 的 GLM-5.2 一分。運行完整基準測試套件的成本,V4 Flash Max 為 72.02 美元,而 Claude Opus 4.8 Max 為 3,752.55 美元——為了多出的六分,差距高達 52 倍。在 AA-Omniscience 基準測試中,V4 Flash 的準確率為 37%,幻覺率高達 84%。
定價壓力來臨之際,代理型 AI 工作負載正在爆炸式增長。一位使用者耗費了 6.9 億個 token——約合人民幣 3,000 元——讓 Claude Opus 5 透過疊代式工具呼叫建構一款單頁 3D 遊戲。DeepSeek 的模型擁有 2,840 億個總參數,但每個 token 僅啟用 130 億個,正是為此類高流量、反覆試錯的使用情境而打造。
開源 AI 代理工具 OpenCode 報告稱,V4 Flash 正式發布後,透過其平台單日消耗了 8 兆個 token——其中 5 兆來自免費方案,3 兆來自付費方案。相比之下,OpenRouter 每月在其路由的 400 多個模型間處理約 200 兆個 token,即每日約 6.6 兆個。
這一規模反映出人們使用 AI 方式的轉變。聊天時代的互動模式——一個問題、一個答案——正讓位於代理型工作流程,其中模型需要讀取檔案、修改程式碼、執行程式、檢查結果,並在失敗後重試。單一任務可能持續數小時並觸發數十次工具呼叫。即使模型撰寫的程式碼量大致相同,token 消耗量也可能放大數十倍甚至數百倍。
價格背後的架構
V4 Flash 的成本優勢來自其架構。該模型擁有 2,840 億個總參數,但每個 token 僅透過 DeepSeek 的專家混合設計啟用約 130 億個參數。V4 系列還重新設計了 Transformer 模組的注意力層,在交替層中使用壓縮稀疏注意力和分層壓縮注意力機制,以平衡成本與能力。
DeepSeek 的後訓練流程專注於編碼和代理任務。該公司為數學、程式碼、代理行為和指令遵循分別訓練專家模型,然後透過數十個教師模型的同策略蒸餾將其合併回單一模型。工具呼叫獲得專門處理:專用的呼叫格式可減少參數逃逸和格式錯誤,而交錯式思考則在工具回傳結果時保留先前的推理。DSec 系統提供數十萬個並行沙箱,讓模型練習執行程式碼、閱讀錯誤訊息並進行疊代。
結果:V4 Flash 在 Terminal Bench 2.1 上獲得 82.7 分,在針對價格效能調整後,於 Arena 的前端編碼排行榜上領先 Claude Opus 4.8 Thinking。
誰受到擠壓
受衝擊最深的模型既非最弱也非最強。小型廉價模型仍可處理分類、提取和路由任務。尖端旗艦模型仍是困難推理任務和高失敗成本情境的首選。受到擠壓的是中間層——那些比 V4 Flash 高几分但成本高出數十倍,且在 V4 Flash 無法完成的任務上也未必更可靠的模型。
DeepSeek 的「斬殺線」不需要成為最佳模型。它只需要在大多數情況下表現足夠好,同時價格讓高階替代方案難以合理化。當一個模型成本高出 85 倍卻僅多出六個基準分數時,預設選擇自然會改變。
壓力也延伸至本地部署。社群專案 DwarfStar 已將 V4 Flash 的權重——完整版約 167 GB——量化至 q2 版本,可在 96 GB 或 128 GB 統一記憶體裝置上運行,部分 Mac 的短上下文速度超過每秒 20 個 token。一台 4,699 美元的 DGX Spark 工作站,按 V4 Flash 的 API 定價計算,約相當於 1,680 億個輸出 token——尚未計入電力、維護和除錯成本。
DeepSeek 完成了超過 70 億美元的首輪外部融資,使其有底氣在搶佔市佔率的同時補貼激進的定價策略。該公司今年稍早已將 75% 的降價永久化,競爭對手也紛紛跟進:OpenAI 大幅下調 GPT-5.6 的定價,Luna 的輸出價格從每百萬 token 6 美元降至 1.2 美元。
Sam Altman 在 7 月底的播客節目中表示,OpenAI 預期將獲得龐大的使用量,因此不需要極高的利潤率來攤平訓練成本。這一邏輯與 DeepSeek 的押注如出一轍:當代理型工作負載使 token 消耗量倍增時,即使每次呼叫的利潤微薄,也能持續複利累積。
對投資人而言,問題在於高階 AI 定價能否在代理時代存活。如果一個每次基準任務僅收費 3 美分的模型就能處理大多數編碼和代理工作,那麼昂貴的模型就必須證明那些額外的基準分數究竟價值何在。OpenAI 和 Anthropic 建立在高階定價假設之上的 IPO 估值,正面臨中國實驗室廉價開源模型浪潮的壓力。舉證責任已發生轉移。
本文僅供資訊參考,不構成投資建議。