DeepSeek V4-Flash每次基準測試成本約3美分,比Anthropic Claude Fable 5便宜約105倍,重新定義企業應為日常AI支付的價格。
DeepSeek V4-Flash每次基準測試成本約3美分,比Anthropic Claude Fable 5便宜約105倍,重新定義企業應為日常AI支付的價格。

DeepSeek V4-Flash是目前運行成本最便宜的知名AI模型,每次基準測試估計僅需3美分,而Anthropic的Claude Fable 5則需3.15美元,兩者差距約105倍,對西方AI定價構成壓力。
這項估算來自總部位於舊金山的研究公司Artificial Analysis,該公司衡量的是每項完成任務的成本,而非公布的token價格。該公司在基準報告中表示:「一個標價低廉的模型,如果生成答案需要明顯更多的步驟,最終仍可能成本高昂。」
DeepSeek對V4-Flash收取每百萬輸入token 0.14美元、每百萬輸出token 0.28美元的費用,該模型已於7月31日進入公開API測試版。該模型在Artificial Analysis的智慧指數中獲得100分中的50分,與Google的Gemini 3.6 Flash持平,落後Meta的Muse Spark 1.1和Z.AI的GLM-5.2一分。Moonshot AI的Kimi K3得分57,而Anthropic的Claude Opus 5、Fable 5以及OpenAI的GPT-5.6 Sol各領先九分以上。
成本差距重新掀起了DeepSeek R1模型在2025年初引發的投資回報辯論,當時該模型導致全球科技股拋售,並引發對美國AI支出的質疑。據消息人士透露,DeepSeek正在為可能的首次公開募股做準備,同時也在籌備預計於8月推出的更強大V4-Pro模型。
V4-Flash-0731並非比4月預覽版更大的模型——它是同一個2,840億參數的專家混合架構,每次token觸發約130億個參數,上下文視窗為一百萬token。改變的僅是後期訓練。結果是:代理式編碼基準DeepSWE從7.3躍升至54.4,實現七倍提升,而推論成本零變化。
這種脫鉤對任何編列代理型技術棧預算的人都很重要。如果單一後期訓練週期就能讓平價模型超越自家旗艦——V4-Flash-0731在DeepSeek發布的全部九個代理基準測試中均勝過V4-Pro-Preview——那麼能力與算力支出已部分分離,僅靠模型規模建立的領先優勢已不再構成持久的護城河。
以輸入加權四比一(代理工作負載的典型形態)計算,V4-Flash混合成本約為每百萬token 0.17美元。相比之下,Claude Opus 4.8按牌價計算,混合成本約為每百萬token 9.00美元。在DeepSeek自家的Terminal Bench 2.1上,Opus 4.8得分85.0,而V4-Flash為82.7——差距2.3分,但每分成本約為52倍。
這筆交易是否值得取決於工作負載。對於非關鍵內部工具的程式碼審查,溢價很難合理化。對於觸及生產基礎設施的自動代理,2.3分可能就足以構成全部理由。
開放權重使用者有一個陷阱:Hugging Face儲存庫仍以MIT授權託管4月的預覽檢查點。Build 0731僅存在於DeepSeek的端點及OpenRouter等第三方主機之後。今天下載V4-Flash的團隊獲得的是DeepSWE得分7.3的版本,而非54.4。
在企業採購團隊正以每次完成成本比較供應商的時刻,定價壓力落在西方供應商身上。DeepSeek每次測試3美分的成績為他們提供了一個參考點,比Claude Fable 5便宜約105倍,比GPT-5.6 Sol便宜超過60倍。阿里巴巴週一發布了其最大模型Qwen3.8-Max,也在推行同樣的「以更低成本做到夠好」策略。對投資者而言,問題在於:在一個50分模型運行成本僅3美分的市場中,高溢價AI定價能否存活——以及作為當前資本支出週期支柱的美國AI基礎設施支出,是否仍值得其代價。
本文僅供參考,不構成投資建議。