阿里巴巴的 Qwen3.8-Flash 僅憑60億個活躍參數即可達成前沿級性能,將訓練成本降低90%,並重新定義開放式權重AI的經濟學。
阿里巴巴的 Qwen3.8-Flash 僅憑60億個活躍參數即可達成前沿級性能,將訓練成本降低90%,並重新定義開放式權重AI的經濟學。

阿里巴巴的 Qwen3.8-Flash 僅啟動其1000億參數中的60億即可匹敵前沿性能,將訓練成本降低90%,並以低於DeepSeek-V4-Flash三分之二的定價切入市場。
「下一波 Qwen 浪潮即將來臨,」阿里巴巴 Qwen 團隊在 X 平台上表示,該公司於8月26日在 Qwen Office 平台及 Qwen AI API 上發布了這款模型。
Qwen3.8-Flash 採用全新架構,透過稀疏激活實現效率提升——每次推論僅觸發1000億總參數中的60億。該模型定價為每百萬輸入 token 1元人民幣、每百萬輸出 token 3元人民幣,約為 DeepSeek-V4-Flash 價格的三分之一。據該公司表示,與 Qwen3.7-Plus 相比,訓練成本下降近90%。阿里巴巴未揭露 Qwen3.8-Flash 聲稱超越 Claude Opus 4.6 時的基準測試條件。
本次發布緊隨本月稍早 Qwen3.8-Max 的登場,後者是一款擁有2.4兆參數的開放式權重模型,在 SWE-bench Pro 上取得67.7分——擊敗 OpenAI GPT-5.6 Sol 的64.6分——定價為每百萬輸入 token 2美元、每百萬輸出 token 6美元。該消息公布後,阿里巴巴的美國存託憑證(ADR)上漲逾4%。該公司亦預定於日本時間8月27日凌晨12時發布 Qwen3.8-Flash-Next,這是一款基於 Qwen4 架構的多模態混合專家模型,在完整 Qwen4 系列推出前向開發者提供早期存取權限。
60億活躍參數的設計使 Qwen3.8-Flash 躋身於以極低運算成本達成前沿成果的模型之列。Anthropic 的 Claude Opus 4.6 Thinking 在聚合 SWE-bench Pro 排行榜上以約80分領先,但其 API 定價未在相同比較表中公開揭露。OpenAI 的 GPT-5.6 Sol 在其直接 API 上收費每百萬輸入 token 5美元、每百萬輸出 token 30美元,且對超過272,000個 token 的輸入加收2倍附加費。
阿里巴巴的定價策略瞄準重視成本效益與客製化的開發者。開放式權重策略——Qwen3.8-Max 的檢查點自8月12日至13日起已在 Hugging Face 和 ModelScope 上架——直接與 Meta 的 Llama 系列及 Mistral 在自架部署領域競爭。Qwen3.8-Max 開放權重採用客製授權,若企業在 Model-as-a-Service 或 AI 工作助理業務中使用該模型且累計營收超過5000萬美元,則需另行簽訂商業條款。只要不向第三方提供軟體或輸出內容,內部企業使用仍保持免費。
Qwen3.8-Flash 遵循 Qwen3.5-Flash 確立的模式,後者為 Qwen3.5-35B-A3B(總參數350億、活躍參數30億)的功能增強版本。Qwen3.8-Flash 是否對應同等規模的 Qwen3.8-35B-A3B 仍不清楚,因為阿里巴巴尚未揭露預定於8月27日發布的 Flash-Next 變體的參數數量。
據阿里巴巴表示,其平頭哥(T-Head)AI 晶片為外部客戶提供超過60%的公司晶片產能,使公司免受美國出口管制影響——該管制限制 Nvidia 先進 GPU 進入中國。自有晶片與積極的模型定價相結合,強化了阿里巴巴雲端與AI營收的敘事。Qwen3.8-Max 發布後,BABA 美國存託憑證上漲逾4%,而 Qwen3.8-Flash 的發布延續了這股動能。
更廣泛的意涵是:開放式權重模型與封閉式前沿 API 之間的差距正在以比多數開發者預期更快的速度收窄。Qwen3.8-Max 在 SWE-bench Pro 上以67.7分對比 GPT-5.6 Sol 的64.6分——同時輸出價格僅為後者的約五分之一——是迄今最清晰的數據點,顯示開放式與前沿模型在程式碼基準上的差距已縮小至近乎持平。Qwen3.8-Max 在 Terminal-Bench 2.1 上亦取得86.6分,GPQA Diamond 上取得92.6分,阿里巴巴描述這些進步主要集中在多模態與代理式(agentic)類別,而非一般推理能力。
對於評估模型部署的企業而言,選擇日益取決於每個基準點的成本。Qwen3.8-Max 的6美元輸出價格除以67.7的 SWE-bench Pro 分數,約為每點0.089美元;相比之下,GPT-5.6 Sol 在64.6分下收取30美元輸出價格——約每點0.46美元,差距超過5倍。自行架設開放式權重檢查點可完全免除按 token 計費的成本,不過這款2.4兆參數的模型需要配備多 GPU 的推論叢集,並運行 vLLM 或 SGLang 等框架。
本文僅供參考,不構成投資建議。