字節跳動正處於早期討論階段,計劃訓練一個超過5萬億參數的模型,其規模將使其成為中國迄今已知最大的AI模型,且領先幅度極大。
字節跳動正處於早期討論階段,計劃訓練一個超過5萬億參數的模型,其規模將使其成為中國迄今已知最大的AI模型,且領先幅度極大。

字節跳動正處於早期洽談階段,計劃訓練一個超過5萬億參數的模型,超越阿里巴巴的Qwen 3.8-Max及月之暗面(Moonshot AI)的K3,成為中國以參數規模計算最大的已知AI模型。
據中國媒體《晚點》(LatePost)引述知情人士報導,該計劃將由字節跳動Seed基礎模型部門負責人項亮主導,並與負責大型語言模型預訓練數據的沈科合作。
擬議中的模型參數規模將超過月之暗面K3的兩倍——K3以2.8萬億參數推出,同時也將超越阿里巴巴Qwen 3.8-Max的2.4萬億參數。Seed正在重組組織架構、明確職責分工,並為該項目調配資源。該計劃仍處於早期階段,並不能保證最終模型會正式發布。
一個5萬億參數的模型,將標誌著中國前沿AI雄心的一次重大升級,可能重塑字節跳動、阿里巴巴與月之暗面之間的競爭格局。同時,這也將推高算力採購與訓練成本的門檻,因為這些成本會隨參數規模呈非線性增長。
訓練如此規模的模型需要巨大的基礎設施支撐。據《數字智能前線》引述一家中國大型科技公司高層員工的說法,Anthropic僅用於訓練的代碼token就約達4.2萬億,其運營的GPU算力超過中國所有廠商的總和。字節跳動需要確保可比的算力資源,而考慮到美國對先進晶片的出口管制,這是一項重大挑戰。
參數競賽並非純粹的學術問題。一般而言,規模更大的模型表現出更高的智慧水平,不過規模與能力之間的關係存在邊際效益遞減。月之暗面於今年稍早發布的K3證明,一個2.8萬億參數的模型可以在程式設計與推理基準上取得顯著進步。根據第三方行業數據,K3發布後,該公司每日API銷售額增長至少六倍。
此舉將進一步加劇中國AI產業的競爭。阿里巴巴的Qwen系列與月之暗面的Kimi一直在爭奪模型霸主地位,而DeepSeek於2025年發布的R1重新設定了業界對中國模型能力的期望。智譜AI(Zhipu AI)也已崛起為有力競爭者,其GLM-5.1模型的程式設計能力大致相當於Anthropic的Claude Code。
字節跳動的Seed基礎模型部門一直在將AI業務版圖拓展至消費應用之外。該公司的Trae程式設計助手截至6月已擁有約800萬用戶,其Seedance 2.0影片生成模型則於2月推出。一個5萬億參數的基礎模型將使字節跳動能夠在中國AI研究前沿直接與阿里巴巴和月之暗面競爭。
由於該計劃仍處於早期階段,模型可能永遠不會正式推出。但Seed的組織重組表明,字節跳動正為此投入大量資源。對於關注中國AI產業的投資者而言,關鍵問題在於:字節跳動能否確保訓練如此規模模型所需的算力基礎設施,以及最終模型是否值得其高昂的訓練成本。如果字節跳動加速算力採購,香港上市科技股及AI基礎設施供應商可能出現情緒波動,不過該計劃的投機性質限制了其短期基本面影響。
本文僅供參考,不構成投資建議。