阿里巴巴万相3.0影片模型於8月6日進入公開測試,支援生成30秒片段,720p解析度每秒收費0.6元。
阿里巴巴万相3.0影片模型於8月6日進入公開測試,支援生成30秒片段,720p解析度每秒收費0.6元。

阿里巴巴集團旗下的萬相3.0影片生成模型於8月6日進入公開測試階段,支援單次生成30秒片段,720p解析度每秒收費0.6元人民幣,加劇了中國AI影片市場的競爭態勢。
阿里巴巴在發布公告中表示,該模型「致力於精準還原真實世界——千人千面,每一幀畫面既真實又可信」,強調視覺逼真度而非單純的生成時長。
萬相3.0支援文件輸入,包括doc、xls、ppt、pdf和md格式——這是該模型系列的首創——同時也支援文字、圖片、音訊和影片等多種模態。單次生成30秒的能力讓創作者能夠一次性完整表達敘事意圖,相較於早期影片模型一般只能生成5至10秒的片段,這是一個顯著的升級。以720p解析度每秒0.6元的價格計算,一個完整的30秒片段成本為18元人民幣。
此次發布使阿里巴巴的影片生成雄心與OpenAI的Sora、Google的Veo以及字節跳動的即夢和快手可靈等國內競爭對手直接對壘。對阿里巴巴而言,在超大型雲端服務商正投入近六千億美元於全球AI資本支出的當下,該模型強化了其雲端AI產品組合,根據行業數據顯示。
文件格式支援是一項顯著的差異化優勢。大多數影片生成模型僅接受文字提示、參考圖片或音訊軌道,但萬相3.0具備讀取結構化文件的能力,意味著用戶可以向其輸入簡報投影片、試算表或PDF文件,直接從商業素材生成影片內容。這對行銷、教育和企業傳播領域的企業用戶具有吸引力——這些正是阿里雲在擴展AI服務過程中所瞄準的目標市場。
該模型的真實世界渲染能力也解決了AI影片的一個長期痛點:維持臉部、物體和環境之間的一致性。阿里巴巴表示,萬相3.0能實現「千人千面」,意味著每個角色在跨幀畫面中都能保持獨特的視覺識別。這對於品牌一致性和角色辨識至關重要的商業應用具有重要意義——如果發言人在每一幀畫面中都長得不同,將嚴重削弱AI生成企業內容的可信度。
30秒的生成窗口本身也具有重要意義。大多數面向消費者的影片模型只能生成5至10秒的片段,用戶需要拼接多次生成結果才能獲得較長時間的序列。萬相3.0的單次30秒輸出降低了這種複雜性,可能使該模型在短影片廣告、產品示範和社群媒體內容等更需要連續長鏡頭的應用場景中更具吸引力。
以720p每秒0.6元的定價,萬相3.0的價格低於西方競爭對手。OpenAI的Sora和Google的Veo尚未公布每秒定價,但企業級AI影片工具通常對同等輸出收取明顯更高的費用。這一價格點反映了中國AI供應商在成本上展開競爭的整體趨勢——阿里巴巴的通義千問大型語言模型同樣以低於西方同類產品的價格定價,而字節跳動的豆包模型更進一步壓低了價格。
對阿里巴巴而言,該影片模型是其更廣泛AI變現策略的一部分。公司雲端部門一直是主要的成長引擎,AI相關收入是關鍵驅動力。萬相3.0為阿里雲的AI產品組合新增了另一款產品,有望吸引媒體、廣告和內容創作等業務需求。公司股價受惠於AI熱潮,隨著阿里巴巴擴大其AI基礎設施版圖,投資者已將雲端持續成長納入估值預期。
競爭的賭注不僅限於影片生成。阿里巴巴的AI投資橫跨大型語言模型(通義千問)、雲端基礎設施以及目前的影片生成,使公司同時與西方超大型雲端服務商和國內競爭對手展開較量。Nvidia的GPU供應限制以及更廣泛的AI基礎設施建設,仍是決定阿里巴巴能否快速擴展萬相3.0部署規模的關鍵因素。公司能否將AI模型領先優勢轉化為雲端營收,將決定目前的估值溢價能否維持。
本文僅供資訊參考,不構成投資建議。