MiniMax H3 使這家中國 AI 新創公司與 OpenAI 及 Google 在全模態生成領域直接競爭。
MiniMax H3 使這家中國 AI 新創公司與 OpenAI 及 Google 在全模態生成領域直接競爭。

MINIMAX-W 股價在港股收盤飆升 12.86% 至 230 港元,此前這家香港上市的 AI 公司發布了 MiniMax H3——一款全模態生成式模型,能以原生雙聲道音訊生成最高 15 秒的 2K 解析度影片。
該公司表示,此模型支援對文字、影像、影片及音訊輸入的統一理解,並計畫在數日內開放模型權重,惟須遵守相關法律法規。截至午盤,成交量達 426.9 萬股,成交額為 9.98 億港元;賣空金額達 8,191 萬美元,佔總成交額的 8.207%。
此次發布使 MiniMax 與 OpenAI 的 GPT-4o 及 Google 的 Gemini 直接展開競爭,後兩者均已支援多模態輸入與輸出。透過開放模型權重,MiniMax 正遵循 Meta 的 Llama 及阿里巴巴的 Qwen 所採用的開源策略,押注開發者的採用將彌補其缺乏專有平台的劣勢。
開放模型權重的決定——有別於 OpenAI 與 Google 的閉源路線——可加速希望在自己基礎設施上部署該模型的開發者採用。Meta 的 Llama 系列已證明這一模式奏效,自 2023 年首次亮相以來已成為下載量最高的開放權重模型家族。阿里巴巴的 Qwen 在中國也走過類似路徑,其 Qwen2.5 系列模型在 Hugging Face 上名列前茅的開放權重發布之一。
MiniMax 的雙聲道音訊生成是一大差異化優勢。目前大多數多模態模型(包括 GPT-4o 和 Gemini)雖能生成音訊,但通常僅產出單一音軌。原生雙聲道技術可實現空間音訊輸出,這對影片製作、遊戲及沉浸式媒體應用至關重要。15 秒的 2K 影片輸出亦超過多數競品模型的典型生成長度,不過 MiniMax 並未披露這些能力的測試條件。
向全模態模型轉型反映出行業的更廣泛趨勢。OpenAI 於 2024 年 5 月發布的 GPT-4o 是首批在單一模型中原生處理文字、影像及音訊輸入的模型之一。Google 的 Gemini 1.5 Pro 則將此延伸至影片理解。MiniMax 的 H3 更進一步,原生生成影片與音訊,而非為每種模態拼接獨立的模型。
該公司決定在數日內──而非發布數月後──開放權重,反映其對模型技術基礎的信心。然而,中國的監管合規要求增添了不確定性。該公司表示,此次發布「須遵守相關法律法規」,這可能延遲或限制部分司法管轄區的可取得性。
單日 12.86% 的漲幅反映投資人對 MiniMax 全模態能力的熱情,但該公司面對的是競爭激烈的市場。單在中國,阿里巴巴的 Qwen、百度的文心以及字節跳動的豆包都在爭奪開發者的心智佔有率。開放權重策略或有助於 MiniMax 實現差異化,但這也意味著該公司必須透過企業服務及 API 使用來變現,而非依賴專有模型存取。
MINIMAX-W 在香港交易所上市,股票代碼為 00100.HK。該公司尚未披露與 H3 發布相關的營收或估值數據。中國整體 AI 模型市場競爭日益激烈,本土參與者競相追趕西方能力,同時須因應先進晶片的出口管制。MiniMax 的全模態路線──結合文字、影像、影片及音訊的理解與生成──可望在媒體與娛樂應用中開闢利基市場,因為雙聲道音訊與高解析度影片輸出是這些領域的關鍵要求。
該股午盤每股上漲 26.20 港元,成交額達 9.98 億港元,顯示機構投資人參與積極。賣空佔總成交額的 8.207%,顯示部分投資人正押注此波漲勢回落,短期內可能帶來波動。該公司的下一個里程碑將是模型權重的實際發布,屆時開源社群的反應將決定市場熱情是獲得印證還是受到冷卻。
本文僅供參考,不構成投資建議。