重點摘要:
- 阿里巴巴於7月21日推出Qwen-Image-3.0,支援最多4,500 Token的提示詞輸入
- 該模型原生支援12種語言文字渲染及20多種字型
- 瞄準商業設計應用場景,包括多語言海報與分鏡腳本
重點摘要:

阿里巴巴的新款影像模型可在單一提示詞中解析4,500 Token的指令,生成帶有12種語言文字渲染的圖表——這項能力能降低多語言商業內容的製作成本。
阿里雲於7月21日推出Qwen-Image-3.0,這款影像生成模型可接受最多4,500 Token的輸入,並以20多種字型原生渲染12種語言的文字,目標瞄準商業設計市場。
「這是該團隊首款能夠處理超長指令的影像模型,可在單一輸出中結合公式符號、幾何形狀與邏輯推理步驟,」Qwen團隊在新聞稿中表示。
該模型能夠生成知識圖譜、複雜的UI佈局以及包含渲染文字的多元素圖形——解決了早期影像生成器的一大頑疾,那些模型經常產出難以辨識或扭曲變形的文字。Qwen-Image-3.0支援12種語言的原生文字渲染,減少了多語言海報、電影分鏡腳本及漫畫版面上手動後製編輯的需求。
這項發表加劇了生成式AI市場的競爭,阿里巴巴在此領域正面對壘OpenAI的DALL-E、Midjourney,以及百度與字節跳動等中國競爭對手。阿里巴巴尚未公布Qwen-Image-3.0獨立API存取的定價,但該模型可透過其雲端平台使用。
文字渲染仍是業界最棘手的難題
大多數影像生成模型在處理文字時表現不佳,因為它們將文字視為視覺模式而非語言符號,經常產生拼寫錯誤或扭曲的單詞。該公司表示,Qwen-Image-3.0的原生渲染管線透過將文字視為獨立的生成層,繞過了這項限制。這種方法與OpenAI在2023年底透過DALL-E 3增強的文本能力所展示的方向相似,不過阿里巴巴聲稱其模型開箱即支援更多語言與字型。
4,500 Token的輸入限制——約等於3,400個英文單詞——讓用戶能夠在單一提示詞中指定詳細的佈局指示、配色方案與文字位置,相較之下,競爭對手的典型限制為1,000至2,000 Token。這種更長的上下文窗口使該模型適合生成多格分鏡腳本、帶有編號步驟的教學圖表,以及標有說明的UI模型圖。
對阿里巴巴而言,在中國科技公司競相將生成式AI商業化之際,這款模型強化了其雲端AI產品組合。該公司的雲端事業部在3月季度報告營收為417億元人民幣(約58億美元),其中AI相關收入年增率達到三位數。Qwen-Image-3.0加入了一個已包含7月19日發表的Qwen 3.8大型語言模型的產品系列,該模型擁有2.4兆個參數。
根據彭博數據,在Qwen 3.8發布後,阿里巴巴在香港上市的股價一度上漲5.4%。該公司尚未透露Qwen-Image-3.0將作為獨立付費服務提供,還是整合到現有的雲端訂閱方案中。
本文僅供資訊參考,不構成投資建議。