阿里於 7 月 21 日發布了最新的圖像生成基礎模型 Qwen-Image-3.0。該模型支持最大 4.5k Token 超長輸入,能夠一次生成涵蓋公式符號、幾何圖形、邏輯推導步驟等多元素融合的知識圖解及複雜的用户界面,同時支持 12 種語言和 20 多款字體的原生渲染。
根據報導瞭解,Qwen-Image-3.0 是千問圖像生成和編輯模型系列的第三代基礎模型,此模型在生成直播間頁面方面同樣具備卓越能力,能夠輕鬆實現與 GPT-Image-2 相媲美的效果。Qwen-Image-3.0 的一大重點在於提升模型對於複雜信息的承載能力,較前代模型在文本輸入長度上實現了 4.5 倍的增長。
Qwen-Image-3.0 提升了圖像生成的靈活性和效率
這意味著,在影視短劇分鏡、複雜信息圖、產品説明頁等需要超長提示詞輸入的場景中,使用者不再需要將需求壓縮成一句話,而是可以像撰寫需求文檔一樣,完整描述畫面結構、文字內容、視覺風格和排版細節,從而減少反覆生成和人工調試的成本。
憑藉 Qwen-Image-3.0 對語義並置和空間控制能力的把握,新模型可一次性生成涵蓋 9 種不同領域的九宮格知識圖解。此外,Qwen-Image-3.0 還能夠輕鬆理解複雜指令及畫面的邏輯嵌套關係,根據一條指令在同一幅圖中生成網頁、軟件界面、聊天窗口、海報等多類組合式視覺內容。
想睇更深入嘅 AI 模型與工程科技報道?
前往 The Base Principle 繁體中文 AI 新聞 →
