阿里巴巴($BABA)公開了整合影像生成與編輯功能的7B規模開源模型Qwen-Image-2.1,支援透明影像生成,以及最多10張參考圖片的合成。
Qwen官方部落格表示,Qwen-Image-2.1將文字生成影像與既有影像修改功能整合到同一模型中。
使用者可輸入多張參考圖片進行多影像合成,也能以圓形選取特定區域,或使用筆刷進行局部修改。
透明影像的生成與編輯也被納入基本功能。其特色是無須將影像生成與編輯工作拆分至不同工具,而是可由單一模型處理。
Qwen表示,模型強化了將人物與商品同多張參考圖片合成時維持原始外觀的能力。Qwen也說明,影像中的文字排版品質有所改善,但未提供獨立基準測試數據或比較對象。
Qwen先前在Qwen-Image介紹文章中,將影像文字呈現與編輯功能列為主要特色。既有模型規模為20B,本次模型則將視覺生成部分配置為7B。
Qwen-Image-2.1的實際品質與執行負擔,仍有待根據公開版本的使用環境及後續評估進一步確認。
留言 0