上星期有讀者私訊我:「小編,我見你們寫 Qwen 出圖好厲害,但我打開網站完全唔知點入手,係咪一定要識寫程式?」

答案是:完全不用。這篇就是為你寫的。

過去一星期,Qwen-Image-2.1 在 HuggingFace 的下載量衝破 360 萬次,相關的社群版本(ComfyUI 單檔版)單週下載也超過 360 萬,加上 GGUF 量化版接近 88 萬次,換句話說,全球已經有幾百萬人在用這套模型出圖。它最吸引香港和台灣用戶的地方,是中文字生成能力——以往 AI 出圖最弱的一環就是中文字,十次有九次變成鬼畫符,而 Qwen-Image-2.1 在這方面有明顯進步。

這篇文章會帶你走完三個階段:先搞懂它跟其他出圖工具有什麼分別,再一步步設定好你的環境,最後用三個實戰情境(中文海報、商品圖、社群貼文圖)教你寫提示詞。讀完你就能自己出圖,不用再求人。

Qwen-Image-2.1 到底是什麼?跟 Midjourney 有什麼不同?

先講清楚定位。Qwen-Image-2.1 是阿里巴巴通義千問團隊推出的開源圖像生成模型,你可以把它想成「一個可以下載返屋企、自己電腦跑的出圖引擎」。跟 Midjourney、DALL·E 這類要付月費、在網頁上操作的服務相比,它有幾個實際差異。

第一是開源與免費。模型權重公開,你可以本地跑、可以商用(需留意授權條款),不用每個月付 10 至 30 美元。對經常要出大量圖的小店、自媒體來說,這個成本差異很可觀。

第二是中文理解與中文字渲染。這是它最大的賣點。你打「一杯珍珠奶茶,杯身寫住『香港限定』」,它真的會嘗試把「香港限定」四個中文字畫出來,而不是給你一堆亂碼線條。當然,字數越多越容易出錯,建議每次控制在 2 至 6 個字以內。

第三是可控性高。因為是開源,社群可以做各種微調版本、量化版本,甚至有人做了「無審查版」讓創作更自由。你在 HuggingFace 上見到的 Comfy-Org 版本、GGUF 版本,都是為了讓不同硬件的用戶都能跑得動。

那它有什麼缺點?本地跑需要顯卡。如果你的電腦只有內顯或者入門級顯示卡,會跑得非常慢,甚至跑不動。這種情況下,用雲端服務(例如 HuggingFace 的線上 Demo 或第三方 API)會是更實際的選擇。

新手怎麼開始?三種方法由易到難

方法一:直接用網頁版,零安裝。 打開 HuggingFace 上 Qwen-Image-2.1 的模型頁面,右邊通常有一個「Spaces」或線上試用入口,點進去輸入提示詞就能出圖。這是最快的方法,適合只想試水溫的人。缺點是免費額度有限,排隊時間可能較長,而且不能儲存自訂設定。

方法二:用 ComfyUI 搭配單檔模型。 這是目前社群最主流的工作流。步驟如下:

第一步,到 ComfyUI 官方網站下載對應你系統的安裝包(Windows 有可攜版,解壓即用)。第二步,到 HuggingFace 搜尋「Comfy-Org/Qwen-Image-2.1」,下載那個 diffusion-single-file 的 safetensors 檔案,放進 ComfyUI 的 models/checkpoints 資料夾。第三步,另外下載對應的 text encoder 和 VAE 檔案,分別放進 models/clip 和 models/vae。第四步,開啟 ComfyUI,載入官方提供的 Qwen 範例工作流,把 checkpoint 節點指向你剛下載的檔案,就可以開始出圖。

聽起來複雜,但其實就是「下載檔案、放對資料夾、開範例工作流」三件事。第一次設定大約 20 分鐘,之後每次開圖只要 10 秒。

方法三:用 GGUF 量化版,舊電腦救星。 如果你的顯示卡只有 8GB 甚至 6GB 顯存,用原版模型會爆顯存。這時候改用 abenzerps/Qwen-Image-2.1-Uncensored-GGUF 這類量化版本,配合 ComfyUI 的 GGUF 節點,可以在較低硬件規格下跑得動,代價是細節會稍為犧牲。這個版本單週下載接近 88 萬次,可見需求有多大。

提示詞怎麼寫?三個實戰範本直接抄

寫提示詞不是寫作文,重點是結構。一個好用的公式是:主體 + 細節描述 + 風格 + 光線 + 畫質要求 + 文字內容。

情境一:中文節慶海報。 假設你要做中秋節促銷圖。提示詞可以這樣寫:「一張中秋節月餅禮盒宣傳海報,深藍色夜空配金色滿月,中央放一盒精緻月餅,海報上方有中文字『中秋團圓』,下方小字『限時八折』,商業攝影風格,柔和暖光,高解析度」。關鍵是把文字內容用引號標出來,並且明確講位置(上方、下方、中央)。

情境二:商品主圖。 賣手沖咖啡器具的話:「白色背景的產品攝影,一支玻璃手沖壺放在木質托盤上,旁邊散落幾顆咖啡豆,壺身標籤寫『手沖專用』,簡約北歐風格,柔和的自然側光,超高細節,電商主圖構圖」。記得標明「白色背景」和「電商主圖構圖」,出來的圖才容易直接上架。

情境三:社群貼文圖。 想發一張語錄圖:「一張簡約風格的方形社群圖片,米白色背景,中央用黑色手寫字體寫『今日事今日畢』,右下角有一個小小的綠色植物插畫,極簡風格,留白充足」。這類圖最容易被分享,重點是留白和文字清晰。

三個範本的共通點是:具體、有結構、文字加引號。新手最常犯的錯是只寫「一張漂亮的圖」,這種提示詞給任何模型都只會出隨機結果。

出圖失敗怎麼辦?四個常見問題排解

問題一:中文字變成亂碼。 這是最常見的。解決方法有三個:減少字數(控制在 6 字以內)、把文字放在引號內、以及明確描述文字顏色與位置。如果還是不行,可以考慮出圖後用 Canva 或 Photoshop 自己加上文字,反而更快更準。

問題二:圖片模糊或細節不足。 檢查你的步數(steps)設定,建議 20 至 30 步;採樣器可以試 euler 或 dpmpp_2m;另外在提示詞加上「高解析度」、「超高細節」這類詞彙會有幫助。

問題三:跑得很慢或直接當機。 大機會是顯存不足。先降低解析度(由 1024 降到 768),再考慮改用 GGUF 量化版。關掉其他佔用顯卡的程式(例如遊戲、影片剪輯軟件)也很有用。

問題四:出圖風格每次都不同。 這是因為隨機種子(seed)每次都在變。如果你想要一致的風格,把 seed 固定下來,只微調提示詞,就能做出系列感一致的圖。

重點回顧:今天你學到了什麼

第一,Qwen-Image-2.1 是開源、免費、中文能力強的出圖模型,適合香港台灣用戶處理中文內容。第二,新手可以從網頁版入手,進階用 ComfyUI 單檔模型,硬件較弱就用 GGUF 量化版。第三,提示詞要有結構:主體、細節、風格、光線、畫質、文字,六個元素缺一不可,文字記得加引號。第四,中文字出錯是常態,字數越少越穩,必要時後製補字。

最好的學習方式就是現在打開電腦試一次。先從最簡單的網頁版開始,出一張圖,感受一下它的能力邊界在哪裡。出圖這件事,看十篇文章不如自己動手做一次。

延伸閱讀

常見問題

Q: 我的電腦沒有獨立顯卡,還能用 Qwen-Image-2.1 嗎?

A: 可以,但建議用網頁版或雲端 API,不要嘗試本地安裝。本地跑圖對顯卡有一定要求,一般建議 8GB 顯存以上會比較順暢。如果你只有內顯,用 HuggingFace 的線上 Demo 或第三方 API 服務會實際得多,雖然可能要排隊或付少量費用,但省下來的時間和麻煩絕對值得。

Q: Qwen-Image-2.1 生成的圖可以商用嗎?

A: 需視乎授權條款,建議到 HuggingFace 模型頁面查看最新的 license 說明。一般開源模型會允許商用,但可能有附加條件(例如標註來源)。如果你是幫客戶做商業設計,建議先確認條款,必要時選用明確標示可商用的版本,避免日後爭議。

Q: 為什麼我打的英文字出得漂亮,中文字卻一團亂?

A: 這是目前多數圖像模型的通病。中文字筆畫複雜,模型訓練資料相對較少。實用建議是:中文字控制在 6 字以內、用引號標明、明確描述位置和顏色。如果要求非常精準(例如品牌名稱),最穩妥的做法是出圖後用設計軟件自己加上文字,效果一定比 AI 直接生成好。

Q: 出圖要等很久是正常的嗎?

A: 取決於你的硬件和設定。用中階顯卡出 1024x1024 的圖,大約 15 至 40 秒是正常範圍。如果超過兩分鐘,通常是顯存不足導致系統在調用記憶體,建議降低解析度或改用量化版本。另外,第一次載入模型會比較慢,之後同一個工作階段內會快很多。

Q: 我需要學寫程式才能用 ComfyUI 嗎?

A: 不需要。ComfyUI 是節點式介面,你用滑鼠拖拉節點、連接線條就可以,像砌積木一樣。官方和社群都有大量現成的工作流可以直接載入,你只要把模型檔案放對位置、把節點指向正確檔案就行。真正需要寫程式的只有自己開發自訂節點,一般出圖用戶完全用不到。