上星期 Qwen 團隊把 Qwen-Image 2.1 開源放出,短短七天在 HuggingFace 就衝到兩千七百多個讚、七萬多次下載,社群甚至有人把它拿去做「無審查版」GGUF 量化,下載量直接破百萬。很多人看到新聞只覺得「哦,又多一個生圖模型」,但其實這件事對香港、台灣的小編、設計師、電商賣家來說,意義大得多——你終於可以用中文提示詞,做出接近商用等級的插圖,而且不用每個月付訂閱費。
這篇不是新聞速報,是一篇實戰教學。我會帶你從零開始,先講清楚 Qwen-Image 2.1 到底強在哪裡,再教你三種使用方式:網頁版最快、API 最穩定、本地部署最自由。最後附上我實測有效的提示詞公式,以及新手最常踩的五個坑。看完你就能自己生出一張能放上商品頁、貼文封面、甚至簡報首圖的成品。
Qwen-Image 2.1 到底強在哪?為什麼值得你花時間學?
先講結論:它最強的地方是「中文理解」和「文字渲染」。過去我們用 Midjourney 或 Stable Diffusion,最大的痛點是提示詞要用英文,而且畫面裡只要出現中文字,幾乎一定變成鬼畫符。Qwen-Image 2.1 在這兩件事上有明顯進步,你直接打「一杯手沖咖啡,木桌上,旁邊放一本書,暖色調,俯拍」它就能懂,而且畫面中要放「期間限定」四個中文字,它渲染出來的字型是有機會可辨識的。
第二個優勢是開源。這代表兩件事:第一,你可以免費商用(記得還是要看官方授權條款,Qwen 系列通常採 Apache 2.0 或類似寬鬆授權,但仍建議自行確認最新版本);第二,你可以把它裝在自己的電腦或租來的雲端 GPU 上,不受平台審查、不受額度限制。對接案設計師來說,這等於多了一台不會罷工的生圖機器。
第三個優勢是生態系已經起來了。HuggingFace 上不只有官方版本,還有社群做的 GGUF 量化版,讓你在只有 8GB、12GB VRAM 的顯示卡上也能跑。這對很多用 MacBook 或中階顯卡的香港台灣創作者來說,是能否入場的關鍵。
方法一:網頁版最快上手,五分鐘生出第一張圖
如果你只想先試水溫,不想裝任何東西,最快的方式是走網頁版或通義萬相的入口。步驟很簡單:
第一步,打開瀏覽器搜尋「Qwen Image 線上生成」或直接進阿里雲的通義萬相頁面,註冊一個帳號。第二步,找到「文生圖」的介面,通常會有一個大大的輸入框。第三步,把你想像的畫面用中文寫進去,例如「香港茶餐廳的早晨,陽光從鐵閘透進來,一位阿伯在看報紙,寫實攝影風格」。第四步,選擇尺寸,社群貼文建議用 1:1 或 4:5,簡報用 16:9。第五步,按下生成,通常十到三十秒就會出四張候選圖。
網頁版的優點是零門檻,缺點是有每日額度限制、排隊時間不固定,而且你沒辦法控制太多進階參數。但對「我只想趕快做一張貼文圖」的人來說,這已經非常夠用。我實測用中文短句就能出不錯的結果,不需要像以前那樣硬背英文咒語。
方法二:用 API 接進你的工作流程,批量出圖
如果你是小編或電商營運,每天要生十張以上的圖,那 API 會是你的好朋友。以阿里雲百鍊平台為例,你可以在後台申請 API Key,然後用 Python 呼叫。核心程式碼大概長這樣:
import requests
url = "https://dashscope.aliyuncs.com/api/v1/services/aigc/text2image/image-synthesis"
headers = {
"Authorization": "Bearer YOUR_API_KEY",
"Content-Type": "application/json"
}
payload = {
"model": "qwen-image-2.1",
"input": {"prompt": "台灣夜市,霓虹燈,人潮,寫實攝影,35mm"},
"parameters": {"size": "1024*1024", "n": 4}
}
r = requests.post(url, headers=headers, json=payload)
print(r.json())
把 YOUR_API_KEY 換成你自己的金鑰就能跑。這樣你就能把生圖功能接進 Google Sheet、Notion 或你自己的排程腳本,例如每天早上自動為今天的貼文生三張候選圖。成本通常按張計費,比訂閱製圖工具便宜不少,而且量大時更好控管預算。
方法三:本地部署 ComfyUI,完全免費又不受限
這是最自由、也最適合進階玩家的路線。你需要一張至少 8GB VRAM 的 NVIDIA 顯卡,或 Apple Silicon 的 Mac(M 系列晶片)。流程如下:
第一步,安裝 ComfyUI,官方 GitHub 有 Windows 一鍵包,Mac 用 pip 安裝也可以。第二步,到 HuggingFace 搜尋「Qwen-Image-2.1 GGUF」,下載社群量化版本,通常會分 Q4、Q5、Q8 不同精度,VRAM 越小就選越低的量化。第三步,把模型檔放進 ComfyUI 的 models/checkpoints 或對應資料夾。第四步,載入官方提供的範例 workflow,把 checkpoint 節點指向你下載的模型。第五步,在提示詞框打中文,按下 Queue Prompt,等它跑完。
本地部署最大的好處是零邊際成本,生一百張、一千張都一樣,而且完全離線、不怕審查。缺點是初次設定要花點時間,而且出圖速度取決於你的顯卡。以 RTX 4060 8GB 為例,1024×1024 一張大約二十到四十秒,還在可接受範圍。
提示詞怎麼寫?我實測有效的三段式公式
很多人卡在「不知道要打什麼」。我的建議是用三段式結構:主體 + 環境 + 風格。
主體就是畫面主角,例如「一位穿西裝的上班族」。環境是場景與光線,例如「中環街頭,黃昏,霓虹燈反射在濕地面」。風格是攝影或繪畫語言,例如「寫實攝影,85mm 鏡頭,淺景深」。組合起來就是:「一位穿西裝的上班族,中環街頭,黃昏,霓虹燈反射在濕地面,寫實攝影,85mm 鏡頭,淺景深」。
三個實用技巧:第一,中文提示詞不用怕太口語,Qwen 對自然語句的理解比英文模型好。第二,要畫面出現文字時,把文字用引號包起來,例如「海報上寫著『限時優惠』」,成功率會提高。第三,負面提示詞(negative prompt)可以放「模糊、變形、多餘手指」,能明顯改善人像品質。
新手最常踩的五個坑,先避開就贏一半
第一個坑是提示詞太長太雜。塞了二十個形容詞,模型反而抓不到重點。建議控制在六十到一百字內。
第二個坑是期待一次就中。生圖是機率遊戲,一次生四張、挑最好的,再微調提示詞重跑,才是正常流程。
第三個坑是忽略解析度與比例。社群貼文用直式、簡報用橫式,一開始就設對,省下後製裁切時間。
第四個坑是以為開源就等於完全免費商用。授權條款會更新,商用前務必再看一次官方說明,尤其你要拿去印實體商品時。
第五個坑是硬體不夠還硬跑高精度模型。VRAM 不夠就老實用量化版,或改用網頁版與 API,不要讓電腦跑到當機。
總結一下:Qwen-Image 2.1 對香港台灣創作者的價值,在於它把「中文生圖」和「免費自架」這兩件事同時做到了。你不需要是工程師,只要照著上面三種方法挑一種開始,今天就能生出第一張能用的圖。先從網頁版試一張,覺得順手再往 API 或本地部署走,這條路我走過,真的不難。
延伸閱讀
常見問題
Q: Qwen-Image 2.1 可以免費商用嗎?
A: 多數 Qwen 系列模型採寬鬆開源授權,但商用前務必到官方模型頁確認最新授權條款,尤其是要印製實體商品或大量販售時,建議保留授權證明文件。
Q: 我的電腦只有 8GB VRAM,跑得動嗎?
A: 可以。下載社群製作的 GGUF 量化版本(例如 Q4 或 Q5),搭配 ComfyUI 就能在 8GB VRAM 上運行,只是出圖速度會比高階顯卡慢一些。
Q: 為什麼我生的圖中文字都是亂碼?
A: 把要出現的文字用引號包起來,並在提示詞中明確說明位置,例如「招牌上寫著『開幕優惠』」。Qwen-Image 2.1 的中文渲染已比多數模型好,但仍建議多生幾張挑選。
Q: 網頁版、API、本地部署,新手該選哪個?
A: 想快速試用選網頁版;每天要生十張以上選 API;重視隱私、想零成本大量出圖,再投入時間學本地部署。
Q: 提示詞用中文還是英文比較好?
A: Qwen-Image 2.1 對中文理解是它的強項,直接用繁體中文自然描述即可,不需要硬翻成英文,反而更容易得到符合你想像的結果。