你也能自己生影片?先搞懂 LTX-2.5 是什麼
如果你最近在社群上看到有人用一句話就變出一段會動的短片,而且畫面還有運鏡、有光影變化,那很可能就是這幾天在 Hugging Face 上炸開的 Lightricks LTX-2.5。這個模型在短短一週內衝出 5,739 個讚、下載次數突破 160 萬次,是目前開源影片生成圈子裡討論度最高的名字之一。它最大的特色是同時支援「文字生影片」與「圖片生影片」,而且提供單一檔案(diffusion-single-file)版本,代表你不需要搞懂一整套複雜的模型目錄結構,也能在自己電腦上跑起來。
對香港和台灣的讀者來說,這件事的意義很實際:以前要做一支產品短片、活動預告、社群素材,不是要找剪輯師,就是要訂閱每月幾百塊的雲端服務。現在你只要有一張中高階顯卡,就能在自己房間裡產出可用的動態素材。這篇教學不會跟你談論文,我會帶你從零開始,一步步把 LTX-2.5 跑起來,並且告訴你怎麼寫提示詞才會真的好看,還有哪些坑一定要避開。
先講結論:這不是「按一顆鈕就生出電影」的魔法,但它已經足夠讓你做出社群貼文、簡報開場、電商展示的動態素材。你需要的不是天才,而是正確的步驟跟一點耐心。
第一步:先確認你的電腦跑不跑得動
很多人第一步就卡住,不是因為不會操作,而是硬體不夠卻硬要跑,結果等到天荒地老。LTX-2.5 屬於擴散模型,對顯示記憶體(VRAM)的需求比一般圖像模型高。根據實際社群的測試回報,8GB VRAM 是勉強能玩的門檻,12GB 以上會舒服很多,16GB 以上則可以嘗試較高解析度與較長秒數。如果你用的是 Apple Silicon 的 Mac,透過 MLX 或 ComfyUI 的 Metal 後端也能跑,但速度會比同等級的 N 卡慢一些,建議先從 512×768 這種較小尺寸開始。
如果你完全沒有獨立顯卡,也別急著放棄。目前最實際的兩條路是:一,租用雲端 GPU,例如 RunPod、Vast.ai 這類按小時計費的服務,一小時大約落在 0.3 到 0.8 美元之間,換算下來一小時不到 30 港幣;二,使用已經整合 LTX-2.5 的線上平台。對香港讀者來說,雲端方案還有一個好處:不用擔心房間散熱跟電費,尤其夏天開冷氣加顯卡全速跑,電費帳單會很有感。
硬體確認完,接下來就是安裝。最推薦的入口是 ComfyUI,因為它對單一檔案模型的支援最好,而且網路上已經有大量現成的 LTX-2.5 工作流可以下載。安裝流程大致是:先裝好 ComfyUI 主程式,再把 LTX-2.5 的 safetensors 檔案放進 models/checkpoints 資料夾,接著匯入對應的工作流 JSON。第一次執行時它會自動下載文字編碼器,這個步驟會佔用幾 GB 的硬碟空間,記得先清出至少 30GB 的空間。
第二步:提示詞怎麼寫,才會生出「能看」的影片
影片生成的提示詞跟圖像生成很不一樣。圖像只要描述畫面,影片還要描述「時間」與「動作」。很多人第一次用 LTX-2.5 失敗,就是因為只寫了「一隻貓」,結果出來一隻靜止不動的貓,看起來像壞掉的照片。正確的寫法要包含三個元素:主體、動作、鏡頭。
舉個實際例子。假設你要做一支咖啡店的社群素材,不要只寫「咖啡」,而是寫成:「一杯熱咖啡放在木桌上,蒸氣緩緩上升,鏡頭從左側緩慢推近,暖色調晨光從窗戶灑落,淺景深」。這樣的描述同時交代了主體(咖啡)、動作(蒸氣上升)、鏡頭(緩慢推近)與氛圍(暖色調晨光)。根據社群實測,這種寫法的成功率明顯高於模糊描述。
另外一個實用技巧是控制秒數。LTX-2.5 在 3 到 5 秒的短片段表現最穩定,超過 8 秒就容易出現主體變形或背景漂移。與其硬生一段 15 秒的影片再來頭痛,不如生三段 5 秒的片段,再用剪輯軟體接起來,成品反而更精緻。這點對做電商的人特別重要:一支 15 秒的商品展示,用三段不同角度的 5 秒片段組合,質感會遠勝一次生成的長片段。
如果你用的是「圖片生影片」模式,提示詞的重點會轉向「描述你希望畫面怎麼動」。例如你上傳一張香港夜景照片,提示詞可以寫「鏡頭緩慢向右平移,霓虹燈光微微閃爍,水面倒影輕微波動」。這樣模型就知道要保留原圖構圖,只加入動態。這個模式對地產、旅遊、餐飲業超級實用,因為你手上本來就有大量靜態照片,等於直接把舊素材升級成動態廣告。
第三步:參數調整與常見錯誤排除
跑得動之後,接下來是調參數。有幾個關鍵數值你一定要知道。第一個是「引導強度」(guidance scale),數值越高越貼近你的提示詞,但太高會讓畫面僵硬、色彩過飽和。LTX-2.5 建議從 3 到 5 之間開始試,覺得畫面太死板就往下調,覺得模型不聽話就往上加。第二個是「採樣步數」(steps),20 到 30 步通常是甜蜜點,低於 15 步畫面會糊,高於 40 步則邊際效益很低,只是浪費電。
常見錯誤第一名是「畫面閃爍」。這通常發生在秒數太長或解析度太高時,解法是把解析度降到 768 寬以下,或把片段縮短到 4 秒內。第二名是「主體變形」,例如人的手指突然多一根、車子開一開變成別台車,這在生成式影片裡目前仍難完全避免,實務上的做法是避開特寫手部與快速運動的鏡頭。第三名是「顏色偏掉」,如果你發現成品整體偏綠或偏紫,檢查一下是不是用了不相容的 VAE 檔案,換回官方建議的版本通常就能解決。
還有一個很多人忽略的細節:種子碼(seed)。當你生出一段很滿意的影片,記得把當下的 seed 記下來。之後想微調提示詞或改秒數時,沿用同一個 seed,可以讓風格保持一致,這對需要系列素材的品牌來說非常關鍵。反過來說,如果你生了十次都很糟,換個 seed 往往比改十次提示詞更快找到方向。
香港台灣讀者的實戰應用場景
講了這麼多技術,回到最實際的問題:這東西對你有什麼用?對香港的中小企來說,最直接的應用是社群廣告素材。以前一組動態廣告要外發製作,報價動輒三、五千港幣;現在你自己生三段 5 秒片段,配上文案與音樂,一個下午就能產出一組可測試的素材。對台灣的電商賣家來說,把商品照丟進「圖片生影片」模式,加上「鏡頭緩慢環繞,光影流動」的提示詞,就能把靜態商品圖變成有質感的動態展示。
對內容創作者與自媒體經營者,LTX-2.5 可以拿來做影片的開場動畫、過場效果,甚至是 Podcast 的視覺化片段。對補習班、健身教練、餐飲業者,則可以用來做課程預告與菜色展示。關鍵心法是:不要想一次做出完美成品,而是把它當成「素材產生器」,先生成大量片段,再挑出最好的幾段來剪。這個工作流程的思維轉換,比任何參數設定都重要。
最後提醒一件事:目前多數開源影片模型在商業使用上都有各自的授權條款,LTX-2.5 的授權細節建議你在正式商用前,花十分鐘到官方模型頁面確認一次。這不是要嚇你,而是避免你辛苦做的素材最後不能用。養成看授權的習慣,是每個 AI 創作者的必修課。
延伸閱讀
常見問題
Q: 我只有 8GB VRAM 的顯卡,真的跑得動 LTX-2.5 嗎?
A: 可以,但要把解析度降到 512×768 以下、秒數控制在 3 到 4 秒,並且關閉其他佔用顯卡的程式。若還是很卡,建議改用雲端 GPU 服務,成本比升級顯卡低得多。
Q: 文字生影片和圖片生影片,新手該先學哪一個?
A: 建議先從圖片生影片開始。因為構圖已經由原圖決定,你只需要描述動態,變數少、成功率高的多,比較容易建立信心,之後再挑戰純文字生成。
Q: 為什麼我生的影片只有 3 秒,可以生更長嗎?
A: 技術上可以,但超過 8 秒後主體變形與背景漂移的機率會大幅上升。實務上建議生多段短片段再用剪輯軟體拼接,成品品質會比一次生長的更好。
Q: 生成的影片可以商業使用嗎?
A: 取決於模型的授權條款,不同版本可能不同。商用前務必到官方模型頁面確認授權細節,必要時保留生成紀錄與 seed 作為佐證。
Q: 我不會寫程式,也能用 LTX-2.5 嗎?
A: 可以。透過 ComfyUI 的圖形介面,你只需要下載現成的工作流、放入模型檔案、輸入提示詞就能執行,完全不需要寫任何一行程式碼。