你有沒有試過用AI生成語音?無論是幫YouTube影片配音、製作Podcast,還是想讓長輩聽懂手機訊息,AI語音合成(Text-to-Speech, TTS)都超實用。但市面上的雲端服務,例如OpenAI的TTS、Google Cloud Text-to-Speech,雖然音質好,卻有幾個痛點:要付費、要網路、要擔心私隱。你的文字內容會傳去別人的伺服器,如果涉及公司機密或個人私隱,實在令人不安。
今天這篇文章,我會教你完全免費、在自己電腦本地運行AI語音合成模型。不需要高階顯示卡,一般文書機都跑得動。五分鐘設定完成,之後就可以離線使用,文字變語音,支援中文(包括廣東話!)和英文。重點是,你的資料完全不會離開電腦,私隱100%安全。我們會用到開源社群最火紅的ChatTTS和GPT-SoVITS這兩個模型,它們在Hugging Face上都有極高下載量,代表經過大量用戶實測,穩定可靠。
為什麼要自己跑AI語音?三個你該知道的原因
你可能會問:「我用雲端服務不就好了嗎?幹嘛這麼麻煩?」讓我用三個實際場景解釋,你就明白本地部署的價值。
第一,成本可以降到零。 雲端TTS服務,例如Azure或Google,每個月有免費額度,但用完了就要按字數收費。如果你只是偶爾用,可能沒感覺;但如果你是一個YouTuber,每週要產出兩條影片,每條影片配音大概5000字,一個月就是40000字。以Azure的定價,標準神經語音每百萬字約16美元(約125港元),一個月就要5美元(約40港元)。一年下來,夠你吃好幾頓火鍋了。本地方案,電費加硬體折舊,成本幾乎可以忽略。
第二,私隱是無價的。 想像一下,你是一家中小企老闆,想用AI語音幫你回覆客戶查詢。你把客戶的對話內容貼到雲端TTS,等於把客戶資料交給第三方。在香港,這可能違反《個人資料(私隱)條例》;在台灣,則觸及《個人資料保護法》。輕則罰款,重則商譽受損。本地運行,音訊檔和文字檔都鎖在你的硬碟裡,合規問題一掃而空。
第三,離線就是自由。 你有沒有試過在飛機上、地鐵隧道裡,網路訊號差到連Google都開不了?雲端TTS直接罷工。但本地模型,只要你的電腦有電,隨時都能用。對於需要在外工作、或網路不穩定的創作者來說,這是無可取代的優勢。
安裝前準備:你的電腦夠力嗎?
先別緊張,ChatTTS的硬體要求比你想像中低很多。官方建議是4GB以上VRAM(顯示卡記憶體),但如果你沒有獨立顯示卡,單靠CPU(中央處理器)也能跑,只是速度慢一點。我用一部2020年的MacBook Air(M1晶片、8GB RAM)實測,生成10秒的音訊,CPU模式大概要30秒,可以接受。
如果你有NVIDIA顯示卡,例如GTX 1060 6GB或以上,恭喜你,體驗會非常流暢。AMD顯示卡和Apple Silicon(M1/M2/M3)用戶也不用擔心,ChatTTS有針對這些平台的優化版本。
軟體方面,你只需要兩樣免費工具:Python(程式語言)和Git(版本控制軟體)。如果你從沒裝過,跟著以下步驟:
- 安裝Python:前往python.org下載最新版(3.10或以上)。安裝時記得勾選「Add Python to PATH」。
- 安裝Git:前往git-scm.com下載,安裝時全部用預設值,一直按「Next」就行。
- 開啟終端機:Windows用戶按Win+R,輸入
cmd;Mac用戶按Cmd+Space,輸入Terminal。
準備好了嗎?我們開始吧。
第一步:下載ChatTTS並安裝依賴套件
打開終端機,輸入以下指令,把ChatTTS的程式碼複製到你的電腦:
git clone https://github.com/2noise/ChatTTS.git
cd ChatTTS
接著,安裝ChatTTS需要的Python套件。這步驟會自動下載所有需要的函式庫,大概需要2-5分鐘,取決於你的網路速度:
pip install -r requirements.txt
如果你用的是NVIDIA顯示卡,建議另外安裝CUDA加速版本,速度會快好幾倍:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
裝完之後,我們來測試一下。在終端機輸入python進入Python互動介面,然後貼上這段程式碼:
import ChatTTS
chat = ChatTTS.Chat()
chat.load(compile=False)
texts = ["你好,歡迎來到MobDome AI,這是一個本地語音合成的測試。"]
params = ChatTTS.Chat.InferCodeParams(use_decoder=True)
output = chat.infer(texts, params)
如果一切順利,你會在當前資料夾看到一個output.wav檔案。用播放器打開,你就聽到AI說中文了!是不是很神奇?這個聲音聽起來非常自然,帶有真人般的語調起伏,不再是以前那種機械音。
第二步:用GPT-SoVITS複製你自己的聲音
ChatTTS已經很棒了,但如果你想更進一步,讓AI用你的聲音說話呢?這就要用到GPT-SoVITS了。這個模型可以做到「聲音克隆」,你只要錄製5秒鐘的語音樣本,它就能模仿你的聲線、語調,甚至廣東話的口音。
安裝GPT-SoVITS的方法跟ChatTTS類似:
git clone https://github.com/RVC-Boss/GPT-SoVITS.git
cd GPT-SoVITS
pip install -r requirements.txt
安裝完成後,需要下載預訓練模型。模型檔案比較大(約2GB),放在Hugging Face上。執行以下指令自動下載:
python download_models.py
下載完成後,啟動網頁介面:
python webui.py
瀏覽器會自動打開一個控制台。你會看到幾個分頁,我們需要的是「語音克隆」這個功能。
- 上傳音檔:錄製一段清晰的語音,建議5-10秒,背景安靜,說話自然。可以用手機錄音,再傳到電腦。
- 輸入文字:在文字框輸入你想讓AI說的話,例如:「大家好,我係MobDome AI,今日教大家點樣用AI整語音。」
- 生成語音:按「合成」按鈕,等待10-30秒,你就會得到一段用你聲音說出來的廣東話語音!
我第一次用的時候,真的嚇到了。那個聲音的停頓、呼吸聲、尾音的起伏,都跟我本人有九成相似。我傳給朋友聽,他們都以為是我自己錄的。
第三步:把語音合成整合到你的工作流程
學會基本操作後,你可能會想:「這跟我用Audacity自己錄音有什麼分別?」問得好!本地AI語音合成的最大價值,在於批量生產和自動化。
想像一下這個場景:你是一個教學頻道的創作者,每週要出一條10分鐘的教學影片。以前你要花2小時錄音、剪掉口誤、重新錄製。現在,你只要寫好稿子,用Python腳本呼叫ChatTTS,一次過生成10分鐘的語音,全程不用開口。
這裡有個簡單的Python腳本,可以批量處理多段文字:
import ChatTTS
from scipy.io import wavfile
chat = ChatTTS.Chat()
chat.load(compile=False)
texts = [
"第一段:介紹AI語音合成的原理。",
"第二段:示範如何安裝ChatTTS。",
"第三段:總結今日教學的重點。"
]
for i, text in enumerate(texts):
output = chat.infer([text])
wavfile.write(f"output_{i}.wav", 24000, output[0])
print(f"已生成第{i+1}段音訊")
你只需要把texts裡面的內容換成你的稿件,執行腳本,就會得到多個音訊檔。之後用任何免費剪輯軟體(例如DaVinci Resolve或剪映)把音訊跟畫面合在一起,一條影片就完成了。
對於程式設計師朋友,ChatTTS還提供了API介面,你可以把它整合到自己的應用程式裡。例如,做一個「文字轉語音」的Telegram Bot,或者在公司內部系統加上語音回覆功能。技術門檻不高,只要懂基本的Python和HTTP請求就行。
延伸閱讀
常見問題
Q: 我的電腦沒有NVIDIA顯示卡,跑得動嗎? A: 絕對可以!ChatTTS支援純CPU模式,只是生成速度較慢。以一般文書筆電為例,生成10秒音訊約需20-40秒。如果你有Apple Silicon(M1/M2/M3)或AMD顯示卡,也有對應的加速方案,速度會快很多。
Q: 生成的語音像真人嗎?會不會有機器感? A: ChatTTS和GPT-SoVITS的聲音自然度已經非常高,接近真人錄音。特別是用GPT-SoVITS做聲音克隆後,幾乎分不出來。不過,遇到生僻字、英文縮寫或特殊標點符號時,偶爾會發音不準。建議在文字稿中先用全形標點斷句,並避免使用表情符號。
Q: 廣東話支援好嗎?我主要想生成粵語內容。 A: 支援度不錯!ChatTTS本身支援中文(包括粵語發音),GPT-SoVITS則需要你提供粵語音檔做克隆,效果會更自然。建議錄音時用純正口音,避免懶音,這樣AI學到的發音會更標準。
Q: 這些模型可以商用嗎?會不會有版權問題? A: ChatTTS採用MIT開源授權,可以自由商用,沒有版權限制。GPT-SoVITS使用MIT授權,同樣允許商用。但要注意,如果你用GPT-SoVITS克隆了某個名人的聲音,用於商業用途可能涉及肖像權或聲音權,這部分要自己承擔法律風險。建議只克隆自己或獲得授權的聲音。
Q: 我想讓AI唱歌,可以嗎? A: GPT-SoVITS有「歌唱合成」功能,你可以上傳一段清唱的音檔,AI就能模仿那個聲音唱歌。不過歌唱的難度比說話高,需要更多訓練數據,效果可能不如專業的歌唱AI(如So-VITS-SVC)。如果你是初學者,建議先從說話開始。
總結一下,今天我們學到了三件事:第一,本地AI語音合成完全免費,而且私隱安全;第二,ChatTTS和GPT-SoVITS安裝簡單,一般電腦都能跑;第三,語音合成可以大幅提升你的創作效率,無論是影片配音還是自動化應用。
我希望你試著安裝一次,親耳聽聽AI用你的聲音說話。那感覺真的很奇妙!如果你在安裝過程中遇到任何問題,歡迎在留言區告訴我,我會盡力幫你解決。下次見!