你有沒有這種經驗:開完一場兩小時的會議,錄音檔躺在手機裡三天不敢打開,因為一想到要重聽、要打字、要整理重點,就覺得頭皮發麻?或者你是接案工作者,訪談錄音累積了十幾條,卻一直沒時間整理成文字,案子就這樣卡住?
這篇文章要教你的,就是把這件苦差事整條自動化。從今天開始,你只需要「按下錄音」和「按下轉換」兩個動作,中間那些逐字聽打、分段、抓重點的過程,全部交給 AI。而且我會用 2026 年最新的開源語音辨識模型來示範,包含本週在 HuggingFace 上衝出近千讚的串流語音模型 Audio8-ASR-Infinite,以及大家熟悉的 Whisper 系列。
讀完之後,你會知道:怎麼挑工具、怎麼設定才能讓繁體中文辨識率大幅提升、怎麼處理中英夾雜的香港/台灣口語,以及最實用的——怎麼讓 AI 幫你把逐字稿直接變成會議紀錄。整篇都是可以照著做的步驟,不需要任何程式背景也能上手。
為什麼 AI 逐字稿現在才真的「能用」?
先講一個很多人不知道的關鍵:語音轉文字不是新技術,但過去兩年最大的突破不是「辨識準不準」,而是「不用等」。
以前的語音辨識是「批次處理」——你上傳一個 60 分鐘的錄音,系統要跑完才能給你結果,中間不能中斷。但今年開源社群開始大量投入「串流辨識」(streaming ASR),也就是邊講邊轉,延遲可以壓到幾秒內。本週在 HuggingFace 上快速竄起的 Edge0/Audio8-ASR-Infinite,就是這條路線的代表:它的標籤直接寫著 streaming,主打長時間、不中斷的即時轉錄。
這對一般使用者意味著什麼?意味著你可以開著筆電,一邊開會一邊看到逐字稿在畫面上長出來。會議結束的瞬間,文字檔也差不多完成了。這在一年前還是要付費企業方案才做得到的事。
另一個變化是「中文友善」。早期開源模型對繁體中文的支援很弱,常常把「專案」聽成「轉案」、「資料」聽成「之料」。但 2025 年底之後,Qwen 系列、MiMo 系列陸續把中文語音資料灌進訓練集,加上社群針對台灣腔、香港腔做微調,現在的辨識品質已經和付費服務非常接近,甚至在特定場景下更好。
所以現在是最好的時機:工具成熟了、免費選項夠強了,缺的只是「知道怎麼用」。
第一步:選對工具,別一開始就選最難的
我把工具分成三條路線,你可以照自己的需求挑一條,不用全部學。
路線一:完全不想碰技術。 直接用你手上已有的工具。Google Docs 的語音輸入、iPhone 的「語音備忘錄+備忘錄轉錄」、Windows 的語音輸入,這些都能做到基本轉錄。優點是零設定,缺點是長時間錄音容易斷、中英夾雜會亂掉、不能批次處理。適合「一週只用一次、每次十分鐘內」的人。
路線二:想免費又要高品質。 這是本文主力。用開源的 Whisper 系列模型,在自己電腦上跑。推薦的模型是 whisper-large-v3 或社群微調的繁體中文版本。如果你有獨立顯卡(8GB 記憶體以上),跑起來非常順;沒有的話,用 CPU 也能跑,只是 60 分鐘的音檔大約要等 20~40 分鐘。
路線三:要即時、要串流、要長時間。 這是進階路線,用 Audio8-ASR-Infinite 這類串流模型,或是在自己的伺服器上架一個 API。適合需要即時字幕、直播逐字稿、或是每天都有大量錄音的團隊。
我的建議是:先走路線二,跑通一次完整流程,再決定要不要升級。 因為路線二會讓你理解「音檔品質」「取樣率」「語言設定」這幾個關鍵變數,之後換任何工具都用得上。
第二步:錄音前先做三件事,辨識率直接差兩成
大多數人逐字稿做不好,問題不在 AI,在錄音。這三件事請在按下錄音鍵之前確認:
第一,靠近音源。 手機放在桌子中央、離講者兩公尺,和放在講者面前 30 公分,辨識率可以差 15~25%。如果是一對一訪談,把手機放在兩人之間;如果是會議室,盡量放在桌子中央,不要放在角落。
第二,關掉冷氣和風扇的直吹。 風聲是語音辨識的頭號殺手,因為它的頻率和人聲的子音重疊。同樣的錄音,有風聲和沒風聲,錯誤率可以差一倍。
第三,開場先講一句「今天日期是 2026 年 9 月 28 日」。 這聽起來很蠢,但這一句話同時給了模型兩個重要訊號:語言是中文、而且有數字和日期格式。很多模型會用開頭幾秒來「校準」語言模型,這一句能讓整段辨識穩定很多。
如果你用的是 iPhone,記得進「設定 → 語音備忘錄 → 音訊品質」選「壓縮」以外的選項;Android 則建議用內建的錄音程式而不是通話錄音,因為通話錄音會被電信商壓縮。
第三步:實際操作——把音檔變成逐字稿
以下用 Whisper 為例,因為它是目前最穩定、社群資源最多的選擇。
安裝(只需做一次)。 打開終端機,輸入:
pip install -U openai-whisper
如果你有 NVIDIA 顯卡,先確認 CUDA 裝好,Whisper 會自動偵測。沒有的話它會用 CPU,慢但能跑。
基本轉換指令。
whisper meeting.m4a --model large-v3 --language zh --task transcribe --output_format txt
這行指令的意思是:用最大的模型、指定語言是中文、任務是「轉錄」(不是翻譯)、輸出成純文字檔。跑完之後,你會得到一個 meeting.txt。
繁體中文的關鍵設定。 這裡是很多人卡住的地方:Whisper 預設輸出常常是簡體,或是把台灣用語轉成中國用語。解法是加一個「初始提示詞」(initial prompt),告訴模型你要什麼風格:
whisper meeting.m4a --model large-v3 --language zh --initial_prompt "以下是台灣繁體中文的會議記錄,請使用繁體字,保留中英夾雜的原文,例如 meeting、deadline、KPI 不要翻譯。" --output_format txt
這一段提示詞的效果非常明顯。根據社群實測,加上之後繁體字比例可以從大約六成提升到九成五以上,專有名詞的保留率也大幅改善。
處理超長錄音。 如果你的音檔超過兩小時,建議先用免費工具(例如 Audacity)切成 30 分鐘一段。原因不是模型跑不動,而是萬一中途出錯,你不用整段重來。切記每段之間留 2~3 秒重疊,避免句子被切斷。
中英夾雜怎麼辦? 香港讀者特別常遇到這個問題。實測最有效的做法是:--language zh 搭配上面那段提示詞,並且在提示詞裡明確列出你常講的英文詞。例如你是做行銷的,就把「campaign、conversion、ROAS」寫進去。模型會優先把這些詞當成英文保留,而不是硬翻成中文。
第四步:讓 AI 把逐字稿變成「有用的東西」
逐字稿本身其實沒什麼價值,價值在於濃縮。這一步我強烈建議接一個語言模型(Claude、ChatGPT、Gemini 都可以),把逐字稿丟進去,用以下提示詞:
以下是一份會議逐字稿。請幫我整理成:
1. 三句話摘要
2. 決議事項(條列,標註負責人與期限)
3. 待確認問題(條列)
4. 下次會議前需要準備的資料
請用繁體中文,保留原始專有名詞,不要自行補充逐字稿中沒有提到的內容。
最後那句「不要自行補充」非常重要。語言模型在整理會議紀錄時,很容易「腦補」出聽起來合理但根本沒發生過的決議。加上這句可以大幅降低幻覺。
如果你是用 Audio8-ASR-Infinite 這類串流模型,還可以做一件更酷的事:把逐字稿即時丟進語言模型,讓它在會議進行中就幫你標記「這裡出現了一個待辦事項」。這在 2026 年已經是完全可行的做法,而且成本比你想像的低很多。
常見錯誤與排查
最後整理幾個大家最常撞到的坑。如果你轉出來的逐字稿「整段都是亂碼」,通常是取樣率問題——先用免費工具把音檔轉成 16kHz 的 WAV 檔再試一次。如果「只有前幾分鐘正確,後面全亂」,通常是音檔太長或是有靜音段,建議切段處理。如果「中文變成英文翻譯」,檢查你是不是誤加了 --task translate,改成 --task transcribe 就好。如果「專有名詞一直錯」,把它們寫進 initial prompt,這招幾乎每次都有效。
總結:把時間拿回來
今天你學到的是一條完整流程:錄音前做好三件事、用 Whisper 加上繁體中文提示詞轉出高品質逐字稿、再用語言模型濃縮成會議紀錄。整條流程跑順之後,一場兩小時的會議,從錄音到有決議清單,大約只需要 15 分鐘的等待時間,而且你完全不用動手打字。
最實際的建議是:這週挑一場會議試一次就好。不用一次全部自動化,先跑通「一個音檔 → 一份逐字稿」這個最小迴路。等你體驗過那種「會議結束,紀錄也差不多好了」的感覺,你自然會想辦法把更多流程接上去。
工具會一直更新,但這套「先顧好音源、再顧好提示詞、最後才交給 AI 濃縮」的順序不會變。掌握這個順序,不管明年出什麼新模型,你都能馬上上手。
延伸閱讀
常見問題
Q: 免費的 AI 逐字稿工具,辨識率真的夠用嗎?
A: 夠用,但取決於錄音品質。 以 Whisper large-v3 為例,在安靜環境、近距離收音的條件下,繁體中文辨識率可達 90~95%,與付費服務差距已經很小。真正拉開差距的是錄音環境,不是模型本身。先把錄音做好,免費工具的表現會讓你意外。
Q: 我的電腦沒有獨立顯卡,跑得動嗎?
A: 跑得動,只是要等。 純 CPU 環境下,60 分鐘的音檔大約需要 20~40 分鐘處理,取決於你的處理器等級。建議先用 --model medium 試水溫,覺得品質可以接受就不一定要用 large-v3。或者把音檔切成 10 分鐘一段分批跑,體感上比較不折磨。
Q: 為什麼轉出來是簡體字?怎麼改成繁體?
A: 加上 initial prompt 就能解決。 在指令中加入 --initial_prompt "請使用台灣繁體中文,保留中英夾雜原文",繁體比例會從約六成提升到九成五以上。如果還有殘留的簡體字,可以用 OpenCC 這類開源工具做一次後處理轉換,一分鐘就能跑完。
Q: 中英夾雜(例如「這個 campaign 的 ROAS 要再優化」)要怎麼設定?
A: 指定語言為中文,並在提示詞中列出常用英文詞。 使用 --language zh,並把「campaign、ROAS、deadline、KPI」這類你常講的詞寫進 initial prompt。模型會優先保留這些英文原文,而不是硬翻成中文。香港讀者如果常夾雜粵語英文混用,建議額外準備一份自己的常用詞清單。
Q: 逐字稿可以直接丟給 ChatGPT 整理嗎?會不會有隱私問題?
A: 可以,但要看你錄的是什麼。 一般內部會議、公開訪談沒問題。但如果涉及客戶機密、個資、財報未公開資訊,建議改用可本地部署的開源模型(例如 Qwen 系列),或是先把逐字稿中的姓名、公司名做去識別化再上傳。這一步多花五分鐘,可以省下很多麻煩。