你有沒有這種經驗?明明檔案就在電腦裡,卻怎麼找都找不到。用系統內建的搜尋功能,等它轉圈圈轉了半天,出來的結果還是一堆不相干的東西。尤其是當你記得內容片段,卻忘了檔名是什麼的時候,那種無力感真的讓人很崩潰。
今天這篇教學,就是要教你用 AI 幫你在本地電腦上搜尋檔案。不用把檔案上傳到雲端,不用擔心隱私外洩,而且搜尋速度比傳統方式快上十倍。我會帶你一步步設定三種免費工具,從最簡單的到功能最強大的,讓你可以根據自己的需求選擇最適合的方案。
為什麼傳統檔案搜尋這麼慢?
在進入正題之前,我們先來理解一下問題的根源。Windows 和 macOS 內建的搜尋功能,基本上是靠檔案名稱和副檔名來比對。這意味著,如果你忘記檔案名稱,只記得裡面的某段文字,傳統搜尋就幫不上忙了。
更別提那些藏在 PDF、Word 文件、Email 附件裡的內容,傳統搜尋根本無法索引。根據微軟的官方文件,Windows 搜尋預設只索引文件夾和桌面,其他位置的檔案都要等搜尋時才即時掃描,這當然慢得離譜。
AI 檔案搜尋工具的運作原理完全不同。它們會先建立一個「向量資料庫」,把每個檔案的內容轉換成數學向量。當你輸入查詢時,AI 會把你的問題也轉換成向量,然後在資料庫中找出「語意上最接近」的檔案。這意味著,即使你搜尋的關鍵字和檔案內容不完全一樣,AI 也能理解你的意圖,找出正確的檔案。
第一招:用 AnythingLLM 建立本地知識庫
AnythingLLM 是目前最受歡迎的本地 AI 工具之一,它整合了多種 AI 模型,而且完全免費、開源。最棒的是,它可以在電腦上離線運作,你的檔案永遠不會離開你的裝置。
首先,到 AnythingLLM 的官方網站下載對應你作業系統的版本。安裝過程非常直觀,就跟安裝一般軟體一樣,一直按「下一步」就可以了。安裝完成後,打開程式,它會問你要不要建立一個工作區,我們先建立一個名為「我的文件」的工作區。
接下來,點擊左側的「連接資料來源」按鈕,選擇「上傳檔案」或是「連接資料夾」。如果你想要讓 AI 可以搜尋整個資料夾的檔案,選「連接資料夾」會更方便。你可以指定像是「D:\工作文件」這樣的路徑,AnythingLLM 會自動掃描裡面的所有檔案。
這裡有個小技巧:AnythingLLM 支援的文字格式非常多,包括 PDF、DOCX、TXT、Markdown 等等。但要注意,掃描大量檔案時,第一次建立索引會比較慢。如果你有幾千個檔案,可能要等十幾分鐘。之後再新增檔案,它只會增量索引,速度就會快很多。
索引建立完成後,你就可以在聊天視窗輸入問題了。例如,你可以輸入「上個月給客戶的報價單內容是什麼?」或「我在筆記裡寫過關於 AI 繪圖的想法」,AI 就會從你的檔案中找出相關內容,並告訴你這些內容來自哪個檔案。
第二招:用 LocalGPT 搜尋整台電腦
如果你的檔案分散在各個磁碟、各種資料夾,而且數量非常龐大,那 LocalGPT 會是更強力的選擇。這是一個命令列工具,雖然沒有漂亮的圖形介面,但搜尋能力非常強悍。
安裝 LocalGPT 需要一點技術基礎,但跟著步驟做其實不難。首先,你需要安裝 Python 3.10 或以上版本,然後打開終端機,輸入以下指令:
pip install localgpt
安裝完成後,輸入 localgpt init 來初始化程式。接著,輸入 localgpt add /path/to/your/folder 來指定要索引的資料夾。你可以重複執行這個指令,把多個資料夾都加入索引。
LocalGPT 最強大的地方在於它支援 OCR 功能。什麼意思呢?如果你有掃描的 PDF 或圖片檔,裡面是「圖片形式」的文字,一般的文字搜尋是找不到的。但 LocalGPT 可以透過 OCR 技術,把圖片裡的文字也轉換成可搜尋的內容。
搜尋時,輸入 localgpt search "你的問題",程式就會列出所有相關的檔案,並顯示每個檔案與你問題的相關度分數。分數越高代表越相關。你也可以加上 --top 5 參數,只顯示前五個最相關的結果。
值得一提的是,LocalGPT 是基於 Meta 的 Llama 模型,完全離線運作。根據開發者在 GitHub 上的數據,在一般筆電上搜尋一萬個檔案,平均只需要三秒鐘。這種速度是傳統搜尋完全做不到的。
第三招:用 Ollama 搭配 Open WebUI 打造個人搜尋引擎
如果你是進階使用者,想要有更彈性的控制,那 Ollama 加 Open WebUI 的組合會是你的菜。這套方案可以讓你在瀏覽器介面中,像使用 ChatGPT 一樣搜尋你的本地檔案。
首先,到 Ollama 的官網下載安裝程式。安裝完成後,打開終端機輸入 ollama pull llama3.2 來下載語言模型。這個模型大概 4.7GB,下載時間取決於你的網路速度。
接著,安裝 Open WebUI。在終端機輸入:
pip install open-webui
然後輸入 open-webui serve 啟動服務。打開瀏覽器,輸入 http://localhost:3000,你就可以看到一個類似 ChatGPT 的介面。
在左側選單中,點擊「文件」選項,你可以上傳檔案或是連接資料夾。Open WebUI 會自動建立索引,之後你就可以在聊天視窗中,用自然語言搜尋你的檔案了。
這套方案的好處是,你可以同時使用多種 AI 模型。例如,你可以用 Llama 3.2 來處理一般文件,用 Qwen 2.5 來處理中文文件,因為 Qwen 對中文的理解能力特別好。切換模型只需要在下拉選單中選擇即可。
如何選擇最適合你的方案?
看完三種方案,你可能會有點選擇困難。別擔心,我幫你整理一下。
如果你的需求很單純,只是想要有一個地方可以存放重要文件,然後用 AI 快速找到它們,那 AnythingLLM 是最友善的選擇。圖形介面直觀,不需要寫任何指令,十分鐘就能設定完成。
如果你是數位工作者,電腦裡有成千上萬個檔案,而且包含大量掃描文件和圖片,那 LocalGPT 的 OCR 功能會幫上大忙。雖然需要學習一些指令,但它的搜尋能力和速度是最強的。
如果你喜歡實驗各種 AI 模型,而且想要一個可以長期使用的個人知識庫系統,那 Ollama 加 Open WebUI 是投資報酬率最高的選擇。雖然設定過程比較複雜,但一旦設定好,你可以不斷加入新模型,擴充它的能力。
最後提醒一點:不管你選擇哪種方案,都建議定期備份你的索引資料庫。雖然重建索引不是什麼難事,但如果檔案數量龐大,重建過程會花不少時間。以 AnythingLLM 為例,它的索引存放在 ~/.anythingllm 資料夾,只要複製這個資料夾就能完成備份。
延伸閱讀
常見問題
Q: 這些工具會把我的檔案上傳到雲端嗎? A: 不會。這三種工具都是完全離線運作的。你的檔案和索引資料庫都只存在你的電腦上,不會有任何數據傳送到外部伺服器。這也是使用本地 AI 搜尋最大的優勢之一。
Q: 我的電腦規格不高,跑得動嗎? A: 這要看你的檔案數量而定。一般來說,8GB 記憶體的電腦就可以順暢運行 AnythingLLM。如果你的檔案超過一萬個,建議至少要有 16GB 記憶體。LocalGPT 對硬體需求較低,因為它採用的是較輕量的模型。
Q: 搜尋中文資料的效果好嗎? A: 效果非常好。近年來的開源模型對中文的理解能力大幅提升。如果你主要搜尋中文文件,建議選擇 Qwen 或 Llama 3 系列模型,它們在中文語意理解上表現特別出色。
Q: 這些工具支援哪些檔案格式? A: 最常見的格式都有支援,包括 PDF、Word、TXT、Markdown、HTML 等。AnythingLLM 和 LocalGPT 支援 OCR,可以處理掃描文件和圖片中的文字。如果你有特殊格式的檔案,建議先測試看看。
Q: 如果我的檔案有變動,AI 會自動更新嗎? A: 這要看工具而定。AnythingLLM 和 Open WebUI 會在你新增檔案時自動增量索引。LocalGPT 則需要手動執行更新指令。建議養成習慣,在重要檔案變動後執行一次更新,確保搜尋結果是最新的。