你會不會也這樣想:「AI 這麼厲害,但每次用都要連上網路,還擔心資料外洩?」尤其當你處理的是公司機密、個人日記,或是還沒公開的創意點子,把這些丟給雲端 AI,心裡總是毛毛的。
好消息是,Google 最近開源了 Gemma-4-12B 這個強大模型,它不僅能看懂圖片、處理文字,更重要的是——你完全可以在自己的電腦上離線執行它!不用 GPU、不用花錢買雲端點數,只要一台普通筆電就能跑。
這篇文章會帶你一步步完成本地部署,從下載模型到第一次成功對話,全程不用連網。你學到的不只是技術,更是對自己資料的完全掌控權。準備好了嗎?我們開始吧!
為什麼你需要本地 AI?
你可能會問:「用 ChatGPT 或 Gemini 不就好了嗎?幹嘛這麼麻煩自己跑模型?」
這三點理由會讓你改觀:
第一,隱私無價。 當你把商業合約、病歷、或是還沒發表的文章貼進雲端 AI 時,這些資料就等於交給了別人。不少公司甚至明文禁止員工用 ChatGPT 處理工作文件,就是怕資料外洩。本地模型完全離線運行,你的資料永遠只在你硬碟裡。
第二,不用排隊也不怕斷線。 雲端服務常常塞車,熱門時段要等好幾分鐘才得到回應。更別提網路不穩時,對話到一半突然斷線,氣都氣死了。本地模型就像你的私人助理,隨叫隨到。
第三,長期省錢。 雖然初期要花點時間設定,但之後完全免費。如果你每天大量使用 AI,一個月省下的訂閱費可能就超過一杯手沖咖啡的錢了。
你的電腦跑得動嗎?硬體需求一次說清楚
很多人聽到「跑 AI 模型」就以為需要幾萬塊的專業顯卡。但 Gemma-4-12B 的厲害之處,就是它很親民。
最低需求(可以跑,但慢一點):
- 記憶體:8GB RAM(建議 16GB 以上)
- 儲存空間:至少 15GB 可用空間
- 作業系統:Windows 10/11、macOS 12+、或 Linux
建議配置(順暢體驗):
- 記憶體:16GB RAM 或更多
- 有 NVIDIA 顯卡(4GB VRAM 以上)會更快,但非必要
- SSD 固態硬碟(載入速度差很多)
我用一台 2020 年的 MacBook Air(M1 晶片、8GB RAM)實測過,雖然生成速度約每秒 3-5 個字,但完全堪用。如果你有 16GB RAM 的電腦,速度會快上一倍。
第一步:安裝 Ollama——你的 AI 管家
我們要用 Ollama 這個工具來管理模型,它就像 AI 界的 App Store,幫你下載、執行、管理各種模型,而且指令超級簡單。
Windows 用戶:
- 前往 ollama.com 下載 Windows 安裝檔
- 雙擊安裝,一路按「下一步」
- 安裝完成後,打開命令提示字元(CMD)或 PowerShell
macOS 用戶:
- 從 ollama.com 下載 macOS 版本
- 將 Ollama 拖進應用程式資料夾
- 打開終端機(Terminal)
Linux 用戶: 打開終端機,輸入這一行:
curl -fsSL https://ollama.com/install.sh | sh
安裝完成後,輸入 ollama --version 確認有看到版本號碼,就代表成功了。
第二步:下載 Gemma-4-12B 模型
現在是關鍵時刻——我們要把模型拉到你的電腦裡。Ollama 讓這件事變得超簡單。
打開你的終端機或命令提示字元,輸入:
ollama pull gemma4:12b
這行指令會從網路上抓取模型檔案,大小約 7-8GB。注意:這個步驟需要網路,但只有這一次。下載完成後,之後就不用網路了。
下載時間取決於你的網速,大約 10-30 分鐘。可以去泡杯咖啡,回來就下載好了。
下載完成後,你會看到類似這樣的訊息:
pulling manifest
pulling 7.2 GB ▕███████████████████████████████▕ 100%
第三步:開始你的離線對話
模型下載好之後,就可以離線使用了!輸入這個指令:
ollama run gemma4:12b
你會看到提示符號變成 >>>,這代表模型已經準備好聽你說話了。
試試看問它:
>>> 用繁體中文寫一封給客戶的道歉信,因為我們延遲交貨了
Gemma-4 會開始生成文字,速度依你的電腦效能而定。第一次回應可能稍微慢一點(因為模型要載入到記憶體),之後就會順暢許多。
小技巧: 如果你覺得回應太慢,可以試試更小的模型版本:
ollama run gemma4:2b
這個版本只有 2B 參數,速度快很多,但回答品質會稍微下降。適合快速測試或簡單任務。
第四步:進階玩法——讓 AI 看懂圖片
Gemma-4 最厲害的功能之一,就是它是「多模態」模型——它不僅能讀文字,還能「看」圖片。
假設你有一張產品照片,想讓 AI 幫你寫產品描述,可以這樣做:
先確保你在 Ollama 的對話模式中(>>> 提示符號),然後輸入:
>>> 描述這張圖片中的產品,用繁體中文,200字以內
但 Ollama 預設的對話模式不支援直接貼圖片。你需要用 API 方式呼叫。
用 Python 呼叫(進階用戶):
- 安裝 Ollama 的 Python 套件:
pip install ollama
- 建立一個 Python 檔案
test_gemma.py,內容如下:
import ollama
response = ollama.chat(
model='gemma4:12b',
messages=[{
'role': 'user',
'content': '用繁體中文描述這張圖片',
'images': ['path/to/your/image.jpg'] # 改成你的圖片路徑
}]
)
print(response['message']['content'])
- 執行它:
python test_gemma.py
AI 就會根據圖片內容,生成一段描述。你可以用它來寫社群貼文、產品介紹,甚至是幫視障朋友描述照片內容。
常見問題
Q: 我的電腦只有 8GB RAM,跑得動嗎?
A: 可以,但建議用 gemma4:2b 這個較小的版本。8GB RAM 跑 12B 版本會非常慢,而且可能因為記憶體不足而當機。先用 2B 版本體驗看看。
Q: 模型下載到一半網路斷了,要重來嗎?
A: 不用擔心,Ollama 支援斷點續傳。重新執行 ollama pull gemma4:12b 會從中斷的地方繼續下載。
Q: 我可以用 GPU 加速嗎? A: 可以!如果你有 NVIDIA 顯卡,安裝 CUDA 後 Ollama 會自動啟用 GPU 加速。macOS 用戶如果有 Apple Silicon(M1/M2/M3),Ollama 也會自動使用 Metal 加速。
Q: 模型會佔用多少硬碟空間?以後可以刪掉嗎?
A: Gemma-4-12B 約佔 7-8GB。如果要刪除,輸入 ollama rm gemma4:12b 即可。也可以隨時重新下載。
Q: 離線模式真的完全不上網嗎?
A: 是的,只要模型已經下載完成,關掉網路後依然可以正常使用 ollama run gemma4:12b。但要注意,如果你用瀏覽器介面(如 Open WebUI),瀏覽器本身可能需要網路來載入頁面資源。
延伸閱讀
總結
今天你學到了如何在自己的電腦上離線運行 Google Gemma-4-12B 這個強大的開源 AI 模型。從安裝 Ollama、下載模型、到第一次對話,整個過程不到 30 分鐘就能完成。
你現在擁有的不只是一套 AI 工具,而是對自己資料的完全控制權。無論是處理敏感文件、在沒有網路的環境工作,還是單純想省下每月訂閱費,本地 AI 都是值得投資的技能。
別忘了試試讓 Gemma-4 看圖片的功能——你可能會驚訝於它對照片的理解能力。如果遇到問題,隨時回來看這篇教學,或到 Ollama 的社群討論區求助。
現在,打開你的終端機,開始你的離線 AI 之旅吧!