為什麼有人要自己跑模型?
雲端 AI 服務這麼方便,為什麼還有一群人堅持在自己電腦上跑開源模型?三個動機都很實在:
- 隱私:資料完全不離開你的機器。處理病歷、合約、公司機密、個人日記——「根本不上傳」是最徹底的隱私保護,沒有之一。
- 離線與掌控:沒有網路也能用、不受服務商改版和漲價影響、模型行為永遠一致,也沒有內容政策替你決定什麼能問。
- 成本結構:高頻率、大批量的任務(例如每天分類上萬筆文本),付一次硬體錢比按 token 計費划算。
但這三個好處都有對應的代價。先把代價講清楚,你再決定。
代價一:品質差距是真的
先說最重要的實話:你筆電上跑得動的模型,跟頂級雲端模型之間存在真實的能力差距。開源模型進步神速,中小型模型在摘要、翻譯、分類、格式轉換這類「範圍明確」的任務上已經非常好用;但在複雜推理、長篇寫作、艱難的程式問題上,差距依然明顯。
正確的期待是:本地模型是「夠用就好」哲學的勝利,不是「免費的頂級模型」。任務越封閉、越格式化,本地模型越能勝任;任務越開放、越吃推理深度,你越會想念雲端。
代價二:硬體門檻,用白話講
模型大小用參數量(B,十億)計,跑起來主要吃記憶體。幾個粗略的量級感:
- 7B~9B 級:16GB 記憶體的一般筆電就能跑,速度可用。適合入門體驗與輕量任務。
- 13B~30B 級:需要 24~32GB 記憶體或一張像樣的顯卡,品質明顯上一階。
- 70B 級以上:高階工作站或多卡等級的玩具,一般人建議直接用雲端。
讓小硬體跑大模型的關鍵技術叫量化(quantization):把模型權重的精度壓低來換記憶體空間,白話說就是「有損壓縮」。壓得越狠、檔案越小、品質掉得越多;主流的中度量化通常是甜蜜點。另外,Apple Silicon 的統一記憶體架構讓 Mac 意外地成為本地 LLM 的優質平台——這是少數「買 Mac 對 AI 有利」的真實場景。
工具怎麼選
- Ollama:目前的入門首選。一行指令下載模型、一行指令開始對話,也提供本地 API 讓其他程式接。先從它開始。
- LM Studio:完整的圖形介面,適合不想碰終端機的人;瀏覽、下載、比較模型都在視窗裡點一點。
- llama.cpp:底層引擎,前面兩個工具都基於它的生態。想深度客製、榨乾硬體效能時再碰。
- Hugging Face:開源模型的集散地。看排行榜時記得多疑:跑分高不等於在你的任務上好用,用你自己的真實任務測十分鐘,勝過看一百張評測圖。
什麼場景值得、什麼場景別鬧
值得
- 敏感資料處理:法律、醫療、財務文件的摘要與整理——「不上傳」本身就是賣點的全部。
- 大批量的封閉任務:分類、貼標、抽取欄位、格式轉換,跑一整夜也不用看帳單。
- 產品原型:開發階段用本地模型迭代,省下 API 費用,上線再換雲端。
- 學習:想真正理解 LLM 怎麼運作,自己跑一次勝過讀十篇文章。
別鬧
- 當主力生產力工具:寫重要文件、解困難的程式問題——頂級雲端模型的品質差距,會讓你每天多花的時間遠超過省下的訂閱費。
- 為了省錢而省錢:如果你的用量只是每天聊幾輪,訂閱或免費額度比買硬體便宜得多。先算數學再刷卡。
- 不想維護任何東西的人:模型更新、工具升級、參數調校都是你自己的事。這是養寵物,不是買家電。
務實的混合策略
其實這不是單選題。越來越多人的配置是:敏感的、批量的交給本地;困難的、重要的交給雲端。用 Ollama 的本地 API 加上一層簡單的路由,甚至可以讓工具自動分流。把本地 LLM 當成工具箱裡的一把新工具,而不是一種信仰,你會用得最舒服。
結語
本地 LLM 已經過了「極客玩具」階段,但還沒到「人人該用」的程度。如果你的需求命中隱私、批量、離線這三個關鍵字之一,週末花兩小時裝個 Ollama 試試,很可能會回不去;如果沒有,繼續用雲端服務完全沒問題——工具的價值在解決你的問題,不在它跑在哪裡。