把 AI 搬回自己電腦:本地 LLM 的真實取捨

為什麼有人要自己跑模型?

雲端 AI 服務這麼方便,為什麼還有一群人堅持在自己電腦上跑開源模型?三個動機都很實在:

但這三個好處都有對應的代價。先把代價講清楚,你再決定。

代價一:品質差距是真的

先說最重要的實話:你筆電上跑得動的模型,跟頂級雲端模型之間存在真實的能力差距。開源模型進步神速,中小型模型在摘要、翻譯、分類、格式轉換這類「範圍明確」的任務上已經非常好用;但在複雜推理、長篇寫作、艱難的程式問題上,差距依然明顯。

正確的期待是:本地模型是「夠用就好」哲學的勝利,不是「免費的頂級模型」。任務越封閉、越格式化,本地模型越能勝任;任務越開放、越吃推理深度,你越會想念雲端。

代價二:硬體門檻,用白話講

模型大小用參數量(B,十億)計,跑起來主要吃記憶體。幾個粗略的量級感:

讓小硬體跑大模型的關鍵技術叫量化(quantization):把模型權重的精度壓低來換記憶體空間,白話說就是「有損壓縮」。壓得越狠、檔案越小、品質掉得越多;主流的中度量化通常是甜蜜點。另外,Apple Silicon 的統一記憶體架構讓 Mac 意外地成為本地 LLM 的優質平台——這是少數「買 Mac 對 AI 有利」的真實場景。

工具怎麼選

什麼場景值得、什麼場景別鬧

值得

別鬧

務實的混合策略

其實這不是單選題。越來越多人的配置是:敏感的、批量的交給本地;困難的、重要的交給雲端。用 Ollama 的本地 API 加上一層簡單的路由,甚至可以讓工具自動分流。把本地 LLM 當成工具箱裡的一把新工具,而不是一種信仰,你會用得最舒服。

結語

本地 LLM 已經過了「極客玩具」階段,但還沒到「人人該用」的程度。如果你的需求命中隱私、批量、離線這三個關鍵字之一,週末花兩小時裝個 Ollama 試試,很可能會回不去;如果沒有,繼續用雲端服務完全沒問題——工具的價值在解決你的問題,不在它跑在哪裡。