Ollama、Gemma、審查/未審查一次搞懂
你平常用的 ChatGPT、Claude、Gemini,全部都是「雲端模型」——
運算在別人的伺服器上做,你只是連線過去用。
但其實 AI 模型也可以直接裝在自己的電腦裡跑,這叫「本機模型」或「地端模型」。
這篇先把「雲端 vs 本機」「Ollama 是什麼」「Gemma 是什麼」「審查跟未審查差在哪」這些基礎名詞一次講清楚,
之後聽到這些詞不會霧煞煞。
雲端模型:像叫外送。
廚師手藝好(模型能力強)、菜色多(功能齊全),
但你要付錢、要等(可能排隊或限流量)、東西要經過別人的廚房(資料會傳到對方伺服器)。
本機模型:像自己家裡開伙。
免費、想煮隨時煮、食材(資料)都在自己家沒外流,
但受限於你家廚房的設備(電腦硬體),煮出來的菜通常比不上五星主廚。
本機模型吃的主要是「記憶體(RAM)」。先查自己有多少,再對號入座:
| 你的記憶體 | 能跑的等級 | 白話定位 |
|---|---|---|
| 8GB | 7B 級 | 小電腦入門,體驗用 |
| 16GB | 12B 級 | 最多人的甜蜜點,主流筆電就是這級 |
| 32GB 以上 | 35B 級 | 能力開始接近雲端模型 |
模型選擇很多,但新手第一顆不用比來比去:
16GB 記憶體的電腦直接下載 Gemma 4 12B(Google 出的),下載時挑「一般版」就好。
8GB 的選 Qwen3 7B,32GB 以上的選 Qwen3.6-35B。
等你用熟了、有特殊需求(例如寫作不想被拒答),再回來看下面的完整比較表。
本機模型最適合「量大、重複、不用最高品質」的任務,這部分從此免費:
因為分工的邏輯跟請人很像:
它 24 小時待命、多件事並行、隨叫隨到、不會請假離職,
成本是訂閱費或電費而不是月薪。
差別在於——需要創意、人際判斷、負最終責任的事,仍然只有真人做得到。
所以合理的用法是:把重複的雜事交給 AI(本機免費模型就能扛一大段),
把真人的時間留給只有人能做的事。
這是 Ollama 官方模型庫的實際下載次數排名(2026/8 查詢),代表全世界最多人真的在用的本機模型:
| 排名 | 模型 | 家族/出處 | 下載次數 |
|---|---|---|---|
| 1 | Llama 3.1 | Meta | 約 1.18 億次 |
| 2 | DeepSeek-R1 | DeepSeek | 約 7,900 萬次 |
| 5 | Gemma3 | 約 3,960 萬次 |
資料來源:Ollama 官方模型庫下載統計(2026/8 查詢),詳見 Morph/BenchLM 等公開整理文章。
下面這張表整理的是查詢公開資料與社群評測彙整出來的參考,不是我自己實機跑分測出來的數字,僅供方向參考。
| 模型 | 家族/出處 | 參數量 | 審查狀態 | 適合場景 |
|---|---|---|---|---|
| Qwen3.6-35B-A3B | 阿里 Qwen | 35B(只啟動 3B) | 一般版 | 32GB 記憶體等級最推的全能款,速度像小模型、能力接近大模型 |
| Gemma 4 12B 新手選這個 | Google Gemma | 12B | 一般版 | 16GB 記憶體等級的稱職小助手,新手第一顆就選它 |
| Qwen3 7B | 阿里 Qwen | 7B | 一般版 | 7-8B 等級裡寫程式能力最強的一支 |
| Dolphin 3.0 Mistral | 社群微調(基於 Mistral) | 視版本而定 | 未審查 | 拒答率低、體積小,寫作/創作用途口碑不錯 |
| Hermes 3 (Llama 3.3) | 社群微調(基於 Llama) | 視版本而定 | 未審查 | 拒答率低、指令遵循能力強 |
| Gemma Abliterated 9B | 社群去審查版(基於 Gemma) | 9B | 未審查 | 拿掉拒答機制後推理能力幾乎沒掉,12GB 等級可跑 |
資料整理自 Hugging Face、Morph、InsiderLLM、Apidog 等公開文章(2026/8 查詢),實際表現以你自己跑起來的感受為準。
不會,至少現階段不會。
本機模型的角色是「省成本的工作馬」,處理量大、不需要頂級品質的任務;
重要的、要對外交付的、需要最強推理能力的事,還是雲端頂級模型比較可靠。
不用。用 Ollama 這類工具,基本上是打開軟體、選一個模型下載、就能開始對話,跟裝一般 App 差不多。
未審查模型本身是公開的開源技術,下載使用不違法。
但拿掉拒答限制,代表使用者自己要為輸出內容負更多責任,
用途上要自己拿捏分寸。
三個其實是同一套核心的不同包裝:
底層都是 llama.cpp 這個開源引擎,Ollama 和 LM Studio 是把它包得更好用的外殼。
新手用 Ollama(指令最簡單)或 LM Studio(有完整圖形介面)都是主流正解;
追求極限效能的高手才會直接操作 llama.cpp,Mac 上的進階玩家還會用蘋果的 MLX 框架再快一截。
先從好用的開始,覺得不夠再往下層走。
可以,但模型要挑小一點的(例如 7B 等級),
記憶體越大能跑的模型越大越聰明。
一般 16GB 記憶體以上的電腦就能開始體驗。
覺得有用?引用這篇分享給更多人