本機 AI 模型入門教學
Ollama、Gemma、審查/未審查一次搞懂
黃志弘 Leo
2026-08-27 發佈 · 2026-08-29 更新 · 36 人看過
看這篇需要的程式背景是 0,會講到 7 個核心名詞,最後附上 2026/8 最新的模型排行。
雲端模型與本機模型
你平常用的 ChatGPT、Claude、Gemini,全部都是「雲端模型」——運算在別人的伺服器上做,你只是連線過去用。但其實 AI 模型也可以直接裝在自己的電腦裡跑,這叫「本機模型」或「地端模型」。
這篇先把「雲端 vs 本機」「Ollama 是什麼」「Gemma 是什麼」「審查跟未審查差在哪」這些基礎名詞一次講清楚,之後聽到這些詞不會霧煞煞。
1先懂一個觀念:雲端 vs 本機
雲端模型 = 叫外送,本機模型 = 自己開伙
叫外送
自己開伙
雲端模型:像叫外送。廚師手藝好(模型能力強)、菜色多(功能齊全),但你要付錢、要等(可能排隊或限流量)、東西要經過別人的廚房(資料會傳到對方伺服器)。
本機模型:像自己家裡開伙。免費、想煮隨時煮、食材(資料)都在自己家沒外流,但受限於你家廚房的設備(電腦硬體),煮出來的菜通常比不上五星主廚。
兩者實際差在運算在哪裡進行
雲端模型:模型在服務商的伺服器(GPU 叢集)上運算,你的電腦只負責送出輸入、接收結果。依用量或訂閱計費,有請求次數與每日額度限制;輸入的內容會傳到服務商處理,保存期間與是否用於訓練依各家隱私條款而定。
本機模型:模型檔下載到自己的電腦,用本機的 CPU/GPU 和記憶體運算,推論時不需要連網,資料不離開電腦。能跑多大的模型取決於記憶體容量(顯示卡的 VRAM,或 Mac 的統一記憶體),一般個人電腦常見是跑 70 億到 300 億參數的量化版本,能力通常低於雲端的旗艦模型。
2常用名詞解釋
Google 出的一系列開源 AI 語言模型的名字,是一個「模型家族」,不是工具、也不是公司名。像 Llama 是 Meta 出的、Qwen 是阿里出的,Gemma 就是 Google 出的那一支。
代表這個模型的「腦容量」,B 是 Billion(十億)的縮寫。7B 代表 70 億個參數,32B 就是 320 億個。數字越大,通常越聰明,但也越吃電腦資源(記憶體、速度)。
「審查」代表模型被訓練成會拒絕回答某些敏感、爭議、邊緣問題(例如 ChatGPT、Claude 這類商業模型都有這層限制)。「未審查」代表這層限制被拿掉或減少,模型比較不會拒答。未審查只是拒答的限制變少,模型不會因此主動教人做壞事。
一種讓模型變成「未審查」版本的具體技術做法。是社群拿現成模型(例如 Gemma、Llama)動手術,移除裡面負責「拒絕回答」的機制,做出來的版本通常會標明 abliterated 這個字。
3安裝到上手的三個步驟
先看你的電腦記憶體,決定跑得動哪一級
本機模型吃的主要是「記憶體(RAM)」。先查自己有多少,再對號入座:
| 你的記憶體 | 能跑的等級 | 白話定位 |
|---|---|---|
| 8GB | 7B 級 | 小電腦入門,體驗用 |
| 16GB | 12B 級 | 最多人的甜蜜點,主流筆電就是這級 |
| 32GB 以上 | 35B 級 | 能力開始接近雲端模型 |
Mac → 點左上角蘋果選單 →「關於這台 Mac」
Windows → 設定 → 系統 → 關於
看「記憶體」那一欄的 GB 數字就是了。
新手不用糾結,16GB 直接選 Gemma 4 12B
模型選擇很多,但新手第一顆不用比來比去:16GB 記憶體的電腦直接下載 Gemma 4 12B(Google 出的),下載時挑「一般版」就好。8GB 的選 Qwen3.5 2B,32GB 以上的選 Qwen3.8 27B 或 Qwen3.6-35B。等你用熟了、有特殊需求(例如寫作不想被拒答),再回來看下面的完整比較表。
先把這四種工作交給它
本機模型最適合「量大、重複、不用最高品質」的任務,這部分從此免費:
- 翻譯文件——外文文章、信件丟給它翻
- 摘要長文——長報告、長影片逐字稿抓重點
- 報告草稿——先讓它打第一版,你再修
- 分類整理——一堆筆記、資料丟給它分門別類
重要的、要對外交付的、需要最強推理的,仍建議用雲端頂級模型。本機模型負責量大的雜事,這部分可以免費處理。
42026/8 本機模型能力比較表
查資料彙整,不是我實機測試過的結果
Ollama 官方庫下載量排行
這是 Ollama 官方模型庫的實際下載次數排名(2026/8 查詢),代表全世界最多人真的在用的本機模型:
| 排名 | 模型 | 家族/出處 | 下載次數 |
|---|---|---|---|
| 1 | Llama 3.1 | Meta | 約 1.18 億次 |
| 2 | DeepSeek-R1 | DeepSeek | 約 7,900 萬次 |
| 5 | Gemma3 | 約 3,960 萬次 |
注意:下載多不等於最好用。下載量高通常是因為推出得早(累積時間長)、名氣大、入門教學多,代表「最主流、出問題最好找解法」,不代表當下能力最強——以 2026 年 8 月的表現來看,Llama 3.1 已被更新的模型超越。要看當下真實能力,請看下面那張依用途挑選的推薦表。
資料來源:Ollama 官方模型庫下載統計(2026/8 查詢),詳見 Morph/BenchLM 等公開整理文章。
依用途挑選的最新推薦
下面這張表整理的是查詢公開資料與社群評測彙整出來的參考,不是我自己實機跑分測出來的數字,僅供方向參考。
| 模型 | 家族/出處 | 參數量 | 審查狀態 | 適合場景 |
|---|---|---|---|---|
| Qwen3.6-35B-A3B | 阿里 Qwen | 35B(只啟動 3B) | 一般版 | 32GB 記憶體等級最推的全能款,速度像小模型、能力接近大模型 |
| Gemma 4 12B 新手選這個 | Google Gemma | 12B | 一般版 | 16GB 記憶體等級的稱職小助手,新手第一顆就選它 |
| Qwen3.5 9B | 阿里 Qwen | 9B | 一般版 | Qwen3.5 小尺寸系列裡最大的一支,記憶體少的電腦可以改用同系列的 2B、4B |
| Dolphin 3.0 Mistral | 社群微調(基於 Mistral) | 視版本而定 | 未審查 | 拒答率低、體積小,寫作/創作用途口碑不錯 |
| Hermes 3 (Llama 3.3) | 社群微調(基於 Llama) | 視版本而定 | 未審查 | 拒答率低、指令遵循能力強 |
| Gemma Abliterated 9B | 社群去審查版(基於 Gemma) | 9B | 未審查 | 拿掉拒答機制後推理能力幾乎沒掉,12GB 等級可跑 |
資料整理自 Hugging Face、Morph、InsiderLLM、Apidog 等公開文章(2026/8 查詢),實際表現以你自己跑起來的感受為準。
跟社群共識對過了:全世界最大的本機模型社群 r/LocalLLaMA(74 萬+ 成員)2026 年 7-8 月的討論整理裡,被提到最多的兩個模型家族正是 Qwen3.6 和 Gemma 4——跟這張表的推薦一致。記憶體更大(24GB 以上)的進階玩家則多選 Qwen3.6-27B 或 Gemma 4 更大的版本。
5常見問題
本機模型會不會取代 ChatGPT、Claude?
不會,至少現階段不會。本機模型的角色是「省成本的工作馬」,處理量大、不需要頂級品質的任務;重要的、要對外交付的、需要最強推理能力的事,還是雲端頂級模型比較可靠。
裝本機模型需要懂寫程式嗎?
不用。用 Ollama 這類工具,基本上是打開軟體、選一個模型下載、就能開始對話,跟裝一般 App 差不多。
未審查模型合法嗎?安全嗎?
未審查模型本身是公開的開源技術,下載使用不違法。但拿掉拒答限制,代表使用者自己要為輸出內容負更多責任。
高手都用 Ollama 嗎?跟 LM Studio、llama.cpp 差在哪?
三個其實是同一套核心的不同包裝:底層都是 llama.cpp 這個開源引擎,Ollama 和 LM Studio 是把它包得更好用的外殼。新手用 Ollama(指令最簡單)或 LM Studio(有完整圖形介面)都是主流正解;追求極限效能的高手才會直接操作 llama.cpp,Mac 上的進階玩家還會用蘋果的 MLX 框架再快一截。先從好用的開始,覺得不夠再往下層走。
電腦規格不夠好,可以跑本機模型嗎?
可以,但模型要挑小一點的(例如 7B 等級),記憶體越大能跑的模型越大越聰明。一般 16GB 記憶體以上的電腦就能開始體驗。