人來過

本機 AI 模型入門教學

Ollama、Gemma、審查/未審查一次搞懂

← 返回首頁免費教學·關於我·Threads
0
程式背景需求
7
個核心名詞
2026/8
最新模型排行

為什麼要懂「本機模型」這件事?

你平常用的 ChatGPT、Claude、Gemini,全部都是「雲端模型」——
運算在別人的伺服器上做,你只是連線過去用。
但其實 AI 模型也可以直接裝在自己的電腦裡跑,這叫「本機模型」或「地端模型」。
這篇先把「雲端 vs 本機」「Ollama 是什麼」「Gemma 是什麼」「審查跟未審查差在哪」這些基礎名詞一次講清楚,
之後聽到這些詞不會霧煞煞。

1
先懂一個觀念:雲端 vs 本機
用叫外送 vs 自己開伙來比喻
比喻

雲端模型 = 叫外送,本機模型 = 自己開伙

雲端模型
ChatGPT・Claude・Gemini
叫外送
對比
本機模型
裝在自己電腦
自己開伙

雲端模型:像叫外送。
廚師手藝好(模型能力強)、菜色多(功能齊全),
但你要付錢、要等(可能排隊或限流量)、東西要經過別人的廚房(資料會傳到對方伺服器)。

本機模型:像自己家裡開伙。
免費、想煮隨時煮、食材(資料)都在自己家沒外流,
但受限於你家廚房的設備(電腦硬體),煮出來的菜通常比不上五星主廚。

白話一句話:本機模型不是要取代雲端模型,
是拿來做「量大、不用最高品質、想省錢、想離線」的事情,
重要的事還是交給雲端頂級模型。

2
常用名詞解釋
看到這些字不再霧煞煞
工具
Ollama 是什麼?
一個讓你在自己電腦上「下載+執行」AI 模型的軟體。它本身不是模型,是跑模型的容器/播放器。
比喻:Ollama 就像 Netflix 這個 App——App 本身不是電影,是拿來播放各種電影(模型)的平台。
模型家族
Gemma 是什麼?
Google 出的一系列開源 AI 語言模型的名字,
是一個「模型家族」,不是工具、也不是公司名。
像 Llama 是 Meta 出的、Qwen 是阿里出的,Gemma 就是 Google 出的那一支。
比喻:如果 Ollama 是 Netflix,Gemma 就是某一部影集的名字,是「內容」不是「平台」。
規格
參數量(7B/32B/70B)是什麼?
代表這個模型的「腦容量」,B 是 Billion(十億)的縮寫。
7B 代表 70 億個參數,32B 就是 320 億個。
數字越大,通常越聰明,但也越吃電腦資源(記憶體、速度)。
比喻:像大腦裡的神經元數量,神經元越多通常越聰明,但也需要更大的「頭」(更多記憶體)才裝得下。
壓縮
量化(quantization/4-bit)是什麼?
把模型「瘦身」,讓它變小、跑更快,但精準度會打一點折扣。「4-bit 量化」是目前最常見的瘦身程度,通常肉眼感覺不出差別。
比喻:像把一張高畫質照片壓縮成小檔案傳 LINE——檔案小很多、傳輸快很多,畫質打一點折但通常看不太出來。
安全限制
審查/未審查(censored/uncensored)是什麼?
「審查」代表模型被訓練成會拒絕回答某些敏感、爭議、邊緣問題
(例如 ChatGPT、Claude 這類商業模型都有這層限制)。
「未審查」代表這層限制被拿掉或減少,模型比較不會拒答。
未審查不等於會主動教壞人做壞事,是「限制變少」,不是「沒有底線」。
比喻:審查版像有家長監控的電視頻道,未審查版像沒有分級限制的頻道——內容一樣不會憑空變出來,差別在「會不會因為主題敏感就整台拒播」。
技術做法
Abliterated(去審查手術)是什麼?
一種讓模型變成「未審查」版本的具體技術做法。
是社群拿現成模型(例如 Gemma、Llama)動手術,移除裡面負責「拒絕回答」的機制,
做出來的版本通常會標明 abliterated 這個字。
比喻:像把一台有安全鎖的機器拆掉安全鎖,機器本身沒變,只是拿掉了「碰到某些狀況就自動停機」的那個開關。
框架
MLX 是什麼?
蘋果公司自己開發的技術框架,讓 AI 模型能更貼合 Mac 的硬體架構(統一記憶體)來跑,同一顆模型用 MLX 通常比用一般的通用工具跑得快。
比喻:像蘋果自己做的原廠充電器,比副廠充電器更貼合自家設備,效率通常更好。

3
安裝到上手的三個步驟
不用寫程式,照做就好
步驟 1

先看你的電腦記憶體,決定跑得動哪一級

本機模型吃的主要是「記憶體(RAM)」。先查自己有多少,再對號入座:

你的記憶體能跑的等級白話定位
8GB7B 級小電腦入門,體驗用
16GB12B 級最多人的甜蜜點,主流筆電就是這級
32GB 以上35B 級能力開始接近雲端模型
怎麼查自己的記憶體:
Mac → 點左上角蘋果選單 →「關於這台 Mac」
Windows → 設定 → 系統 → 關於
看「記憶體」那一欄的 GB 數字就是了。
步驟 2

新手不用糾結,16GB 直接選 Gemma 4 12B

模型選擇很多,但新手第一顆不用比來比去:
16GB 記憶體的電腦直接下載 Gemma 4 12B(Google 出的),下載時挑「一般版」就好。
8GB 的選 Qwen3 7B,32GB 以上的選 Qwen3.6-35B
等你用熟了、有特殊需求(例如寫作不想被拒答),再回來看下面的完整比較表。

步驟 3

先把這四種工作交給它

本機模型最適合「量大、重複、不用最高品質」的任務,這部分從此免費:

  • 翻譯文件——外文文章、信件丟給它翻
  • 摘要長文——長報告、長影片逐字稿抓重點
  • 報告草稿——先讓它打第一版,你再修
  • 分類整理——一堆筆記、資料丟給它分門別類
重要的、要對外交付的、需要最強推理的,仍建議用雲端頂級模型。
本機模型是幫你把「量大的雜事」變免費,不是取代一切。
觀念

為什麼有人把 AI 叫「AI 員工」?

因為分工的邏輯跟請人很像:
它 24 小時待命、多件事並行、隨叫隨到、不會請假離職,
成本是訂閱費或電費而不是月薪。
差別在於——需要創意、人際判斷、負最終責任的事,仍然只有真人做得到。
所以合理的用法是:把重複的雜事交給 AI(本機免費模型就能扛一大段),
把真人的時間留給只有人能做的事。


4
2026/8 本機模型能力比較表
查資料彙整,不是我實機測試過的結果
最多人在用

Ollama 官方庫下載量排行

這是 Ollama 官方模型庫的實際下載次數排名(2026/8 查詢),代表全世界最多人真的在用的本機模型:

排名模型家族/出處下載次數
1Llama 3.1Meta約 1.18 億次
2DeepSeek-R1DeepSeek約 7,900 萬次
5Gemma3Google約 3,960 萬次
注意:下載多不等於最好用。
下載量高通常是因為推出得早(累積時間長)、名氣大、入門教學多,
代表「最主流、出問題最好找解法」,不代表當下能力最強——
以 2026 年 8 月的表現來看,Llama 3.1 已被更新的模型超越。
要看當下真實能力,請看下面那張依用途挑選的推薦表。

資料來源:Ollama 官方模型庫下載統計(2026/8 查詢),詳見 Morph/BenchLM 等公開整理文章。

最新且適合你電腦

依用途挑選的最新推薦

下面這張表整理的是查詢公開資料與社群評測彙整出來的參考,不是我自己實機跑分測出來的數字,僅供方向參考。

模型家族/出處參數量審查狀態適合場景
Qwen3.6-35B-A3B阿里 Qwen35B(只啟動 3B)一般版32GB 記憶體等級最推的全能款,速度像小模型、能力接近大模型
Gemma 4 12B 新手選這個Google Gemma12B一般版16GB 記憶體等級的稱職小助手,新手第一顆就選它
Qwen3 7B阿里 Qwen7B一般版7-8B 等級裡寫程式能力最強的一支
Dolphin 3.0 Mistral社群微調(基於 Mistral)視版本而定未審查拒答率低、體積小,寫作/創作用途口碑不錯
Hermes 3 (Llama 3.3)社群微調(基於 Llama)視版本而定未審查拒答率低、指令遵循能力強
Gemma Abliterated 9B社群去審查版(基於 Gemma)9B未審查拿掉拒答機制後推理能力幾乎沒掉,12GB 等級可跑

資料整理自 Hugging Face、Morph、InsiderLLM、Apidog 等公開文章(2026/8 查詢),實際表現以你自己跑起來的感受為準。

跟社群共識對過了:
全世界最大的本機模型社群 r/LocalLLaMA(74 萬+ 成員)2026 年 7-8 月的討論整理裡,
被提到最多的兩個模型家族正是 Qwen3.6 和 Gemma 4——跟這張表的推薦一致。
記憶體更大(24GB 以上)的進階玩家則多選 Qwen3.6-27B 或 Gemma 4 更大的版本。
怎麼選?
先看你電腦的記憶體等級抓對應的參數量,一般用途選「一般版」就好;
如果你的需求是寫作、角色扮演、不想動不動被拒答,才需要考慮「未審查版」。

5
常見問題
看完這篇你可能會問的

本機模型會不會取代 ChatGPT、Claude?

不會,至少現階段不會。
本機模型的角色是「省成本的工作馬」,處理量大、不需要頂級品質的任務;
重要的、要對外交付的、需要最強推理能力的事,還是雲端頂級模型比較可靠。

裝本機模型需要懂寫程式嗎?

不用。用 Ollama 這類工具,基本上是打開軟體、選一個模型下載、就能開始對話,跟裝一般 App 差不多。

未審查模型合法嗎?安全嗎?

未審查模型本身是公開的開源技術,下載使用不違法。
但拿掉拒答限制,代表使用者自己要為輸出內容負更多責任,
用途上要自己拿捏分寸。

高手都用 Ollama 嗎?跟 LM Studio、llama.cpp 差在哪?

三個其實是同一套核心的不同包裝:
底層都是 llama.cpp 這個開源引擎,Ollama 和 LM Studio 是把它包得更好用的外殼。
新手用 Ollama(指令最簡單)或 LM Studio(有完整圖形介面)都是主流正解;
追求極限效能的高手才會直接操作 llama.cpp,Mac 上的進階玩家還會用蘋果的 MLX 框架再快一截。
先從好用的開始,覺得不夠再往下層走。

電腦規格不夠好,可以跑本機模型嗎?

可以,但模型要挑小一點的(例如 7B 等級),
記憶體越大能跑的模型越大越聰明。
一般 16GB 記憶體以上的電腦就能開始體驗。

覺得有用?追蹤我的帳號

更多 AI 工具教學 + 一人公司實戰分享

@kanisleo328

想跟大家一起學?

我開了一個免費的 LINE 學習社群,AI 工具問題可以直接問

加入 LINE 教學社群

覺得有用?引用這篇分享給更多人