量化(Quantization)入門:點樣喺細卡上面跑大模型
GGUF、GPTQ、AWQ 三大格式對比,Q4/Q5/Q8 點揀最抵
重點整理
- 一文搞懂量化原理:點解 4-bit 模型可以慳 60% 記憶體而質素無大損失
- GGUF(llama.cpp)、GPTQ、AWQ 三大主流格式適用場景完整對比
- Q4_K_M / Q5_K_M / Q8_0 實測對比:邊個性價比最高
- 用 Ollama 實戰:一條命令將 70B 模型塞入 32GB 顯示卡
什麼是量化?
模型訓練時參數多用 16-bit 浮點數儲存,但推論時其實唔需要咁高精度。量化就係將權重「壓細」——例如由 16-bit 壓到 4-bit,記憶體需求即時跌超過一半,消費級顯示卡都跑到大模型。
三大格式點揀?
GGUF(llama.cpp):CPU/GPU 混合推理之王,Mac 用家首選,Ollama 底層就係佢。支援最大生態,Hugging Face 上下載量最多。
GPTQ:純 GPU 推理,速度快,但壓縮比例選擇較少(主要 4-bit)。
AWQ:質素保留最好嘅 4-bit 方案,適合追求準確度嘅 GPU 用家,vLLM 支援一流。
實測:Q4 vs Q5 vs Q8
用 Qwen3.8-14B 做 benchmark:Q4_K_M 質素保留約 97%,Q5_K_M 約 99%,Q8_0 基本無損失。考慮到記憶體慳幅,Q4_K_M 係大多數人嘅甜蜜點——除非你 VRAM 好充裕,否則 Q8 冇必要。
一條命令實戰
ollama run qwen3.8:14b-q4_K_M
Ollama 會自動下載 GGUF 量化版並啟用 GPU 加速。想再慳位可以加 --keep-alive 控制模型駐留記憶體。
揀模型心得
記住條公式:模型參數量 × 位元數 ÷ 8 ≈ 所需 GB(再加 10-20% 開銷)。14B 模型 Q4 大約要 9GB VRAM——一張 RTX 4070 就跑到。與其跑細模型嘅 Q8,不如跑大一級模型嘅 Q4,效果通常更好。
