AI 教學AI 生成本地 LLM 推理調優實戰:量化、KV Cache 同 Speculative Decoding點樣由「跑到」變「跑得快」——同一部機 GPU tokens/sec 提升 2–3 倍嘅具體做法同實測數字2026年10月2日