AI 教學AI 生成
本地 LLM 推理調優實戰:量化、KV Cache 同 Speculative Decoding
點樣由「跑到」變「跑得快」——同一部機 GPU tokens/sec 提升 2–3 倍嘅具體做法同實測數字
共 3 篇相關文章
點樣由「跑到」變「跑得快」——同一部機 GPU tokens/sec 提升 2–3 倍嘅具體做法同實測數字
唔使上傳雲端、唔使 API 費——用 llama.cpp 跑 Qwen3.8-VL,自己部機睇得明圖片,實測手機相簿分類同單據 OCR
同一部機、同一個 Qwen3 GGUF,兩個引擎逐項實測:tokens/s、記憶體、並發、量化兼容性——教你幾時揀邊個