本地 LLM 推理調優實戰:量化、KV Cache 同 Speculative Decoding
點樣由「跑到」變「跑得快」——同一部機 GPU tokens/sec 提升 2–3 倍嘅具體做法同實測數字
共 20 篇相關文章
點樣由「跑到」變「跑得快」——同一部機 GPU tokens/sec 提升 2–3 倍嘅具體做法同實測數字
唔使上傳雲端、唔使 API 費——用 llama.cpp 跑 Qwen3.8-VL,自己部機睇得明圖片,實測手機相簿分類同單據 OCR
向量搜尋搵返嚟嘅 top-5 未必係最相關嗰 5 篇——由 bi-encoder 到 cross-encoder,用本地模型實測重排前後嘅答案質素差距
唔再靠「求」模型聽話——由 GBNF 語法、JSON Schema、到驗證重試迴圈,一步步將本地 LLM 接入真實程式
同一部機、同一個 Qwen3 GGUF,兩個引擎逐項實測:tokens/s、記憶體、並發、量化兼容性——教你幾時揀邊個
128 / 512 / 1024 token、overlap、語義分塊——本地 Qwen3 + 向量 DB 實測邊個設定最抵
唔好靠 vibe check——用 promptfoo 加自製港式測試集,量化的 model 揀 model 先唔會買錯
7B 級 model 點樣穩定呼叫工具——schema 設計、retry 策略、Ollama structured output 實測心得
RAG、工具結果、記憶、對話歷史點擺位——本地 LLM 實測邊種擺法出嚟答案最準
Prompt caching 係咩、邊啲 API 支援、點設計先 cache 得中——附 Python 實測對比
JSON mode、function calling、json_schema 三層做法逐一講,附 Python 實戰代碼