P05 推論加速與量測
依瓶頸選量化、快取或並發調整,同時檢查品質與資源。
P05 推論加速與量測
優化前先找瓶頸:是模型載入慢、第一個 token 等很久、每次生成慢,還是同時請求多時開始排隊?不同問題不能只靠同一個開關解決。
Quantization 減少數值表示的精度與儲存需求,可能影響品質。Pruning 移除部分結構,Distillation 用較小模型學習較大模型的行為。KV cache 在生成時保存可重用的中間資料,也會占用記憶體。Batch 和並發改變資源的使用方式,吞吐與單次等待可能互相取捨。
先測原版本
固定模型、硬體、輸入長度、輸出限制與請求數,記錄品質、延遲和記憶體。只改一個主要條件再比較,才知道差異來自哪裡。工具例如 vLLM 或 TensorRT 系列有各自支援條件,不能把名稱直接當成加速保證。
若量化後速度較快,但對關鍵欄位的判斷變差,就需要評估能否接受。只報 tokens/sec,容易漏掉第一次等待、載入時間或真實任務的結果。
練習
提出一個具體瓶頸,寫出可能原因、要改的條件、量測方式和品質檢查。沒有可用硬體時先交實驗設計,標明尚未得到實測結果。
自我檢查:能說明優化在哪裡生效、哪些條件保持相同,以及省下資源時付出了什麼代價。