P02 硬體與模型載入
追模型從 SSD 到記憶體與推論的路徑,分清容量和速度。
P02 硬體與模型載入
「這台機器放得下模型嗎?」要拆成幾個問題。模型檔案能存進 SSD、權重能載入記憶體、推論時有足夠空間,是不同條件。
CPU 處理一般控制與部分計算,GPU 適合某些大量並行工作。RAM 是系統記憶體,VRAM 是常見獨立 GPU 的記憶體;統一記憶體平台的配置方式又不同。容量決定能放多少,頻寬影響搬資料的速度,功耗與散熱也可能影響持續運作。
不只算權重檔案
載入模型可能需要暫時的額外空間,推論還有工作緩衝、KV cache 和同時處理請求的資料。長 context 或更多並發可能增加占用,不能只看下載檔案大小就決定可用模型。
GB 通常是十進位的十億 bytes,GiB 是二進位的 2 的 30 次方 bytes。比較規格與量測前,把單位對齊。也要區分可用記憶體和總記憶體,其他程序可能已使用一部分。
練習
畫出 SSD→載入→RAM/VRAM→推論結果的路徑,標出載入峰值與運行占用。比較短、長輸入和不同並發,記錄是否真的測量,還是只有估算。
自我檢查:能分清裝不下、載入時不夠、運行中不足和速度變慢,不用單一規格回答所有問題。