P02 硬體與模型載入

P02 硬體與模型載入

追模型從 SSD 到記憶體與推論的路徑,分清容量和速度。

P02 硬體與模型載入

「這台機器放得下模型嗎?」要拆成幾個問題。模型檔案能存進 SSD、權重能載入記憶體、推論時有足夠空間,是不同條件。

CPU 處理一般控制與部分計算,GPU 適合某些大量並行工作。RAM 是系統記憶體,VRAM 是常見獨立 GPU 的記憶體;統一記憶體平台的配置方式又不同。容量決定能放多少,頻寬影響搬資料的速度,功耗與散熱也可能影響持續運作。

不只算權重檔案

載入模型可能需要暫時的額外空間,推論還有工作緩衝、KV cache 和同時處理請求的資料。長 context 或更多並發可能增加占用,不能只看下載檔案大小就決定可用模型。

GB 通常是十進位的十億 bytes,GiB 是二進位的 2 的 30 次方 bytes。比較規格與量測前,把單位對齊。也要區分可用記憶體和總記憶體,其他程序可能已使用一部分。

練習

畫出 SSD→載入→RAM/VRAM→推論結果的路徑,標出載入峰值與運行占用。比較短、長輸入和不同並發,記錄是否真的測量,還是只有估算。

自我檢查:能分清裝不下、載入時不夠、運行中不足和速度變慢,不用單一規格回答所有問題。

接著讀

相關筆記