記憶體,才是地端 AI 真正的門檻
很多人以為地端 AI 卡在「算力不夠快」,其實在推理階段,也就是拿訓練好的模型來回答問題的時候,多數情況先卡住你的不是速度,而是「東西塞不塞得進顯卡」。一張 GPU 能用的記憶體是固定的,模型一旦裝不下,連跑都跑不起來,根本談不上快慢。所以規劃地端硬體,第一件事永遠是先算記憶體帳。
這筆記憶體帳,主要由三塊組成:
- 模型權重本身,也就是那幾百億個參數要佔的空間。
- KV 快取,對話過程中暫存的中間結果。
- 框架與運算的臨時開銷,推理引擎自己也要用掉一些。
把這三塊加起來,再抓一點安全邊界,才是你真正需要的 VRAM。下面一塊一塊拆給你看。
第一塊:模型權重怎麼算
語言模型的「參數量」直接決定權重要佔多少記憶體。算法其實很單純,就是參數數量乘上每個參數佔的位元組數:
- 全精度 FP32:每個參數 4 位元組。
- 半精度 FP16 / BF16:每個參數 2 位元組。
- 8 位元 INT8:每個參數約 1 位元組。
- 4 位元 INT4:每個參數約 0.5 位元組。
第二塊:量化不是只能憑感覺判斷,是有損壓縮
量化這個詞聽起來很玄,講白了就是「把模型參數從高精度換成低精度來省記憶體」,本質上是一種有損壓縮,概念跟把無損音樂轉成 MP3 有點像,體積小很多,但大部分人聽不太出來差別。
機制上要分兩種講清楚。一種是只壓權重,推理時再把數值還原回來運算;另一種是連運算中間的激活值也一起壓。地端問答、客服這類場景,最常用的是只壓權重的 4 位元方案,因為它省得最多、傷得最少。坊間常見的幾種做法,可以簡單這樣理解:
- 一類是事後校準的方法(如 GPTQ),拿一小批資料去逼近原本的權重分布,轉換快、在 GPU 上吞吐好,適合高流量的生產環境。
- 一類是看激活值下手的方法(如 AWQ),會特別保護那些對輸出影響最大的關鍵權重,通常在同樣 4 位元下品質保留得更好一點。
- 一類是彈性格式(如 GGUF),可以在 GPU 和 CPU 之間分工,記憶體真的很吃緊時,能把一部分權重丟到系統記憶體去撐,代價是速度變慢。
- 還有 FP8 這種折衷選項,精度比 INT4 好、又比 FP16 省,越來越多新一代硬體原生支援。
不同模型、資料集、提示、判分方式與正式流量,結果可能差很多。公開 benchmark 只能用來理解方法,不能直接當成專案承諾;驗收應使用公司自己的題庫,分別記錄正確率、引用支持率、拒答、延遲、成本與人工覆核量。
不過有個邊界一定要講清楚,量化不是免費午餐。模型越小、位元壓得越低,退化就越明顯;碰到需要精密數學、長串邏輯推理、或程式碼生成的任務,4 位元有時會露餡,這時候寧可退一步用 8 位元或 FP8。所以正確的心態是,量化是把大模型塞進可負擔硬體的利器,但要依任務挑對位元數,不是無腦一律壓到最低。
第三塊:別忘了 KV 快取這頭吃記憶體的怪獸
這是最多人踩的坑。大家算完權重就以為結束了,結果一上線併發人數一多,記憶體立刻爆掉,問題就出在 KV 快取。
模型每回答一段話,會把前文算過的中間結果暫存起來,避免重複計算,這就是 KV 快取。它的大小會隨著上下文長度和同時服務的人數接近線性地膨脹。舉個實際數字,一個 70B 模型在半精度下,每一個 token 大約要多吃 0.3 MB 的 KV 快取。聽起來不多,但如果你要支援很長的上下文,比方十幾萬 token 的長文件問答,光是一個請求的 KV 快取就可能吃掉將近 40 GB,這數字甚至逼近權重本身。
所以真正的記憶體公式,應該長這樣:
- 總 VRAM ≒ 量化後的權重 +(單人上下文長度 × 併發人數)換算出的 KV 快取 + 15% 到 25% 的框架開銷
換句話說,同一顆模型,你打算給 5 個人用短問答,跟給 50 個人做長文件分析,需要的顯卡可以差好幾個檔次。這也是為什麼網路上那種「跑某某模型要幾 GB」的懶人表,幾乎都不能直接照抄,它們往往只算了權重,沒把你的真實併發與上下文算進去。
併發與吞吐:怎麼估「幾個人能同時用」
好消息是,現代的開源推理框架已經把記憶體用得很省。它們會用分頁式的管理,把 KV 快取切成小塊、按需分配,避免傳統做法那種動輒浪費八成記憶體的窘境;再搭配連續批次處理,把多個使用者的請求併在一起算,整體吞吐往往能一口氣拉高好幾倍。
不是越大越好:先定任務,再回推硬體
講到這裡,最重要的觀念要出來了,選型的邏輯應該反過來走。不是先挑一顆最大最猛的模型,再想辦法湊硬體;而是先問清楚「我這個任務到底需要多強的模型」,再回推所需記憶體,最後才決定買哪張卡。
2026 年有一大票中小型開源模型,從幾十億到三十幾億參數這個等級,量化之後在相當親民的硬體上就能跑得順。再搭上 RAG,也就是把你公司的內部文件建成知識庫、讓模型回答前先去查資料,針對自家業務問答的表現已經相當堪用,很多時候比硬上一顆超大模型還準、還省。
成本要算總帳,更要算利用率
最後來談錢。地端的成本從來不只是那張顯卡,主機、電力、散熱、機房空間、還有後續的維運人力,全都要進帳本。一次性投入確實比較高,但長期到底划不划算,關鍵其實藏在一個很多人忽略的變數,就是利用率。
- 資料敏感、法遵或資料主權要求高,東西不能出公司,地端幾乎是唯一解。
- 用量大又穩定、GPU 能長時間高檔運轉,地端的長期成本優勢很明顯。
- 用量零星、尖峰離峰落差很大,先用雲端或混合架構,別急著砸硬體。
一次性投入雖高,但在對的情境下,回本可能比你想的快;反過來,情境不對,買回來的卡天天曬太陽,才是最貴的浪費。
幾個最常見的誤區,幫你先避開
- 只算權重、忘了 KV 快取:併發和長上下文一上來,記憶體照樣爆。
- 一律把模型壓到最低位元:省是省了,但碰到推理、數學、程式任務容易露餡。
- 照抄網路懶人表:沒把你的真實併發與上下文算進去,那些數字不能盡信。
- 一味追大模型:多數業務用小模型加 RAG 就夠,還更省更快。
- 只比硬體單價、不算利用率與總帳:買得起不等於划算,用得滿才是關鍵。
廷皓科技就在高雄,我們協助南台灣的企業做地端 AI 的硬體評估、量化策略與總體成本試算,會照你真實的併發人數、上下文長度與任務難度,規劃出剛好夠用、不浪費的方案,也能一併把 RAG 私有知識庫搭起來。與其對著網路上的規格表瞎猜,不如帶著你的實際場景來,我們一起把這筆帳算清楚。