主题
字号
PART V · 算力与推理
CHAPTER 27 ≈ 40 MIN READ

跑得动吗——显存数学与量化速算手册

上一章解剖了一张 GPU,这一章回答全书被预告过最多次的实用问题:**一个模型,我到底跑不跑得动?**前几卷已经零散地给过你几笔账(第一卷的"每 1B 参数约 2 GB"、第五章的 KV cache 公式、第二卷的"训练 16 字节/参数"),这里把它们收拢成一套完整的速算体系,再补上最后一块拼图——量化。这一章刻意写成"手册"风格:目标是你合上书之后,听到任何一个模型名字,十秒内能报出它的硬件需求量级。

2.1 推理显存的三笔账

推理时显存里躺着三样东西,逐笔清点:

**第一笔:权重(大头,固定开销)。**每个参数占用 = 精度位数 ÷ 8 字节。16 位(BF16/FP16)时每 1B 参数 2 GB——这是速算的基准锚点:

$$ \text{权重显存} \approx \text{参数量(B)} \times \frac{\text{位数}}{8} \text{ GB} $$

再次强调那个新手最常掉的坑(第一卷讲过):MoE 按总参数算显存——激活参数只省计算,不省"待命"的显存。

**第二笔:KV cache(随对话增长的变量)。**第一卷第五章的公式与数字直接搬来:架构决定单价——GQA 的 70B 级模型约 320 KB/token,MLA 的 DeepSeek-V3 约 69 KB/token;乘以上下文长度就是总账。一条 128K 的长对话,前者要 40 GB、后者只要 8.6 GB——这笔账单在多用户服务时按并发数放大,是决定"一张卡能同时服务多少人"的关键变量。

**第三笔:激活值与杂项(零头)。**推理的激活值只需保留当前步(不像训练要存全程反传用),加上框架开销,一般预留 10–20% 的余量即可。

三笔合一,得到速算总式:推理显存 ≈ 权重 + 并发数 × 上下文 × KV 单价 + 15% 余量。练两个实战:单人本地跑一个 4 位量化的 32B 模型?$32 \times 0.5 \times 1.15 \approx 18$ GB——一张 24 GB 的消费级旗舰卡(如 RTX 4090)刚好从容。公司想自托管 671B 的 DeepSeek 服务五十个并发、平均 8K 上下文?8 位权重 671 GB + $50 \times 8000 \times 69\text{KB} \approx 28$ GB,合计约 800 GB——十张 80 GB 卡起步,必须多卡多机。你已经能做产能规划了。

对照组:训练显存 ≈ 16 字节/参数(第二卷的账:权重+梯度+高精度母版+优化器两矩),是推理 16 位的 8 倍、还没算激活——"跑得动推理"和"训得动"之间隔着一个数量级,这是"人人能用开源模型、极少人能训开源模型"的物理根源。

2.2 量化:把每个数字说得更短

三笔账里权重是大头,而压缩权重的手段就是量化(quantization):用更少的比特表示每个参数。16 位是训练的通行精度,但推理时真的需要每个权重都精确到小数点后四位吗?实践给出的答案惊人地宽容。

原理可以用一个类比说透:权重是一群"身高各异的人",量化是把连续的身高换成有限档位的"号码牌"。位数越少、档位越少、误差越大——但神经网络对这种误差有天然的免疫力:第一卷讲过残差流里的信息以冗余方式分布(叠加),单个权重的小扰动会被群体平均掉。工程上还有两件武器:分组缩放(每一小块权重配一个自己的缩放因子,让有限档位贴着本地数值范围用——第二卷 FP8 训练里见过同款思想);离群值特殊处理(少数权重异常大,单独拎出来高精度存,剩下的放心压)。

质量代价的行业共识口径:8 位几乎无损(与 16 位的差距在测量噪声内),是 2026 年服务部署的默认档;4 位轻微有损(简单任务无感,数学、代码等精细推理任务掉零点几到几个点),是本地部署与走量场景的主流档;再往下(3 位、2 位)损失明显加速,属于实验区。所以你看到的社区模型文件名里那些后缀——FP8INT4AWQGPTQQ4_K_M——都只是"4 位或 8 位量化的不同工艺流派",看懂位数就看懂了大局。

量化的谱系里还有一条重要的分界线:事后量化 vs 原生量化。事后量化(PTQ)是训练完再压——便宜通用,上面说的损失口径指的是它。原生量化(QAT,量化感知训练)则在训练后期就让模型"戴着镣铐跳舞"——在低精度约束下继续训练,让权重自己适应档位。第一卷读发布时见过的 Kimi K3 的 MXFP4 权重、以及一些开源模型直接以 4 位形态发布,就是 QAT 交付:厂商替你把量化损失在训练里消化掉了,拿到手的低位模型就是"官方满血版"。这是 2025–26 年的新趋势——量化从用户侧的省钱技巧,前移成了厂商侧的交付格式。

易错点

量化压的是权重的存储与搬运,它同时带来速度收益——第一卷讲过 decode 是访存受限的,权重字节数减半、每 token 的搬运时间就近乎减半,所以 4 位模型不仅省显存还明显更快。但注意两件它不做的事:量化不减少参数数量(模型"知道的东西"没变少,只是记得糙了),也基本不省 KV cache(那要靠 MLA/量化 KV 等另外的手段)。"量化"与"蒸馏"(第四卷)的分工由此清晰:要塞进更小的显存,先量化;显存还不够,才换蒸馏的小模型——前者保知识损精度,后者直接换一个更小的脑子。

2.3 一页速查表

把全章压缩成一张表,这是本书承诺过的"听到模型名字报硬件"的兑现(数值按 2026 年主流卡:消费级 24–32 GB,数据中心 80–192 GB):

模型量级 16 位 8 位 4 位 部署位置
7–9B 14–18 GB 7–9 GB 4–5 GB 手机/笔记本 NPU(4 位)、单消费卡
30–34B 60–70 GB 30–35 GB 15–18 GB 单消费卡(4 位)、单数据中心卡
70B 140 GB 70 GB 35 GB 双消费卡(4 位)、1–2 张数据中心卡
100–400B MoE 200–800 GB 半价 再半价 多卡单机 → 多机
671B–1T+ MoE 1.3–2 TB+ 半价 再半价 多机集群,专业部署

另加三条速算口诀收束:权重 = 参数 ×(位数/8)GB;并发的显存在 KV cache 里;训练 = 推理 × 8 起步。掌握这三条,你在任何"这模型要什么配置"的讨论里都不会再是听众。

下一章走进真正的生产现场:当几万个用户的请求同时涌向一个模型集群,工程师们如何把每一分显存和每一毫秒榨干——以及这一切最终如何定价成你在 API 账单上看到的那几个数字。


本章要点