推理工厂与价格标签——从 GPU 到账单
前两章解决了"跑得动吗";这一章看真实的生产现场——推理工厂:几万个用户的请求同时涌向一个集群,工程师怎么把每一分显存与每一毫秒榨干。这一章有一条贯穿的暗线值得先亮出来:API 价格表不是市场部拍的数字,而是这座工厂成本结构的公开化石——每一条定价规则背后,都站着一项本章要讲的技术。读完后你再看任何一家的价格页,看到的将是一份工程结构图。
3.1 两阶段:一次调用的两种物理
一次 API 调用在工厂里其实是两道完全不同的工序,这个区分是全章的地基(第一卷 5.1 节埋的种子在此发芽):
Prefill(预填充):把你的整段 prompt 一次性并行算完、填好 KV cache。几千个 token 同时过一遍模型——大矩阵乘法,GPU 算力被打满,是算力受限的工序。它决定你等待首字出现的时间(TTFT,首 token 延迟)。
Decode(解码):逐 token 生成回答。每个 token 都要把全部权重和不断变长的 KV cache 从显存读一遍,而计算只有薄薄一层——访存受限(第一卷的老结论),GPU 算力大量空转。它决定后续每个字蹦出来的节奏(TPOT,逐 token 间隔)。
同一块 GPU、同一个模型,两道工序的瓶颈资源完全不同:prefill 吃算力,decode 吃带宽和显存容量。这个物理差异是本章一切工程与一切定价的总根源——请带着它读完全章。
3.2 工厂的五件套
围绕两阶段的矛盾,2023–2026 年的推理工程沉淀出一套标准工艺,每件都可以用"解决什么浪费"一句话看穿:
连续批处理——解决"等最慢的人"。朴素做法是把一批请求捆在一起跑、整批等最长的那条生成完,短请求白白占着 GPU。连续批处理改为每生成一步就动态换人:谁完成谁下车、新请求随时上车。这一项改进的实测吞吐提升最高达二十倍量级,如今是所有引擎的空气般的默认。
分页 KV cache——解决"显存碎片"。早期系统按最大可能长度给每个请求预留连续显存,实测 60–80% 的 KV 显存被白白浪费。vLLM 的 PagedAttention 把操作系统的内存分页思想搬进来:KV cache 切成小块按需分配,浪费降到 4% 以下——同一张卡能塞下大一倍的批量,吞吐翻了数倍。开源推理引擎 vLLM 靠这一招起家,成了行业事实标准。
Prefill-Decode 分离——解决"两道工序互相踩脚"。既然物理特性不同,混在同一批 GPU 上跑就会互相干扰(一个几万 token 的长 prefill 挤进来,同批所有用户的出字节奏集体卡顿)。2025–26 年的主线方案干脆分厂:一个 GPU 池专跑 prefill、一个专跑 decode,中间传递 KV cache,两池独立扩缩容、甚至独立选型(prefill 池要算力猛的卡,decode 池要带宽大显存多的卡)。到 2026 年,几乎所有生产级服务栈都建立在分离架构上;Kimi 公开过的生产数字可作标本:K2 在 128 张卡上以 PD 分离加大规模专家并行运行,预填充与解码吞吐各达每秒二十多万 token。有分析说得透彻:这个技术 2024 年论文就齐了,2025 年才普及——拐点不是技术性的,是经济性的:产品上量之后,延迟抖动就是可度量的收入损失。
投机解码——解决"decode 一次只走一步"。第一卷第八章讲过 MTP 自带"草稿员";2026 年的生产形态正是它:旗舰模型发布时就带训练好的 MTP 草稿头,推理引擎自动检测启用,解码提速两三倍。当年"投机解码要额外找一个分布匹配的小草稿模型"的工程难题,被"训练时顺手交付"化解了。
前缀缓存——解决"重复劳动"。大量请求共享相同的开头:系统提示词、多轮对话的历史、agent 每次工具调用都重发的全部上下文。把这些前缀的 KV cache 存下来跨请求复用,命中即跳过整段 prefill。在 agent 时代(同一段上下文反复出现几十次),这一项从锦上添花变成了成本结构的决定因素——记住它,两节之后它会以另一个面目出现在你的账单上。
3.3 价格标签解剖学
现在翻开 2026 年年中的价格页(单位:美元/百万 token,输入/输出):闭源旗舰档 GPT-5.6 顶配 $5/$30、Claude Fable 5 $10/$50;主力档 Claude Sonnet 5 $3/$15、Gemini 3.1 Pro $2/$12;开源系则是另一个世界——DeepSeek V4 仅 $0.4/$0.9,把旗舰级能力打到美系的十分之一上下(一个有趣的例外:Kimi K3 定价 $3/$15,与 Sonnet 5 分毫不差——开源模型第一次按闭源旗舰定价,这是产品自信的宣言,第六卷再谈)。在这张表上,本章的技术逐条显影:
为什么输出比输入贵 5 倍上下?(各家输出/输入比清一色落在 2–6 倍)现在你可以秒答:输入走 prefill,输出走 decode。输入 token 被并行处理、GPU 时间摊薄到几千 token 上,每 token 占用的机器秒极低;输出 token 每个都要完整读一遍权重加 KV cache,访存受限、利用率低,每 token 的机器秒高一个量级。定价比就是两道工序的成本比——价格表是 prefill/decode 物理差异的化石。顺带一提:推理模型的思考 token 也按输出计价,这是"想得久"在账单上的直接投影。
**为什么缓存命中打一折?**各家的 prompt caching 通行价约为输入价的 0.1 倍(DeepSeek 激进到约五十分之一)。机制你刚学过:厂商替你保存了前缀的 KV cache,命中即跳过那段 prefill——你付的不再是计算费,是存取费。3.2 节的前缀缓存技术,在账单上的投影就是这行折扣。对 agent 类应用(每步都携带全部历史)这是决定性的:会不会用缓存,成本差十倍。
**为什么批量接口一律五折?**各家 Batch API(异步、24 小时内交付)统一半价。逻辑藏在"闲置率"里:集群的负载有波峰波谷,批量任务可以调度去填低谷的闲置算力——边际成本极低,五折卖仍然赚。闲置率这个纯运营指标,直接价格化了。
3.4 一张著名的账本:成本、毛利与雪崩式降价
每 token 的成本到底怎么构成?拆解框架一行写尽:每 token 成本 ≈ GPU 每小时全成本(折旧为大头 + 电力 + 运维)÷ 每小时产出的 token 数。分子相对刚性,全部戏剧性都在分母——而分母由本章的五件套决定:这一代推理引擎把典型 GPU 利用率从三四成抬到七八成,软件优化直接等价于成本减半再减半。
行业只有一次头部厂商公开过这本账,值得作为标本细读。2025 年 3 月,DeepSeek 在开源周结尾公布了自家推理集群的运行数据:按每卡每小时 2 美元的租赁价折算,日均推理成本约 8.7 万美元,而按 R1 牌价折算的理论日收入约 56 万美元——理论成本利润率 545%。两个解读都要拿稳:一方面,它证明了在 PD 分离、大规模专家并行、高利用率的极致工程下,推理服务的毛利空间可以非常可观(这也是他们敢把价格打到地板的底气);另一方面,官方自己加了粗体注脚——实际收入远低于此(网页和 App 免费、实际定价低于牌价、错峰折扣)。"理论"二字承担了全部重量,但这份账本仍是理解推理经济学最好的一手材料。
毛利空间的另一面是降价空间。同等能力的推理价格正在以远超摩尔定律的速度崩落:行业测算的中位数约为每年降几十倍;最常被引用的锚点是"GPT-4 级能力"——2023 年上市时 30 美元/百万输入 token,2026 年同水平能力只要三五毛,三年约百倍。这条雪崩曲线是全书多条线索的合流:架构省钱史(第一卷)、低精度与蒸馏(第四卷)、本章的工厂工艺,三股力共同压出来的。
3.5 收束:推理时代的总账
最后把镜头拉到最远。2026 年有一个安静但根本的转折被多方数据确认:全球 AI 算力的大头已经从训练转向推理——占比约三分之二,且一个模型全生命周期的算力开销里推理占八九成。驱动力正是第四卷结尾那条曲线:agent 时代来了。一个数据点足以说明烈度:在最大的第三方模型路由平台上,agent 产生的 token 量已在 2026 年初超过人类直接对话的 token 量,单次 agent 任务的消耗是普通聊天的十几倍到千倍,编程类用途占了总量的一半。
这个总账反过来照亮了全书:现在你彻底明白了,为什么第一卷讲的几乎每一项架构革新(GQA、MLA、稀疏注意力、MoE)刀刃都对着推理账单,为什么厂商肯为 QAT 和 MTP 在训练里买单——因为训练花的是一次性的钱,推理花的是永远的钱,而"永远"正在指数增长。算力的故事讲到这里,"跑在什么上面"的常识账已经齐了。剩下最后一卷:这些钢铁、这些账单、这些模型背后的人与公司——2026 年的产业地图,全书的收官之卷。
本章要点
- 两阶段是总根源:prefill 算力受限(决定首字延迟)、decode 访存受限(决定出字节奏),瓶颈资源不同。
- 工厂五件套:连续批处理(逐步换人,吞吐提升可达二十倍)、分页 KV cache(碎片浪费 60–80%→<4%)、PD 分离(2025–26 主线,分厂各优化,拐点是经济性的)、投机解码(MTP 草稿头交付化,2–3×)、前缀缓存(agent 时代的成本决定因素)。
- 价格表 = 成本结构化石:输出贵 5 倍 = decode/prefill 的机器秒之比;缓存一折 = 前缀缓存商业化(付存取费不付计算费);批量五折 = 闲置率价格化。三档格局:闭源旗舰 / 主力 / 开源系(约 1/10 价)。
- 成本 = GPU 小时全成本 ÷ 每小时 token 产出;引擎把利用率从三四成抬到七八成。DeepSeek 545% 理论利润率账本:毛利空间真实、"理论"二字沉重。同能力价格年降数十倍,GPT-4 级三年约百倍。
- 总账转折:推理已占 AI 算力约 2/3、生命周期开销八九成;agent token 超过人类对话 token——训练是一次性的钱,推理是永远的钱,这解释了第一卷以来的一切省钱史。