主题
字号
PART I · 架构演化
CHAPTER 08 ≈ 45 MIN READ

读懂一次发布——参数量、基模与版本语义

前七章把 2026 年大模型骨架的每个零件都拆开讲了一遍。这最后一章做一件收束的事:把零件拼回实战能力。目标很具体——当一次新模型发布刷屏时,你能逐行读懂它的技术公告,判断这次发布的分量,并用内行的方式跟人讨论它。我们先建立读法,再讲版本号背后的门道,最后拿 2026 年 7 月的真实发布做一次完整演练。

8.1 一份配置表的读法

一次典型发布的技术要点大概长这样(以 2025 年 7 月的 Kimi K2 为例):

1T 总参数 / 32B 激活;61 层;MLA 注意力;384 路由专家 + 1 共享专家,每 token 激活 8 个;词表约 16 万;上下文 128K;预训练 15.5T tokens。

用全卷的知识逐项翻译:

"1T / 32B"——账本与账单(第六章)。总参数 1T 说的是容量和显存占用:这份权重光是以 16 位精度存放就要约 2 TB,注定是多机部署的大家伙;激活 32B 说的是每 token 计算量:推理成本更接近一个 32B 的 dense 模型而不是 1T。两个数字的比值(约 3%)是稀疏度,对照第七章的版图,你能立刻定位它在"稀疏化军备竞赛"里的段位。

"61 层;MLA"——骨架与推理账单(第一、五章)。看到 MLA 你应该条件反射:KV cache 每层每 token 几百个元素的量级,长上下文的显存账单被压到了极低;顺带能推断它的血统——这是 DeepSeek-V3 系配方的延续(事实上 K2 的技术报告坦承架构与 V3 同构,改动在专家数和头数)。

"384 + 1 专家,top-8"——第七章的配方原样在列:细粒度路由专家 + 共享专家 + aux-loss-free 一族的均衡术。384 比 V3 的 256 更细,是"专家数持续细分"趋势线上的一个点。

"词表 16 万;上下文 128K;15.5T tokens"——词表在 2026 年的主流带(12 万–20 万,第一章);128K 上下文背后是第四章讲的大 base RoPE 加长文本续训工艺;15.5T tokens 是预训练的"喂料量",这个数字怎么定、数据从哪来,是第二卷的主题。

这套读法的要点在于:每个数字都不是孤立的规格,而是一连串设计决策的末端。看到数字能反推决策、反推代价与收益,就是"看懂了"。

8.2 参数量与硬件的一次速览

用户视角最常见的一个问题是:"这个模型我跑得动吗?"这里给你一个粗版换算(细账在第五卷):16 位精度下,每 1B 参数约占 2 GB 显存——7B 模型约 14 GB,正好卡在一张消费级旗舰显卡的边缘;70B 约 140 GB,需要两张 80 GB 的数据中心卡;671B 总参的 MoE 约 1.3 TB,十几张卡起步、必须多机。量化(用 8 位、4 位甚至更低精度存权重)可以把这些数字除以 2 到 4,代价是或多或少的质量损失——这是"某模型的 4bit 量化版能在一张 4090 上跑"这类说法的原理。注意 MoE 的显存按总参数算而不是激活参数(第六章讲过:不激活也得待命),这是新手最常掉的坑。

8.3 基模:一切版本的根

现在进入这一章真正的核心概念:基模(base model,基础模型)。

严格意义上的基模,是预训练直接产出的那个模型:在几十 T token 上做完下一词预测、还没有经过任何对话化改造的"满腹经纶的续写机"(第一章的 GPT-3 就是一个纯基模)。你在 HuggingFace 上看到的 -Base 后缀指的就是它。基模不好用——不听指令、没有对话格式——但它决定了一个模型系的能力天花板:知识储备、语言能力、推理潜力,都在预训练里定型。后训练(第四卷的主题)是在基模之上做的第二阶段加工:教它对话(Instruct/Chat 版)、教它深思(Thinking 版)、给它装多模态和工具使用。这些加工能把潜力兑现成产品能力,但很难无中生有地扩大天花板。

这个两阶段结构直接解释了模型家族的谱系逻辑。同一个基模可以衍生出一整窝兄弟:DeepSeek-V3 这个基模上,长出了 V3 的 Chat 版、推理模型 R1、以及后来的 V3.1/V3.2 系列——它们共享同一套预训练获得的知识和能力底盘,差别全在第二阶段的加工方式。判断两个模型是不是"亲兄弟",看的就是基模。

为什么"换基模"是大事?因为重新预训练是这个行业里最重的动作:几个月、几万张卡、数千万到数亿美元,一次性投入且不可中途变更目标。相应地,架构革新(新的注意力机制、新的 MoE 配方)只能搭着新基模的班车上线——第五章讲的那些 2025–26 年架构分岔,每一个都对应着某家公司的一次"重训豪赌"。而后训练的成本比预训练低一到两个数量级,可以小步快跑、每几周迭代一次。一重一轻两种节奏,就是版本号语义的物理基础。

8.4 版本号考古学:小数点里的门道

有了基模概念,就可以破解你最初的疑问:为什么有的更新只是小版本号,有的却"几乎是两个不同的系列"?行规大致是:整数换代 = 新基模(重新预训练),小数点更新 = 同基模上的续训或后训练。但各家执行的透明度差异很大,拿 2025–26 年的真实案例排一排:

**DeepSeek 是教科书式的透明案例。**V3 → V3.1:同一基模续训了约 840B token 做长上下文扩展,加上混合推理的后训练——明确不是新基模。V3.1 → V3.2:还是同一底盘,续训约 1T token 把 DSA 稀疏注意力"改装"上去(第五章讲过这次手术)。V3 → V4(2026 年 4 月):全新预训练,超过 32T token、新的注意力架构、原生 1M 上下文——真正的换代。你看:小数点在续训,整数在换血,版本号忠实反映投入量级。

**Kimi 同样清晰。**K2 → K2.6:还是 1T/32B 那个底盘,加上了多模态和新的后训练。K2 → K3:2.8T 的全新基模、全新架构——两个系列。MiniMax 甚至官方明说:M2 → M2.1 → M2.5 三个版本共用同一架构,纯后训练迭代;M3 才是新基模。

**闭源阵营则要靠"考古"。**OpenAI 的 GPT-5 → 5.1 → 5.2 → 5.4 每隔一到三个月一发,官方从不说明是否重训——间隔之短使业内普遍推断以后训练迭代为主;但 GPT-5.5 是个罕见的例外,有公开证据表明它对应一次全新的预训练。Anthropic 则完全不披露:Claude Opus 在半年里连发几个点版本(4.5 到 4.8),随后推出的 Fable 5 / Mythos 5 干脆启用了一个高于 Opus 的全新层级命名——命名体系本身在暗示底盘换了,但官方一个参数也没说。对闭源模型,从业者靠三条线索推断:发布间隔(短于三个月的大概率是后训练)、能力跃迁的形态(知识截止日期变了、长上下文原生上限变了,通常意味着新基模)、定价结构变化(成本结构大改往往对应新架构)。

易错点

版本号是市场部和工程部拔河的结果,别把它当成严格的技术承诺。有的"小数点"憋着大招(GPT-5.5),有的大版本号之间底盘未必全换。可靠的做法是看证据链——训练 token 数、知识截止、上下文原生长度、架构披露——而不是数字本身。这也是为什么技术报告和模型卡(model card)比发布博客值得读。

8.5 配置表上的新面孔

2026 年的发布公告里还有几个高频词,前七章没专门展开,在此补齐,都点到"能看懂"为止。

MTP(multi-token prediction,多 token 预测):训练时在标准的"猜下一个词"之外,加装一个小模块顺带猜下下个词。收益有二:训练信号更密(每个位置多一道练习题);推理时这个模块天然是"草稿员"——先快速猜一个,主模型一次前向验收,猜中就白赚一个 token(这套技巧叫投机解码,speculative decoding)。DeepSeek-V3 的实现里第二个 token 的猜中率有八九成,整体生成速度提升约 1.8 倍。因为几乎白拿,2026 年 MTP 已接近标配。

训练精度(FP8、MXFP4 等):权重和计算用越来越低的位数表示。DeepSeek-V3 把 FP8 训练做成了主流,2026 年前沿已在探索 4 位一族(Kimi K3 用 MXFP4 存权重)。精度砍半约等于显存和带宽账单砍半,是 infra 战场的主线之一,细节留给第五卷。

原生多模态:2026 年新基模默认从预训练起就混合文本与图像(乃至视频)数据,而不是先训文本模型再外挂视觉模块。这影响你读参数表——多模态组件的参数、数据配比都会出现在报告里。本卷聚焦语言主干,多模态架构值得未来单独展开。

8.6 实战演练:读懂 Kimi K3 的发布

2026 年 7 月 16 日,月之暗面发布 Kimi K3。用本卷的全部装备,我们来做一次真实的逐行解读——这也是全卷的期末考试。

"约 2.8T 总参数,全球首个开源 3T 级模型;896 专家、每 token 激活 16 个。"

第七章的趋势线延伸到了新刻度:总参数 671B → 1T → 2.8T,专家数 384 → 896,稀疏度压向 2% 量级。"开源 3T 级"的分量在于显存账本:2.8T 参数即使低精度存放也要 TB 级显存,这是一个只有大规模集群才伺候得起的开源模型——"开源"的含义正在从"人人能跑"滑向"人人能研究、大机构能跑"。(细心的话你会注意到官方没有直接给出激活参数量——读发布时,"没说什么"和"说了什么"同样值得留意。)

"KDA 与全注意力混合的线性注意力架构;1M 上下文,解码最高 6.3 倍加速。"

第五章三派格局的最新战报:线性混合派把 3:1 配方第一次推上 3T 级量产。1M 上下文(第四章的工艺极限)与线性注意力(KV cache 不随长度膨胀)互为因果——没有后者,前者的推理账单撑不住。

"MXFP4 权重、量化感知训练;权重将以宽松许可开源。"

4 位精度进入预训练/后训练流程本身(而不是事后压缩),说明低精度已是原生设计约束。开源承诺则是产业信号:中国头部实验室延续"开放权重 + 技术报告"路线,与闭源阵营的分界继续加深(第六卷主题)。

"发布公告还提到一项叫 AttnRes 的新机制、以及新的优化器与均衡策略。"

碰到没见过的名词怎么办?这才是真实场景。从业者的做法:先定位它动的是哪个部件(AttnRes 从名字和描述看,动的是残差流的跨层信息组织——第二章的地盘),再等技术报告核实机制细节,在此之前对二手转述保持保留。承认"这个我还没看懂,等报告",恰恰是内行的标志。

这次演练的真正意义在于:K3 发布于本书写作的三天前——你用一套讲历史的框架,读懂了一条今天的新闻。框架的价值就在这里:架构的零件会继续换代,但"账本与账单、基模与版本、趋势线上的定位"这套读法,会陪你读懂之后的每一次发布。

8.7 卷末:骨架之后是灵魂

第一卷到此完整收官。回望一眼走过的路:我们从课本尽头的 Transformer 出发,数清了参数账本(一),配上了残差流的眼镜(二),看完了稳定性之战(三)、位置与长上下文(四)、注意力省钱史(五)、MoE 的机制与分水岭(六、七),最后把一切拼成了读懂真实发布的能力(八)。

但你应该还记得第一章那个更大的问题:GPT-3 到今天的六年,模型是怎么从续写机器变成推理者的?本卷只回答了"骨架"的一半——骨架决定潜力的上限和成本的下限,却不产生任何能力。能力来自训练:几十 T 的 token 怎么选、怎么喂,scaling laws 如何指挥算力的调度,"智能"如何在下一词预测这个朴素目标下被一点点压进权重——这是第二卷《预训练》的故事。骨架已经立起来了,接下来给它注入灵魂。


本章要点