谁是谁的孩子——模型谱系与换代节奏
前两章讲了两个阵营的公司与战略;这一章换一个视角——把模型本身排成家谱。第一卷第八章教过你读懂一次发布、区分"基模"与"版本语义";这一章是那套读法的产业级兑现:我们要把 2026 年你叫得出名字的几十个模型,按血缘关系摊成一张家族树,让你一眼看清谁是谁的孩子、谁和谁是兄弟、以及各家换代的节奏为什么如此不同。这是一张会过时的地图(卷首说过,本卷是"截至 2026 年 7 月的快照"),但读图的方法不会过时。
3.1 一条产品线里的三种"新版本"
先把第一卷的工具磨快。当一家公司发布"新版本"时,它可能是三件性质完全不同的事,而外界最大的误读就是把它们混为一谈:
换基模(整数级换代)——重新预训练一个新的基础模型,几个月、几千万美元的重注。能力天花板被抬高,架构革新(新注意力、新 MoE 配方)只能搭这班车上线。DeepSeek V3→V4 就是典型:全新预训练、32T token、新注意力、原生 1M 上下文——这是"两个系列"级别的事件。
续训(小数点级)——在同一基模上继续训练,扩展某种能力。DeepSeek V3→V3.1 是长上下文续训,V3.1→V3.2 是把稀疏注意力"改装"上去——底盘没换,只是加装。
翻新后训练(同基模、换配方)——基模一个参数不动,只重跑第四卷讲的那条后训练流水线。DeepSeek V3-0324 是最干净的例证:同一个 V3 基座,吸收了 R1 的推理 RL 成果,数学代码能力跳一大级——"小版本更新到底更新了什么"的答案就是这个。
三种事件的成本差着一到两个数量级,而营销命名常常故意抹平这个差别(第一卷讲过:版本号是市场部和工程部拔河的结果)。带着这把尺,我们开始读图。
3.2 中国开源阵营:枝繁叶茂的家族树
开源阵营的谱系最清晰,因为技术报告把血缘写得明明白白。
DeepSeek 系是教科书般工整的一棵树。主干:V2(首创 MLA)→ V3(671B,细粒度 MoE + aux-loss-free)→ V3.1(长上下文续训)→ V3.2(DSA 稀疏注意力续训)→ V4(全新基模,1.6T)。主干上挂着两类果实:推理分支 R1(基于 V3-Base 纯 RL)及其后继;蒸馏分支 R1-Distill 系列(把 R1 的推理能力灌进 Qwen 和 Llama 的躯壳——注意这一支的"身体"是别人家的基模,"灵魂"才是 DeepSeek 的,这是谱系图上最有趣的杂交现象)。到 2026 年,推理线(R 系列)被并进了主线的双模式模型,R2 迟迟未出——因为 V3.2-Speciale 和 V4 已经把推理能力承接了。
Qwen 系(阿里)是另一种形态——不是一棵深树,而是一片同代覆盖全尺寸的灌木丛。同一代(如 Qwen3)从 0.6B 到旗舰 235B 全谱系铺开,小模型多由大模型蒸馏而来(第四卷的"大模型当教师"分工写在家谱里)。代际上 Qwen3→Qwen3.5 是新架构新基模,而 3.5→3.6→3.7 是快速迭代。一个值得记的花絮:Qwen3 曾把"思考/不思考"融进一个模型,半年后又拆回两个——家谱上出现了"先合并、再分家"的罕见枝节。
**Kimi 系(月之暗面)**的家谱短而陡:K2(1T,384 专家)→ K2.6(同架构加多模态)→ K3(2.8T 全新基模+KDA 线性注意力+896 专家)。K2→K3 是明确的换基模+换架构,一次豪赌式的跨代——从家谱看,月之暗面走的是"少而重"的路线,与 Qwen 的"多而全"形成鲜明对比。
其余枝干:GLM(智谱)的 GLM-4.5→5→5.2 稳步走稀疏注意力路线;MiniMax 的 M1→M2→M3 是全书最曲折的一支(线性→回退全注意力→转稀疏,三代三条路,第一卷第五章的"没有共识"活案例);字节豆包、腾讯混元、百度文心、阶跃各有自己的小树,多数不完全公开血缘。
3.3 美国闭源阵营:看不见血缘的家谱
美国前沿阵营的家谱要靠"考古"——参数、架构、基模关系一律不披露,只能从发布节奏和能力跃迁反推(第一卷第八章教的三条线索:发布间隔、能力跃迁形态、定价结构)。
OpenAI 的 GPT 线:GPT-4 → 4o/4.5(4.5 是那个"平淡的最大基模",第二卷的关键证据)→ GPT-5(2025-08,统一 router 架构,把独立的 o 系列推理模型并入主线)→ 5.1/5.2/5.4 快速迭代 → GPT-5.5(罕见地有公开证据是新基模,预训练代号 "Spud")→ GPT-5.6(2026-07,Luna/Terra/Sol 三档)。这条线最大的谱系事件是 o 系列的"合流":曾经 o1/o3 是独立的推理产品线,2026 年初被整体退役、能力融进 GPT-5 家族——"推理模型"从一个物种降格为旗舰内的一个档位(第四卷末章的三段论)。
Anthropic 的 Claude 线:最耐人寻味的谱系。它是一个能力分层的命名体系——Haiku < Sonnet < Opus < Fable/Mythos,同一代里按"个头"分三四档(快而便宜的 Haiku 到最强的 Mythos 级)。2026 年的大事是启用了高于 Opus 的全新 Mythos 层级(Fable 5 是首个公开可用的 Mythos 级模型)——命名体系本身在暗示底盘换代,但官方一个参数都不给。点版本(Opus 4.5→4.6→4.7→4.8 半年四发)大概率是后训练迭代。
Google 的 Gemini 线:2.5 → 3 → 3.5,而 3.5 Pro 的谱系里藏着一个公开的"事故"——原基模因结构性缺陷被推倒重建、屡次跳票,是"换基模是一场豪赌、可能失败"的罕见公开案例(第二卷讲过预训练不可试错)。xAI 的 Grok 线(4→4.1→4.5)和 Meta 的 Llama 线(4→5)各成一支,前者绑定自建算力、后者是美国开源的旗帜。
3.4 一张读得懂的家谱:三个规律
把两个阵营的家谱合起来看,浮现出三条跨公司的规律,它们比任何单个模型都更耐久:
**规律一:基座复用,后训练狂奔。**几乎所有公司都是"基模用数月到一年,后训练以周/月迭代"(第四卷的"持续交付")。所以一年里一家公司发五六个"新模型",背后往往只有一两个真正的新基模。数发布数量会高估进展,数基模数量才是真实的换代频率。
**规律二:能力靠蒸馏向下扩散。**每家的小模型基本都是大模型的蒸馏产物(第四卷"大模型当教师")。所以家谱不只有"父子代际"的纵向血缘,还有"大教小"的横向血缘——DeepSeek 的推理能力甚至横向蒸进了 Qwen 和 Llama 的身体。能力的传播比基模的繁衍快得多。
**规律三:透明度是一条政治分界线。**开源阵营的家谱清晰可考,闭源阵营的家谱靠猜——这不是技术差异,是战略选择(下一章会看到,"开源还是闭源"本身就是最大的战略分野)。一个读图的实用建议:看到中国模型的发布,去读技术报告;看到美国旗舰的发布,去数发布间隔、查知识截止日期、比定价结构——两种阅读法,对应两种披露文化。
家谱读完了。但家谱只告诉你"谁生了谁",没告诉你"这些家族在争夺什么、靠什么活下去"。下一章转向算力与地缘——这些模型背后的钢铁、电力与国界之争;再下一章是钱——谁在盈利、谁在烧钱、这场竞赛能烧多久。
本章要点
- 三种"新版本"性质迥异、成本差一到两个数量级:换基模(整数级,重新预训练,抬高天花板)、续训(小数点级,同基模加装能力)、翻新后训练(同基模换配方,如 V3-0324);营销命名常抹平差别,用第一卷三条线索甄别。
- 中国开源家谱清晰:DeepSeek 工整主干 + 推理/蒸馏两分支;Qwen "全尺寸灌木丛"(大教小写进家谱);Kimi "少而重"(K2→K3 跨代豪赌);MiniMax 三代三路线的曲折支。
- 美国闭源家谱靠考古:GPT 线的 o 系列"合流"(推理从物种降为档位);Claude 的能力分层命名 + 新 Mythos 层级;Gemini 3.5 Pro 推倒重建(换基模可能失败的公开案例)。
- 三条跨公司规律:基座复用后训练狂奔(数基模而非数发布);能力靠蒸馏横向扩散(比基模繁衍快);透明度是政治分界线(读报告 vs 数间隔的两种阅读法)。