六年,与之后——回望、前沿与写给你的话
这是全书的最后一章。前面五卷加这一卷的前五章,我们从课本里那个原版 Transformer 出发,一路走到了 2026 年的产业地图。现在该收尾了——但收尾不是重复,而是站到最高处回望来路、眺望前方,然后把这本书交还到你手里。
这一章分三步走:先看清 AI 增长的三条曲线眼下各自走到了哪、这决定了第 5 章那个"能力还能不能继续涨"的悬念的答案倾向;再巡视一遍下一次范式跃迁的候选者;最后,回望这六年,说几句写给你——一个正在入门的大二学生——的话。
6.1 三条曲线,一个转折
第二卷末尾我们留下过"预训练撞墙了吗"的悬念,第四卷又见证了 RL 和 test-time 两条新曲线的崛起。现在把三条曲线放在一起做个体检,会看到一个清晰的转折。
**第一条,预训练 scaling(把模型做大、喂更多数据)。**2026 年的共识不是"能力见顶",而是"这条特定路径见顶"。多份综述的措辞高度一致:撞上的不是能力的硬天花板,而是"更大模型 + 更多互联网文本"这个具体方法的极限——数据墙(第二卷)是真实的上限,架构与训练方法的创新从"可选"变成了"必需"。
**第二条,RL scaling(后训练强化学习的算力)。**这是第四卷推理革命的引擎,2026 年它还在涨——但一份大规模系统研究揭示了一个关键性质:RL 的算力-性能曲线是 S 形的(有渐近上限),不像预训练的幂律那样在可观测范围内看不到头。用一个直观的比方:预训练像越吹越大的气球(幂律,一直在长),RL 更像逼近饱和的 S 曲线(会趋平)。而且天花板的高度由训练配方决定——这解释了第四卷那场 GRPO 军备赛为什么如此激烈:大家争的不只是效率,是谁的配方能把渐近线抬得更高。
第三条,test-time scaling(答题时想得更久)。o1 以来最实打实的新维度,2026 年的问题已经从"能不能 scale"转向"边际何时递减"。一个耐人寻味的信号来自评测端:衡量能力的基准正在被前沿模型快速饱和——第四卷讲过的 METR 时间跨度曲线(模型能独立完成的任务时长),2024 年后每约三个月翻一倍,到 2026 年初前沿已达十几个小时,但基准本身开始"测不准"了(能撑起十六小时以上任务的测试题太少)。标尺快不够用了——这既是能力仍在猛涨的证据,也是一个微妙的警示:我们正在失去衡量下一段增长的工具。
三条曲线合起来的图景是:老引擎(预训练)在减速,新引擎(RL、test-time)在加速但也能看到各自的天花板。所以第 5 章那个悬念——"能力还能不能继续涨"——2026 年最诚实的答案是:能,但不再是靠同一台引擎;增长的接力棒正在从"规模"传向"方法"。而下一棒会交到谁手里,就是下一节的问题。
6.2 下一次跃迁的候选
如果说过去六年的主线是"scaling 现有架构",那么 2026 年前沿的共识是:下一波增长更可能来自定向的算法突破,而非继续放大现有系统。几个候选方向值得你认识,因为它们很可能就是你未来几年会亲历的故事:
持续学习(continual learning)——解决当前系统最反直觉的一个缺陷:模型部署后学不进新东西。它的权重是"冻"住的,你这次对话教它的,下次它就忘了;想让它学新知识就得重训,而重训又会冲掉旧知识(这个叫"灾难性遗忘"的顽疾困扰了领域几十年)。第四卷讲的"小版本迭代"本质是人类工程师在替模型学习。而持续学习要让模型自己在部署中积累经验。多位前沿研究者乐观地认为它可能在近几年内被"以令人满意的方式解决"——如果成真,这是通往"能力随使用而增长"的关键一步。
世界模型(world models)——大语言模型预测"下一个词",世界模型预测"下一帧",在内部建立对物理与数字世界如何运作的表征。2025–26 年这个方向从论文走进了产品:有系统能从一张图或一段文字实时生成可交互、可导航的三维世界。深度学习先驱中有人(Yann LeCun 是最坚定的代表)押注这才是通往真正智能的路,甚至为此离开大厂另起炉灶——他们认为纯语言模型永远碰不到"理解物理世界"这层,而这层才是最难的。
具身智能(机器人)——把大模型装进机器人身体,让它不只在文本里推理,还能在真实世界里行动。2026 年"视觉-语言-动作"模型密集涌现,但真实短板也很清楚:物理世界的多样性和不确定性远超文本,当前的机器人更像在"模仿训练数据里的模式",还缺乏对动作后果的真正预见。
agent 作为新范式——这不是遥远的未来,而是正在发生的现在。第四卷末尾那条"从解题者到干活者"的曲线,正在把 AI 从"聊天机器人"重新定义为"数字同事"。但这里有个冷静的数据:分析机构一边预测大量企业应用会嵌入 agent,一边预测相当比例的 agent 项目会因成本和回报不清而被砍掉——从原型到可靠生产的鸿沟,仍然很大。
这些方向哪个会成、哪个是炒作?诚实的判断是:世界模型已有商用、持续学习进展强势但未落地、agent 生产化真实但有回报缺口、具身智能必要但仍早期。没有人能确定下一次"GPT-3 时刻"或"R1 时刻"会从哪个方向来——但几乎可以确定,它不会再是"把 Transformer 做得更大"这么简单。
6.3 AGI:一场关于定义的争吵
绕不开的话题:这一切在通向 AGI(通用人工智能)吗?多久?
2026 年,最有分量的几个声音给出的答案差异巨大。一端是最乐观的——有 CEO 认为强大到能取代大部分软件开发者、做诺奖级科研的 AI 会在一两年内出现。另一端是最怀疑的——有图灵奖级的学者坚持现有架构原则上到不了人类级智能,必须换范式,乐观估计也要五到十年。中间是谨慎乐观派——认为人类级 AGI"还差得远",十年内达成的概率大概一半,且明确需要"一两个突破"(持续学习、记忆、few-shot 学习、更强推理这些当前的缺口)。
面对这种分歧,最有用的不是选边站,而是看穿争论的实质。有一个精辟的观察值得你记住:当一个人说"AGI 快到了"、另一个人说"AGI 不可能",他们往往不是在争同一件事——他们在争「该把哪件事叫做 AGI」。 "通用智能"是个没有公认定义的词,把标准定在"能替代程序员"还是"能像人一样理解物理世界",会得出完全相反的时间表。所以当你听到 AGI 的时间预测时,第一个该问的不是"几年",而是"你说的 AGI 是什么"。这是这个领域最重要的一条"防忽悠"心法。
至于能力增长本身——那条每约三个月翻一倍的任务时长曲线,是目前最硬的客观标尺。它没有告诉我们"AGI 何时到来",但它确实告诉我们:AI 能独立完成的工作,正在以肉眼可见、可测量的速度变长。这个趋势会平滑地延续、还是会撞上某道墙,是未来几年最值得盯住的一个数字。
6.4 回望六年:从续写机到数字同事
现在把镜头拉到最远,回望整本书的起点。2020 年,GPT-3 是一台只会"接下一个词"的续写机器(第一卷开篇那个反问你问题的场景)。2026 年,同一条技术路线上的模型能独立完成一个工作日长度的编程任务。这六年的主线,可以浓缩成五级台阶——这也是全书六卷的骨架:
- 续写机(GPT-3,第一、二卷):架构立骨、预训练注入知识,得到一台满腹经纶却只会续写的机器。
- 会听话(RLHF/ChatGPT,第四卷前半):对齐把"续写"驯化成"对话",AI 走进大众。
- 会思考(o1/R1,第三、四卷后半):强化学习把算力从训练期挪到答题期,推理能力被激励出来。
- 会干活(2025 agent,第四卷末):工具使用加长任务,AI 从"生成文本"迈向"完成任务"。
- 会看世界、会记忆(2026 前沿):世界模型与持续学习指向一个持久的、能积累经验的"数字同事"——这是本书结束之处、也是未来开始之处。
每一级台阶,你现在都知道它背后的技术是什么、为什么会发生、代价和边界在哪。这正是这本书想给你的东西:不是记住一堆模型名字和榜单排名(那些下个月就变了),而是拥有一套能看懂任何一次新发布、任何一场新争论的框架——账本与账单、基模与版本、三条 scaling 曲线、约束如何塑造创新。这些框架会比书里任何一个具体数字都活得更久。
6.5 写给你的话:如何跟一个跑得比书快的领域
最后,作为一个大二学生,你合上这本书之后,怎么继续跟这个跑得飞快的领域?几条诚实的建议:
别追榜单,追曲线。谁家模型今天排第一,下个月就换人,记这些没意义。真正耐久的是能力曲线(METR 的任务时长、SWE-bench 的通过率)和范式转折(哪条 scaling 曲线在涨、哪条在饱和)。看懂趋势,比记住名次有用一百倍。
**读一手,别只读转述。**技术报告和 model card 比发布博客诚实(第一卷教过怎么读发布);arXiv、各实验室的技术报告、Epoch AI 的算力数据、METR 的能力数据,都是一手源。二手聚合站常常互相抄、错了一起错——这本书的每一卷都是先派人核实一手源再动笔的,你也该养成这个习惯。
关于就业,说句实在的。你是 CS 学生,绕不开"AI 会不会取代程序员"。2026 年的现实是:它取代的是任务,不是职业;最受冲击的是入门级的重复性编码——研究显示编程是 AI 覆盖率最高的职业之一,年轻程序员的入门岗招聘确实在收缩。但价值没有消失,它在迁移:向"能定义问题、做架构设计、审查和整合 AI 产出"的能力迁移。换句话说,会用 AI 写代码的人不会被取代,被取代的是"只会写 AI 也能写的那种代码"的人。你现在读这本书、去理解 AI 到底怎么运作——这本身就是在往价值迁移的那一端站。
**保持怀疑,也保持惊奇。**这个领域同时充满了真实的突破和过度的炒作,泡沫的质疑和真金白银的进展并存。最好的姿态是两者都不放弃——像工程师一样怀疑每一个惊人的数字(去查它的口径和来源),也像 2020 年第一次见到 GPT-3 的人一样,对"机器开始会思考"这件事保有惊奇。
六卷到此结束。你从一个"听师兄聊天似懂非懂"的起点出发,现在应该能坐到那张饭桌上,不只是听懂,而是有自己的判断——知道哪些是扎实的、哪些是吹的、下一个值得关注的转折可能在哪。这套判断力,就是这本书能给你的全部,也是它想给你的全部。
这六年发生了什么,我们讲完了。接下来的六年会发生什么——那是你的故事了。
本章要点
- 三条曲线体检:预训练 scaling 见顶的是"特定路径"而非能力(数据墙真实、架构创新变必需);RL scaling 是 S 形有渐近上限(气球 vs S 曲线)、天花板由配方决定;test-time 仍涨但评测在饱和、"标尺快不够用"。增长接力棒从"规模"传向"方法"。
- 下一跃迁候选:持续学习(解决静态权重与灾难性遗忘,进展强势未落地)、世界模型(预测下一帧、已有商用、LeCun 押注)、具身智能(VLA 涌现但仍早期)、agent 范式(正在发生但有生产化鸿沟);下一次突破几乎确定不再是"把 Transformer 做更大"。
- AGI 时间表之争的实质是"该把哪件事叫 AGI"的定义之争——听到时间预测先问"你说的 AGI 是什么";任务时长每约三个月翻倍是最硬的客观标尺。
- 六年五级台阶(全书骨架):续写机→会听话→会思考→会干活→会看世界/会记忆;本书给的是看懂任何新发布的框架,而非易过时的名字与名次。
- 给学生的建议:追曲线别追榜单;读一手别读转述;就业是"取代任务不取代职业、价值向定义问题/架构/审查整合迁移";保持怀疑也保持惊奇。