主题
字号
PART II · 预训练
CHAPTER 10 ≈ 50 MIN READ

备菜间——几十万亿 token 从哪来

上一章的结论是数据从配角变成主角:Chinchilla 之后,"喂多少、喂什么"决定了同等算力下模型的成色。这一章走进备菜间,看几十万亿 token 是怎么备出来的。这个领域有个耐人寻味的特点:它是整个预训练里技术含量最被低估、同时保密程度最高的环节。架构大家争相发论文(第一卷你已看过),数据管线的完整细节却几乎没有一家旗舰完整公开——因为在架构日益同质化的今天,数据配方是少数真正拉开差距的地方。好在 2024 年之后出现了几个高质量的开放复现项目,让我们得以看清这条流水线的全貌。

2.1 原矿:互联网不是数据集

先纠正一个普遍的想象:"模型读了整个互联网"。实情是:互联网是矿山,不是粮仓——绝大部分内容是矿渣,可入口的部分需要重重提炼。

矿山的主体叫 Common Crawl(CC):一个非营利组织,十几年来每一两个月对公开网页做一次大规模抓取,每次快照收录二三十亿个网页,累计一百多个快照、数 PB 的原始数据,免费公开。从 GPT-3 到今天的开源旗舰,几乎所有模型的英文网页语料都以它为起点。但"以它为起点"的含义是:从原矿到可用语料,产出比只有百分之几到百分之十。剩下的九成多是什么?导航栏和广告文字、机器生成的垃圾站、无穷无尽的重复模板页、乱码、色情与欺诈页面……直接把原矿喂给模型,模型学到的就是互联网的平均水平——而互联网的平均水平很低。

数据工作的全部秘密就在这条提炼链上。我们借 2024 年 HuggingFace 的 FineWeb 项目走一遍——它把 96 个 CC 快照提炼成 15T token 的高质量语料,并且公开了每一步的方法和消融实验,是这个隐秘领域里最好的一份公开教材。

2.2 提炼链:从网页到精粮

FineWeb 流水线的六道工序,每一道都朴素,叠起来威力惊人:

URL 过滤:先按域名黑名单干掉成人、欺诈、垃圾站——最便宜的一刀,在下载正文之前就砍。

正文抽取:网页是 HTML,正文外包裹着菜单、页脚、广告、评论框。抽取器要从标签汤里把"人写给人看的那部分"挖出来。这一步的质量出乎意料地重要——抽坏了,后面全白干。

语言识别:用轻量分类器判定语言、按置信度过滤,分流到各语言子管线。

质量启发式:一批手工规则刻画"垃圾文本长什么样"。FineWeb 的消融给出了几个直观例子:删掉"行尾几乎没有标点"的文档(干掉了 10% 的 token——那多半是菜单和列表碎片);删掉"重复行占比过高"的文档(再干掉 12%——模板页和刷屏垃圾)。规则土,但每一条都对应互联网垃圾的一种典型长相。

去重:互联网充满转载、镜像、模板复制。用 MinHash 一类的近似算法在几十亿文档里找出"长得差不多"的簇,每簇留一份。去重的意义不只是省算力:重复文档会让模型把"见过很多遍"误当"很重要",加重记忆倾向、挤占学习容量。有趣的是 FineWeb 发现去重也有讲究——逐快照分别去重比全库统一去重效果更好,因为激进的全局去重反而会把"被广泛转载的优质内容"错杀。

PII 与安全处理:匿名化个人信息(邮箱、电话),过滤有害内容。

工序讲完,但 FineWeb 论文真正的方法论贡献是一句话:每一道工序都用"训一个小模型试试"来裁决。规则 A 还是规则 B 好?各做一版数据、各训一个 1.8B 的小模型、比下游成绩。数据工程从手艺变成了实验科学——这也呼应了上一章的"小模型侦察"方法论:不止损失可以外推,数据决策同样靠小模型代理。

2.3 质量的第二级火箭:让模型给数据打分

启发式规则能滤掉垃圾,但"不是垃圾"和"值得学"之间还差一个量级。2024 年的下一步是用大模型当质检员:FineWeb-Edu 用 Llama3-70B 给几十万份样例网页按"教育价值"打分(0–5 分),再用这些标注训练一个便宜的小分类器,让它扫描全部 15T token,只保留 3 分以上的文档。结果 92% 被扔掉,剩下 1.3T——而用这 1.3T 训出的模型,在知识类基准上明显超过用全量 15T 训的。

让这个数字在你脑中停留一会儿:扔掉九成二,效果更好。它宣告了数据竞赛的规则彻底改变——从"谁的数据多"变成"谁的筛子好"。FineWeb 团队自己总结:15T 这个总量数字本身不重要。而"筛子"——那个质量分类器——的构建方式(拿什么样例、按什么标准打分)没有标准答案,每家都在暗中调制自己的版本:这就是"数据配方是核心机密"的第一层含义。

2.4 调配比:预训练的营养师

机密的第二层是配比(data mix):网页、代码、数学、论文、书籍、多语言各占多少。这不是行政决定,是直接影响模型性格的调制。少数公开数字里最完整的是 Llama 3:约 50% 通用知识、25% 数学与推理、17% 代码、8% 多语言。

两个比例值得端详。代码占 17%——Llama 3 并不是编程专用模型,为什么喂这么多代码?因为行业反复验证过一个初看神秘的现象:代码训练提升的不只是编程,还有通用推理能力。代码是人类写过的逻辑最严密、结构最清晰的文本——变量指代精确、因果链条完整、错一个字符就失败——喂代码等于给模型上逻辑课。"即使做通用模型也要喂 10–20% 代码"如今已是共识。数学与推理占 25%——同理,而且数学语料在原始互联网里极稀缺,各家都在极限上采样。配比怎么定?还是小模型:几十种配比各训一个小模型,看哪种曲线好,再外推到大模型——你会发现"小模型当侦察兵"是贯穿本卷的方法论主旋律。

中文语料的特殊困境

一个对国内读者切身的问题:CC 里中文占比远低于中文互联网的真实体量——因为中文内容大量锁在 App 和封闭平台里,公网爬不到。所以中文模型的中文语料高度依赖自有渠道(大厂的站内数据)和自建爬虫,这部分从不公开;开放的中文数据集(WuDao、万卷、CCI 系列等)比英文开放集小一个数量级以上。加上中文网页抽取更易出错、质量分类器需要重训,中文数据管线的每一步都要重新发明一遍。"中文模型为什么难做",一半的答案在备菜间里。

2.5 合成与增密:当矿快挖完的时候

上一章末尾预告过"数据墙":Epoch AI 估计人类公开文本的有效存量约 300T token 量级,而 2026 年旗舰一次预训练就吃 30T 上下、高质量子集还要反复吃好几遍——按这个吃法,撞墙不是会不会、是何时的问题。行业的回应是本节的主题:数据不够,就制造数据。但"合成数据"这个词底下其实是两条很不同的路。

改写增密(rephrasing):不无中生有,而是把已有的高质量文档重写成多种风格——把一篇维基条目改写成问答体、教学笔记体、对话体。同样的知识,多种表达,模型的"每 token 学习效率"更高,还把低质量文档改写成规整文体来废物利用。这条路已实打实进入生产:NVIDIA 的 Nemotron-CC 语料里有 1.9T token 是改写产物;Kimi K2 的技术报告明确说预训练中对知识和数学语料做了受控改写(并小心限制改写遍数防过拟合)。

从头合成:让强模型直接写"教科书级"的训练材料。旗手是微软的 phi 系列("Textbooks Are All You Need"),用极小的模型配纯度极高的合成课本取得过惊艳战绩。这条激进路线后来作为独立门派声量渐弱,但它的方法——系统性地覆盖推理模式、课程化组织内容——被各家吸收进了主流管线。

合成数据能不能真正拆掉数据墙?2026 年的诚实回答是争议中:支持的证据(混入约三成合成数据能显著加速收敛;改写路线报告数倍的效率提升)与怀疑(朴素的"让模型续写网页"收益有限,"用模型的输出训模型"的天花板与退化风险在学术上未有定论)并存。目前的实际图景是:墙被推后了,还没被拆掉——靠改写增密、多模态数据扩容(图像视频音频的 token 化进入预训练)、多遍训练和付费语料,前沿实验室又给自己争取了几年。

2.6 收紧的绞索:版权与"关闭中的网"

备菜间的故事还有一条法律战线,2025–26 年它从背景噪音变成了实质约束。

三个标志性判例勾勒出现状:Anthropic 案中法院认定训练行为本身可构成合理使用,但通过盗版渠道获取书籍另当别论——Anthropic 最终为此支付了 15 亿美元和解金,是 AI 版权史上最大数字;Meta 案中 Meta 胜诉,但判词明确这是原告举证不力的技术性胜利,法官特意写明"无授权训练在多数情形下可能不构成合理使用";而《纽约时报》诉 OpenAI 案缠斗至今未决。合起来的信号是:法律没有给"随便爬"发通行证,也没有一票否决训练本身——行业在夹缝中转向付费授权(OpenAI 已签下十几家出版商,单笔可达亿级美元),但授权费只流向头部媒体,长尾内容拿不到有意义的分成。

比诉讼影响更直接的是技术性封锁:2025 年起 Cloudflare(托管着很大一部分互联网)对新网站默认拦截 AI 爬虫;2026 年中,多家美国主流媒体联名向 Common Crawl 发出停止侵权函,要求停爬并从既有数据集删除其内容——矛头直指 FineWeb 们的上游水源。从业者称之为"关闭中的网"(closing web):公开可爬的高质量文本,存量在逼近上限,增量在主动缩减。这条绞索反过来加速了上一节的一切——授权语料、私有数据、合成数据,都是对它的回应。

备好了菜——几十 T 经过提炼、打分、调配的 token——接下来进厨房。下一章看真正的烹饪过程:损失曲线怎么读、优化器和学习率怎么编舞、三个月的马拉松里每三小时一次的故障怎么扛、以及怎么在几亿美元烧完之前知道这锅菜没做砸。


本章要点