主题综述

驱动范式转变的是数据集不是算法

主题综述

更新日志


主流共识

一、把 AI 史切成四段,每一段的分界线都是一个新数据源。 这条主题的原话出处是 Jack Morris 的一篇博客标题,他在播客里把标题和背后的框架都讲了一遍:

"There are no new ideas in AI, only new data sets."
「人工智能领域没有新想法,只有新的数据集。」

框架来自库恩《科学革命的结构》。Morris 的读法是:范式转变不是"更聪明的方法在旧数据上跑赢",而是"旧方法第一次跑在新数据上"。

"I think all of the things that I would consider paradigm shifts in the Kuhnian sense came from a new technique but trained on new data. And I think the new data is super, super important."
「我认为库恩意义上所有我认为的范式转变都来自一种新技术,但都建立在新的数据之上。而且我认为新数据非常非常重要。」

四段分别是:AlexNet 撞上 ImageNet;Transformer/BERT/GPT 撞上网络规模预训练;指令微调撞上人类偏好数据;推理模型撞上符号系统的可验证反馈。对第二段,他把功劳明确从架构挪到了数据:

"No one had ever tried to scrape all the text off the internet and then tokenize it and feed it into models. It's a crazy idea."
「从来没有人尝试过从互联网上抓取所有的文本,然后对其进行标记化,并将其输入到模型中。这真是个疯狂的想法。」
"I don't know if we'll ever beat them, but the real innovation is web scale pre-training."
「我不知道我们是否能打败它们,但真正的创新是网络规模的预训练。」

对第三段,他把 RLHF 的功劳也挪到了数据侧——真正的创新是有人去收集了人类偏好的正负样本对:

"You don't even need the InstructGPT techniques. You just need the data."
「你甚至不需要 InstructGPT 技术。你只需要数据。」

对第四段——推理模型——他承认形态不同,但仍归到同一框架:

"they do fall into this framework, which is they really did emerge from a new data source."
「但它们确实属于这个框架,也就是它们确实是从新的数据源中出现的。」
"It's verification with symbolic systems like math, calculators, coding environments, unit tests, things where we can provide numerical feedback to language model outputs."
「它是通过符号系统(如数学、计算器、编码环境、单元测试等)进行的验证,在这些系统中,我们可以向语言模型输出提供数值反馈。」

在机器人这一侧,1X 的 Bernt Børnich 独立地讲了同一句话,而且推得更绝对——注意他说的是"所有":

"And all of the major breakthroughs that we've seen, as far as I'm aware of in AI, have been because someone figured out how to use a huge new data source that previously we were not able to use. You unlock some new set of data and now your model capability greatly improves."
「据我所知,AI 里我们见过的所有重大突破,都是因为有人搞明白了怎么用上一个以前用不了的巨大新数据源。你解锁一批新数据,模型能力就大幅提升。」

二、"架构/归纳偏置"在规模面前退位——这是一位归纳偏置研究者自己的转向记录。 Ari Morcos 花了六年做归纳偏置,然后被自己的三篇论文同时打脸:

"But I had these multiple papers, all of which made this clear takeaway that the data is the only thing that matters."
「但是我有多篇论文,所有这些论文都明确地表明,数据是唯一重要的东西。」

他给出的阈值很具体——大约一百万数据点之后,软归纳偏置从有用变成轻微有害:

"when you get to enough scale, inductive biases matter not at all."
「当你达到足够的规模时,归纳偏置就完全不重要了。」

由此推出他的产业判断,以及对 scaling law 文献的一句重话:

"data is the most under-invested in area of research relative to its impact, and I don't think it's even close."
「相对于其影响而言,数据是研究领域中投资最不足的领域,而且我认为差距还很大。」
"they all assume IID data. Which is insane. We know that all data are not created equal"
「他们都假设是独立同分布的数据(IID data)。这太疯狂了。我们知道所有的数据并非生来平等」

三、好想法可以早十年——差的不是想法,是数据的先决条件。 Schulman 复盘 OpenAI 早期的 Universe(一个把大量 RL 环境攒成数据集的项目):

"there's an early project called Universe where the idea was to create lots of different RL environments and build a whole data set of them"
「早期有个叫 Universe 的项目,目的是创造很多不同的 RL 环境,建立一个完整的数据集,然后把它们放在一起。」
"I think like the funny thing is, I think it was a deeply correct idea, but it was just way too early, like maybe even a decade too early."
「实际上,我认为有趣的是,这个想法非常正确,但它出现得太早了,可能早了十年。」

同一逻辑的另一面,是他那个反复被引用的反事实:带着完整后见之明,2018–19 年几个人就能做出 GPT-3.5 级模型——而这个反事实成立的前提,他自己主动补上了:

"You could have gotten something that was ChatGPT 3.5 level maybe back in 2018 or 2019 with with a couple people."
「你本可以在 2018 或 2019 年用几个人得到一些达到 ChatGPT 3.5 水平的东西。」
"Actually, this is also building on like pre-training datasets and scrapes that other people have done."
「实际上,这也是建立在其他人已经完成的预训练数据集和抓取之上的。」

四、当前瓶颈被命名为"复杂度的来源"。 Gemini 联席负责人 Oriol Vinyals 用围棋做对照——棋局走几步之后局面就是全新的,环境自己免费生产无限训练数据;LLM 没有这个东西:

"So the environment's complexity, as you play, makes kind of training data infinite for free, right?"
「所以环境的复杂性,随着你的游戏进行,使得训练数据在某种程度上是无限的,对吧?」
"And in LLMs, we are data limited. And it's what is the source of infinite complexity is not so clear."
「而在大语言模型中,我们的数据是有限的。而导致无限复杂性的来源并不是很清楚。」

Fei-Fei Li 从 3D 那一侧说的是同一件事(此篇逐字稿为中文,无英文原句可引,下文凡引此篇均为中文原文):

「我很羡慕我的 NLP LLM 同事,互联网上有如此丰富的数据,而我们不一定有这种奢侈。」
— Dr. Fei-Fei Li · Teaching AI to Understand the Physical World, with Dr. Fei-Fei Li of World Labs

值得注意的是她对 ImageNet 的自述——在没有 scaling law 的年代,那也是一次纯粹的数据赌注:

「当时,我们开始假设数据很重要,但我们不知道。没有缩放定律。」
— Dr. Fei-Fei Li · Teaching AI to Understand the Physical World, with Dr. Fei-Fei Li of World Labs
「我内心深处知道,从数学的角度来看,他是对的,这会推动模型泛化。我们至少需要足够的数据。」
— Dr. Fei-Fei Li · Teaching AI to Understand the Physical World, with Dr. Fei-Fei Li of World Labs

五、于是钱和公司都在往"造数据的机器"上砸。 这一层是共识的产业投影:Lila 把实验室当 token 生成器、GI 把游戏剪辑当交互版 Common Crawl、Chai 把序列数据库当结构数据的原料、1X 把互联网视频当机器人预训练语料。四家公司的一句话都长得像同一句话。

"science is as an infinite token generator to train models at scale."
「科学是一个无限的 token 生成器,可以用于大规模训练模型。」
"So the lab platform is the token generator."
「所以实验室平台是代币生成器。」
"What if we predict action tokens on essentially what is the equivalent of the common crawl data set, but for interactivity?"
「如果我们预测动作 tokens,本质上就是相当于通用爬虫数据集的东西,但用于交互性呢?」

分歧在哪

一、算法真的只是"解锁旧数据的钥匙"吗?——最尖锐的一次反驳来自主持人

这条主题里最值得记的一点是:Morris 的论点在他自己那期节目里就被当场质疑了,而且他没有硬扛。主持人 swyx 先是直接报了个"民调":

"I would say that the researchers I talked to would somewhat disagree."
「我要说的是,我交谈过的研究人员在某种程度上会不同意。」

接着给出了那个把"数据 vs 算法"二分直接拆掉的等价式:

"an improvement on compute or data efficiency is the equivalent of having a whole bunch more data that otherwise would be a lot more expensive to collect."
「提高计算或数据效率相当于拥有更多的数据,否则收集这些数据会贵得多。」

Morris 没有反驳这一条,反而顺着夸了优化器的价值,并在被追问"推理之后是什么"时坦白交白卷:

"the reality is predicting the future is too damn hard."
「现实是预测未来太难了。」

耐人寻味的是,最激进的"数据派" Morcos 反而给出了一组把方法论请回来的数字——12 倍不是靠新采数据,是靠对同一批数据做筛选/合成/配比:

"we're able to now get to the same performance as DCLM about 12x faster."
「我们现在能够以大约 12 倍的速度达到与 DCLM 相同的性能。」
"repeating higher quality tokens is almost always better than seeing Net new lower quality tokens."
「重复使用更高质量的 tokens 几乎总是比看到全新的低质量 tokens 更好。」

也就是说:在"新数据集驱动范式"和"同一批数据的处理方式驱动性能"之间,本主题的两位主角实际上站在光谱的两端,而没有人把这条线画清楚。

二、下一批数据是"捡"来的还是"造"出来的

这是全场最实质的分裂,而且几乎是按行业分的。

捡派(数据已经存在,只是没人会用)。 GI 的 Pim De Witte 靠的是 Medal 沉淀的游戏剪辑,他对自己的处境说得很诚实——这是运气:

"the largest data set of ground truth action-labeled video footage on the internet."
「我们拥有互联网上最大的带有真实动作标签的视频素材数据集。」
"we just happened to hit a particular goldmine."
「我认为,我们只是恰好发现了一个特殊的金矿。」

1X 的 Bernt Børnich 走得更远:整家公司的差异化就押在"互联网视频能不能当机器人的预训练语料"上,而人形形态本身就是为了让这批数据可用(人是它的 cross-embodiment):

"what differentiates ONE-X from all the other robotics companies is that we are all in on pre-training our own models on this video data on the internet."
「1X 和其他所有机器人公司的区别在于,我们全押在用互联网上的这些视频数据预训练我们自己的模型。」

他的理由是纯粹的量级论——遥操作和第一人称采集的数据量根本不在一个尺度上:

"So if you look at what is needed to actually achieve true intelligence, you need multiple orders of magnitude more data than anyone is even close to collecting over the next few years with egocentric data or with this sensor data."
「如果你看真正实现智能到底需要什么,你需要的数据要比任何人在未来几年里用第一人称数据或这类传感器数据能采到的量再多好几个数量级。」

生物这边,Chai 的 Josh 提出了一个几乎没被讨论过的量级观察:

"there might even be more like biological sequence tokens on the internet than like English language tokens."
「你可能会觉得意外,互联网上的生物序列 token 说不定比英语 token 还多。」

造派(存量已经被榨干,必须新建生产设施)。 Lila 的立场是把实验室本身工程化成数据中心。而且他们对"造什么"是有取舍的——不是产量最大化,是信息量最大化:

"So the next incremental token has to be something that is valuable to the model versus yet another NGS sample to teach us something where it's already hit diminishing returns."
「因此,下一个增量令牌必须对模型有价值,而不是又一个 NGS 样本来教会我们已经出现递减回报的事情。」
"the core conviction that we had two years ago was the bitter lesson is correct. Science could be an infinite token generator."
「但我们两年前的核心信念是痛苦的教训是正确的。科学可以是一种无限的标记生成器。」

Schulman 给"造"指了第三条路——不是实验室也不是模拟器,是真实部署本身:

"so I expect that to at some point come back to the LLM world where we figure out how to learn from real deployment."
「所以我希望在某个时候,它会回到 LLM 领域,在那里我们弄清楚如何从实际部署中学习。」

Agility Robotics 的 Jonathan Hurst 则直接否掉了机器人版的"捡派"前提——他不是说数据不重要,他是说那批数据根本不存在:

"But these language models are trained off of the entire data on the internet. And that data does not exist for robot control. What's the example for your robot of all the torque commands to every motor given all the sensor input? There is no training set of data. So you have to generate and create that somehow."
「但这些语言模型是拿整个互联网的数据训练出来的。而机器人控制没有这种数据。你的机器人在给定全部传感器输入的情况下,对每个电机发出的所有力矩指令——这样的样本在哪儿?根本没有这种训练集。所以你只能想办法自己生成、自己造出来。」

同一场节目、同一个提问人、隔了不到二十分钟的两位 CEO,对"互联网视频对机器人有没有用"给出的是相反的答案。两人都没有被要求对质。

三、模拟和合成数据算不算"新数据源"

这条分歧横跨机器人、材料、生物三个领域,而且同一家公司内部就有温差。

Fei-Fei Li 的立场是模拟被低估——但她随即补了一句限定,说低估它的是圈外人:

「我也认为模拟被低估了。实际上,很多专家和业内人士并没有低估它。」
— Dr. Fei-Fei Li · Teaching AI to Understand the Physical World, with Dr. Fei-Fei Li of World Labs

Lila 的 Rafa Gómez-Bombarelli 是做了十几年物理模拟的人,他的结论相反——大规模计算生成的数据点数量很大,但撑不住真正要回答的问题:

"But they're all virtual simulations that just don't carry enough water for the thing we actually want to do."
「但它们都是虚拟模拟,实际上并不足以支持我们想要做的事情。」
"if we train on computational data, can we answer real-world experimental questions?"
「如果我们使用计算数据进行训练,能否回答现实世界的实验问题?」

Hurst 在机器人侧给出同构的判断,措辞更硬:

"But there's always a massive sim-to-real gap."
「但仿真到现实之间永远有一道巨大的鸿沟。」
"That takes real practice in real life with robots."
「这需要机器人在真实生活里真刀真枪地练。」

Schulman 站在中间,而且是唯一一个明确说"两边都对"的人——他既不认为 Sim2Real 被证伪,也认为真实世界学习会回来(引文见上):

"but I think there's also a lot of value in learning from the real world,"
「我认为这是一种非常有效的技术,但我也认为从现实世界中学习有很多价值,」

Chai 则代表最乐观的一端:模型好到一定程度,自己就成了数据生成器,飞轮闭合。

"And what you can do once you have really good models is just run them on the sequence databases to get new structures out."
「一旦你有了足够好的模型,你能做的就是把它们跑在序列数据库上,直接产出新的结构。」
Matt(Chai Discovery 联合创始人)· Chai Discovery's Bitter Lesson
"It's this bitter lesson pillness of scaling compute and data and models."
「就是这种被 bitter lesson 洗过脑的劲头——扩算力、扩数据、扩模型。」
Josh(Chai Discovery 联合创始人)· Chai Discovery's Bitter Lesson

值得注意的是,Chai 的起点恰恰是"数据不够"的判词——而他们证明了那个判词是错的:

"there was not enough data in antibodies in the protein data bank, for instance, to solve this problem."
「大家都说,比如蛋白质数据库里的抗体数据根本不够解决这个问题。」
Josh(Chai Discovery 联合创始人)· Chai Discovery's Bitter Lesson

同一阵营内部也有温差:Lila 的 Andy Beam 认为材料比生物更难,理由恰恰是材料"有好模拟器但没有中心法则",而生物有成熟的高通量自动化——也就是说,在"模拟器好不好用"这件事上,Lila 的两位创始人各自的领域给出了相反的经验。

四、可验证性:是新数据源的定义,还是它的天花板

Morris 把"符号系统的可验证反馈"直接算作第四次范式转变的数据源(见上)。Vinyals 承认这条路有效、也承认在数学/编程上训练会诱发可迁移的元能力,但对它的边界表达了明确的不满:

"being limited to just verifiability is, is definitely unsatisfying because most of the times for the things I want the model to do, I would not even be able to write a verifier if I had all the time in the world."
「但仅限于可验证性绝对让人不满意,因为在我想让模型做的事情中,即使我有全世界的时间,我也无法写出一个验证器。」

Chai 恰恰把"生物是可验证域"当成自己的核心优势——湿实验读数就是客观 ground truth。但他们同时点出了这个 ground truth 的噪声水平:湿实验的误差棒本身就有正负五个百分点,也就是说,这个"验证器"和数学的单元测试并不是一类东西。这一层张力两边都没有展开。

五、人在数据环节里还剩多少位置

Morcos 的立场最硬——他引 DCLM 论文末尾那个几乎没被注意到的实验:三十位花了两年设计过滤标准的研究生,之后连自己造的分类器会怎么判都猜不准。

"They could not predict what the DCLM classifiers would say above chance."
「他们无法预测 DCLM 分类器会说什么,概率高于随机。」

他给出的唯一可操作结论也反直觉地简单:

"If there's only one thing that you should take away from this entire interview about what is good for data quality, it's diversity."
「如果你只能从这次关于什么对数据质量有益的采访中得到一个启示,那就是多样性。」

而 GI 和 1X 的整个商业模式建立在相反的假设上:人类的行为轨迹本身就是最值钱的那一层数据。GI 的底料是"人类巅峰表现"的游戏剪辑,1X 的做法是让人戴上与机器人同构的传感器去干活。两边说的其实不是同一件事——Morcos 讲的是"人做不好筛选",GI/1X 讲的是"人本身是数据源"——但这两条放一起,恰好画出了人类在数据链条里的实际位置:作为被采集的对象比作为评判者更值钱。

六、私有数据资产到底有多耐久

GI 拒绝了 OpenAI 五亿美元的数据收购,这是本主题里最硬的一个定价锚点。但 Pim 自己给出的建议是自相矛盾中带着清醒的:

"I don't think you can value it unless you actually model it yourself and see what the capabilities are."
「是的,我认为除非你亲自建模并了解其功能,否则无法评估数据价值。」
"as the capabilities increase, you're just going to need less ground truth data and like you can do more model-based data generation or synthetic data generation."
「随着能力的提高,你只需要更少的基础数据,而且你可以做更多基于模型的数据生成或合成数据生成。」

也就是说:一位刚刚拒绝了五亿美元数据报价的创始人,同时认为这类数据的边际价值会随模型能力上升而下降。Lila 则把护城河定义从"存量数据"整个换成了"数据生产速率"("lab platform is the token generator",引文见上)——如果 Pim 是对的,Lila 的定义方式才是这条主题真正的产业结论。


都没说透的

1. "新数据源"这个说法把发现成本藏起来了。 Morris 列的四段里,前三段的数据本质上是"捡"来的(互联网上现成的文本、标注众包、聊天界面的偏好),只有第四段的可验证环境是真造的。如果第五段必须靠造——实验室、RL 环境、真机练习——它的单位成本曲线和前四段完全不是一回事。没有一位受访者给出这条曲线,也没人被问到。

2. token 数和信息量被混着用。 Andy Beam 自己说过一个人的基因组相对参考基因组只有几 KB 的信息量,Morris 的研究方向本身就是"模型每参数能存多少比特",可一旦谈到"无限 token 生成器",所有人又都回到了计数。"科学是无限 token 生成器"到底是在说样本数无限,还是在说信息量无限,这两者的区别没有被任何人当面处理。

3. 算法效率与数据量的替代率没人给。 swyx 提出"效率改进 = 更多数据"的等价式之后,对话就转向了优化器闲聊。这个替代率恰恰是整条主题成立与否的关键:如果替代率高,"数据集驱动范式"就退化成一句关于成本结构的话,而不是关于科学史的判断。

4. 数据资产的定价机制被承认不存在,但没人接着往下推。 Pim 说不建模就没法定价,这等于说这个市场无法出清。可"数据是护城河"的论断恰恰依赖于数据可以被定价、被交易、被独占。承认前者之后,后者该怎么改写,没人说。

5. "可验证"的质量分层被跳过了。 单元测试的验证器、湿实验正负五个百分点的读数、模型当裁判——这三种"验证"在讨论里被当成同一个东西用。Chai 主动提了误差棒,Vinyals 主动提了"没法写验证器",但没有人把它们放在一起做分级。


我的看法

以下是判断不是事实。 我认为这条主题的表述方式("没有新想法,只有新数据集")在描述历史时很有力,在预测未来时几乎不可用——因为它把"哪里还有没被用过的大数据源"当成了可以事先看见的东西,而 Morris 本人被追问时的回答恰恰是"预测不了"。真正被这批访谈证成的,是一个更弱也更有用的版本:范式转变的瓶颈通常在数据侧,但下一个数据源的形态只有在有人先把它造出来之后才认得出来——所以 Lila、GI、Chai 这类"先建生产设施再找需求"的做法,比"等着捡下一个 ImageNet"更可能兑现。把握程度:对"瓶颈在数据侧"这一半我相当有信心(九篇里跨四个行业独立收敛);对"造 > 捡"这一半信心中等偏低,因为造派样本全是自我陈述的在运营公司,缺乏失败案例做对照——Schulman 的 Universe 是本主题里唯一一个"造派失败了十年"的记录,而它只被当成时机问题带过。


还想知道什么

1. 一个"造数据"失败的完整复盘。 现在造派的证据全来自还在运营、还在融资的公司。需要一个把自动化实验室/环境工厂做黄了、并且愿意说清楚为什么的样本,才能给"造 > 捡"的判断做对照组。 2. 算法效率与数据量替代率的硬数字。 有没有人愿意给出"某个优化器/训练方案改进相当于多少倍数据"的实测?Morcos 的 12x 是数据管理侧的,需要一个方法侧的对照才能把 swyx 那条等价式落到地面。 4. 同一个数据源被两家公司分别"捡"和"造"的对照案例。 机器人是现成的战场(1X 捡互联网视频 vs Agility 造真机数据),但本主题只有一场同期节目里的隔空表态。若能拿到双方各自的数据效率数字,这条主题最大的分歧就能被检验,而不只是被陈列。


取材