摘报
2026-08-11 至 2026-08-22
口径说明:本期窗口取上一期摘报(2026-08-10)之后新入库的全部访谈,不与上期重叠。
本批次浮现的主题
1. "拥有你的权重"从口号变成了施工图——但要注意这批材料的来源
本批 17 篇里有 5 篇出自 Sequoia 同一场活动(Sonya Huang 开场 + Lin Qiao 讲 post-training + Harrison Chase 讲 harness/evals + Brendan Foody 讲 RL environments + Trajectory 讲在线学习)。所以这不是五个独立信源的趋同,而是一份被精心编排的议程——读的时候该按"一份有立场的施工手册"来读,而不是当作独立验证。
话虽如此,这份手册本身是本批最有信息量的东西。Sonya Huang 给了口号:
"I hereby present the AI version of this meme, Not Your Weights, Not Your Product. I think that for a product to be truly yours, I think it's reasonable to think that you need to be able to control and custody your own weights."「我在这里呈现这个梗的 AI 版本:没有你的权重,就没有你的产品。我认为,要使产品真正属于你,合理的想法是你需要能够控制和保管自己的权重。」Sonya Huang · How Companies Are Building Their Own Intelligence
她也给了一个反直觉的因果:越成功越被迫自建——
"Ironically, the more successful your AI product is, the higher your AI cogs tend to be. And so it's actually the companies that have been most advanced in their deployments of AI that have been the first to go on this journey of owning their own models."「讽刺的是,你的 AI 产品越成功,你的 AI 成本就往往越高。所以,实际上,最先进地部署 AI 的公司是第一批开始拥有自己模型的公司。」Sonya Huang · How Companies Are Building Their Own Intelligence
值得记的是她给"什么时候该自建"划的四条线(成本占 COGS 多少、延迟是不是 P0、能否靠自有数据调出更好性能、数据有多专有),以及一条很硬的组织建议:不要让现有的 AI 平台团队干这件事,要另起一支小队——Harvey 只用了七个人。Lin Qiao 补上了收益侧的量级:post-training 能把推理成本降到原来的 1/5 到 1/10。
2. 静态预训练是瓶颈——这条共识背后藏着一场没被摆上台面的分歧
本批有四组人独立地说"模型部署后不再学习是根本问题",但他们对学习信号从哪来的回答互不兼容,而且没有人当面交锋。
- Rich Sutton / Khurram Javed:信号只能来自 agent 自身的经验,合成数据是死路,因为它的质量判断权在人类手里:
"you can have humans deciding how to generate these data sets, but you need human experts who know what's a good data set and what's a bad data set for that approach to scale. So it is bottlenecked by humans."「你可以让人类决定如何生成这些数据集,但你需要知道什么是好的数据集、什么是坏的数据集的人类专家,才能使该方法扩展。所以它瓶颈于人类。」Khurram Javed · Rich Sutton and Khurram Javed
- Jack Morris(Engram):信号来自把固定的私有语料反复榨出更难的合成任务——恰恰是 Sutton 那条被否掉的路。他自己承认它会撞墙:
"It's kind of like a data wall in the synthetic sense where when you create synthetic data from D and train on it, you eventually hit this upper bound where like you've learned all of the synthetic data and then you have to do it again."「这有点像在合成意义上的数据墙,当你从 D 创建合成数据并对其进行训练时,最终你会达到一个上限,像是你已经学习了所有合成数据,然后你必须重新进行。」Jack Morris · Scaling Compute on Context
- Trajectory(Ronak Malde / Arjun Karanam):信号来自用户的纠正动作——不是点赞点踩(太稀疏太噪),而是用户对 agent 输出做的具体编辑、撤销和重试。他们的 OPSD/SDPO 就是为了吃这种富文本反馈而不是稀疏奖励。
- Brendan Foody(Mercor):信号来自专家搭建的 RL 环境和评分细则——即 Sutton 说的"人类瓶颈",但他认为这恰恰是必需的,因为模型在主观领域无法给自己打分。
把这四条并排看,Sutton 的"把人类移出循环"和 Mercor 的整个商业模式是正面冲突的,而两边都在同一周被录下来,谁也没提对方。
3. 产能红利被用来扩张产出,而不是砍人——并且顺手砍掉了产品经理层
Stripe 给了本批最硬的一组数字:内部一次成型的编码 agent "Minions" 从年初每周 1,200 个 PR 涨到上周 7,000 个,约占全部 PR 的 30%:
"we blogged about minions, I think in January, February, and they were doing 1,200, you know, PRs per week. And last week, I think 7,000 PRs came from minions. … And about 30% of our PRs in that week came from minions."「我们在一月和二月左右写了关于 Minions 的博客,他们每周做 1200 个 PR。而上周,我想说有 7000 个 PR 来自 Minions。……在那一周,大约 30% 的 PR 来自小黄人。」Will Gaybrick · Stripe's AI Strategy: Build More, Not Less
而他们明确拒绝把这笔红利兑现成裁员——标题就是 "Build More, Not Less"。AppLovin 讲的是同一件事的另一种形态:固定规模的工程团队 + 砍掉传统产品经理层,让工程师直接持有业务上下文。Eric Vishria 则把这条上升成判断:把客户需求和技术实现分开的传统产品管理已经过时,开发必须贴着模型能力的"锯齿边缘"走。
三个来源、三种业态,收敛到同一个组织结论:中间的翻译层(PM/管理层)是这轮效率提升里最先被挤掉的东西。
必读(标出来这几篇)
- Rich Sutton and Khurram Javed — 本批唯一一篇在论证"当前整条路线是错的"。Big World Hypothesis + "合成数据瓶颈于人类"这条反驳,直接抵着本批其余大部分访谈的前提。不同意也该读。
- How Companies Are Building Their Own Intelligence — "自建 vs 租用"的四因素框架 + 组织建议(另起小队、七个人的 Harvey)。是本批最可直接拿去用的一篇。
- Scaling Compute on Context — 把"在私有语料上继续训练"的几条路(KV 压缩、on-policy 蒸馏、合成预训练、无监督 RL)逐一试过并讲清各自撞在哪堵墙上。少见的把失败讲透的技术演讲。
- RL Environments Explained | Brendan Foody — Pass@1 与 Pass@16 的差距可以当作"这个模型还训不训得动"的信号,这个判据很实用。
- Stripe's AI Strategy — 1,200 → 7,000 PR/周、占比 30%,是本批最实的生产环境数字。
可以跳过
- 两集 Simile(Joon Sung Park) 内容高度重合,读一集即可;建议读 Simulation: the new Scaling Law,另一集主要是重述。
- Sequoia 那场活动的五篇如果时间有限,读 Sonya Huang 的开场就够——其余四篇是同一框架的分模块展开,除非你正好要动手做那一块。
静悄悄的重要
- Post-Training Is How You Keep Your Taste | Lin Qiao — 标题像营销,但里面藏着一条对"品味"的重新定义:品味不是产品表层的审美,而是被编码进权重里的产品判断,因此它才成为竞争对手无法直接克隆的东西。这条把"taste"从一个模糊的褒义词变成了一个有技术落点的资产定义,而且它和 taste-judgment 这条线里长期含混的地方正面相关。另外一条实用判据:post-training 的正确启动时机是 PMF 之后,因为在那之前你没有足够的真实生产数据。
- Simulation: the new Scaling Law | Joon Sung Park — 和本批其它所有内容都不搭界,因此容易被划掉。但它指出了一件对整个 eval 话题都成立的事:网络数据训出来的模型学到的是人们"怎么说",不是"怎么做"(say-do gap),要补上后者只能靠随机对照试验这类行为数据。如果这条成立,那么大量以"模拟用户"为前提的 eval 设计是建在沙子上的。数字锚点:数字孪生对个体行为的复现约 85%。