持续学习与记忆 · Continual Learning & Memory
主题综述
更新日志
- 2026-08-24 — 新增 7 篇(Biderman「AI Memory Problem」、Tworek & Anil「Core Automation」、Sutton & Javed「Oak Lab」、Karanam「Trajectory 四支柱」、Malde「living systems」+「Scaling up CL」、Morris「Scaling Compute on Context」),全部纳入,无未纳入。结构性改动:① 新开阵营四「重建派」——Tworek 明说 "transformers are incapable of continual learning" 要换架构,Sutton/Javed 说灾难性遗忘 "totally curable" 但必须从头训元学习模型;原「侧翼一」(Tworek 社会学诊断)升级并入。② 阵营一大幅复杂化——Jack Morris(容量/信息论)加入 Engram 并亲口承认固定语料训练必然 plateau(数据墙),把赌注押到递归自我改进;上一版「还想知道什么」第一条的 Morris×Engram 对撞以入伙方式兑现;Biderman 立场软化为「笔记+神经系统」混合,"RAG killer" 标签不再准确。③ 阵营三的分时程框架被 Trajectory 落地成「按普适度分层」的工程判据,与 Biderman「让模型自己学会路由」的圣杯说法互相印证——「内化 vs 外化判据」缺口从空白变为两个趋同的候选答案。④ 侧翼三补入 Trajectory 现实数据(Harvey 等客户、month→week),但 Malde 自认全行业处于「伪持续学习」(离线批量更新),复杂化了 Baseten 的乐观。⑤「都没说透的」四条全部改写并新增一条;灾难性遗忘从「被绕过」变为「正面交锋但结论相反」;「我的看法」改押「改良 vs 重建」为主线。
- 2026-08-22 — 回滚:当日自动入库的 17 篇访谈被用户否决、全部退库(Podwise Database 为手工精选库,自动 intake 已废除)。pipeline 补跑会话当日基于其中 5 篇对本篇的重写一并撤销,恢复至 2026-07-20 状态(2026-07-16 引用审计修复版)。
- 2026-07-16 — 引用忠实度修复(全站审计):3 处——重引 3 条(Vinyals 两条:转述冒充引文、乱序拼接,均改为逐字原话;Corbitt 一条:剥离主持人转述入正文,仅保留本人原话)。
- 2026-07-06 — 首次综述。基于 9 篇访谈:几乎所有人都同意"权重冻结、上下文有损有界"是当前范式的真瓶颈,但一旦追问"记忆该放哪儿",语料立刻裂成两派——Engram 说必须写进权重(RAG killer),Gemini 的 Vinyals 说恰恰不该动权重、要用文件系统式非参数记忆;中间横着 Schulman 一条"短时程 in-context 赢、长时程 weight update 赢"的分界线。
主流共识
语料从 9 篇涨到 16 篇,共识不但没有松动,反而完成了一次身份升级:2026 年中以来,持续学习从"研究者的抱怨"变成了"创业公司的招股书"——Tworek 为它办了 Core Automation,Sutton 为它办了 Oak Lab,Engram 和 Trajectory 各自围绕它融资建队。没有人为"模型不能在岗学习"辩护,分歧全在"缺的那块该怎么补"。共识仍是三层,每层都被新语料加固。
第一层:这是通往 AGI 的必经关卡,不是产品边角料。 前 OpenAI 研究副总裁 Jerry Tworek 把话说得最重:
"Probably the last thing I meaningfully updated on is that I don't think a static model can ever be AGI. That continual learning is a necessary element of what we are pursuing."「我最近一次有意义的更新可能是,我不认为静态模型可以成为通用人工智能(AGI)。持续学习是我们追求的必要因素。」Jerry Tworek · Ep 81 Ex-OpenAI Researcher On Why He Left
"Without it, it will never feel to me that intelligent. It will still be a tool that needs to be supervised by someone who has the ability to continuously learn."「没有持续学习能力,在我看来,它永远不会是智能的。它仍然需要由具备持续学习能力的人来监督。」Jerry Tworek · Ep 81 Ex-OpenAI Researcher On Why He Left
新语料里他把这句话变成了公司:Core Automation 的使命就是"持续从部署中学习的模型",AGI 判据也随之可操作化——"For me, AGI is a model that can improve itself without human in the loop in any way."(「对我来说,AGI 是一个能够在任何方面自我改进的模型,不需要人类参与。」)而这一层共识的最激进表述来自 Rich Sutton——在他看来这根本不该是一个专门领域:
"All learning is continual. You know, it's not a special phase. We always act and we learn. That's just the normal way of thinking. I'm not weird. The field is weird."「所有学习都是持续的。您知道,这不是一个特殊的阶段。我们总是行动并学习。这就是正常的思维方式。我并不奇怪。这个领域很奇怪。」
Engram 的 Jessy Lin 从另一头到达同一结论——不是"通不过定义",而是"智能都做完了,剩下的就是这个":
"the bottleneck for making these models more useful these days is not really raw intelligence, but understanding like new and evolving context."「如今让这些模型更有用的瓶颈并不是真正的智力,而是理解新兴和不断演变的上下文。」Jessy Lin · Memory and Continual Learning: Engram
Trajectory 的 Arjun Karanam 给这个"智力够了、经验不够"的判断起了名字——experience gap:
"These models are smarter and smarter, but always feels like when you're talking to them, it's their first day on the job."「这些模型越来越聪明,但当你和它们交谈时,总感觉就像它们第一天上班。」Arjun Karanam · Continual Learning: How AI Agents Get Better With Every Use
(有趣的巧合:Karanam 和 Jack Morris 各自独立用了陶哲轩当例子——前者说"口袋里的陶哲轩第一天进会计所也不是最好的会计",后者说 AI 有陶哲轩式的广度、却没有博士生五年泡出来的直觉深度。广度 vs 深度/智商 vs 经验,两家公司同一张牌。)
第二层:现在的补丁(长上下文 + RAG + context engineering)大家都用,但都觉得不够。 连主张"别动权重"的 Vinyals 都承认,把知识塞进文件系统只是权宜,模型本身还没跟上:
"the mechanism that it's fairly good at the moment, but again, I don't think the weights of the model have caught up to this."「目前的机制相当不错,但我仍然觉得模型的权重还没有跟上。」Oriol Vinyals · Ep 87 Gemini Co-Lead
Tworek 给这层共识补了一个最简洁的病因学表述——问题不是哪个补丁不好,而是训练与使用之间的结构性断裂:
"What I think is the issue is that the models are being trained in the lab. And are being deployed in the real world. That is the fundamental tension that is there."「我认为问题在于模型是在实验室中训练的。并且实际上是在现实世界中部署的。这就是存在的根本张力。」Jerry Tworek · Building the Automated AGI Lab
他顺手给出了补丁不够用的日常证据:自己用 Codex 大约 20 分钟就得 compaction 一次——"如果我们能学的只有 20 分钟,那也不算多"。Engram 那句被反复引用的目标,其实是所有人心里"ChatGPT moment of memory"的画面——一个能越用越好的实习生:
"you have an intern that you can teach things over time, and it actually gets better... no matter how sophisticated the context engineering approaches are these days, they're not getting there."「你有一个可以随着时间教授的实习生,而它实际上会变得更好……无论现在的上下文工程方法多么复杂,它们都没有达到那个水平。」Jessy Lin · Memory and Continual Learning: Engram
Trajectory 的 Ronak Malde 把同样的判断说成产品语言:AI 眼下"像任何其他软件一样是静态的",你昨天用的模型明天还在犯同样的错,你给它的所有纠正都被扔掉了。
第三层:类脑直觉(睡眠/巩固/反脆弱)反复出现,但过去都只是隐喻——现在开始有人把它变成算法主张。 Engram 的 Dan Biderman 讲"做梦/巩固",Tworek 讲人脑"反脆弱",Schulman 用运动记忆/情景记忆/程序记忆分类;旧共识是:当前系统在通用预训练那一步之外,几乎没有生物意义上的"消化"环节。
"current systems don't really have that beyond the generic pre-training step."「当前系统在通用预训练步骤之外并没有真正做到这一点。」Dan Biderman · Memory and Continual Learning: Engram
新变化是:Sutton/Javed 把这层从修辞推进到了机制层——Javed 举了人类失去本体感觉后,靠视觉反馈两三年重新学会走路的案例,论证大脑的可塑性是"学新不崩"确实可实现的存在性证明;而他们声称对应的算法(见阵营四)已经在手。类脑直觉第一次有了具体的算法认领人。
分歧在哪
上一版只有一个战场:新知识该沉到哪一层——权重、文件系统、还是上下文窗口。这批新访谈把第二条更深的断层线炸了出来:在现有模型底座上改良,还是把底座整个换掉重建。 值得注意的是,尽管 Engram、Vinyals、Trajectory 互相吵得凶,他们其实都站在第一条战线的同一侧(拿着现成的预训练 transformer 做加法);Tworek/Anil 和 Sutton/Javed 则宣布这条路在原理上走不通。
阵营一:写进权重 —— 从 "RAG killer" 软化为 "笔记 + 神经系统"(Engram: Dan Biderman / Jessy Lin / 新增 Jack Morris)
Engram 的赌注不变:外部记忆(RAG / 长上下文 / KV cache)撑不起真记忆,真记忆要靠梯度下降压进权重。核心论据仍是只有内化才能产生"联想"——检索给不了你没问的东西:
"these kinds of associations can only happen in weights because they're not really about, you know, you asked me to search for this."「这些关联只能在权重中发生,因为它们并不是真的要你让我搜索这个。」Jessy Lin · Memory and Continual Learning: Engram
Biderman 把 RAG 的真痛点定位在"寻址"而非"存储"——你根本不知道该搜什么:
"the problem is not so much what to store and where to put it... the problem is like how to address it, like how to query the thing. Do you know what to look for even?"「问题不在于存储什么和放在哪里……问题在于如何处理它,如何查询这个东西。你甚至知道该找什么吗?」Dan Biderman · Memory and Continual Learning: Engram
信息论论据也不变:KV cache 极其浪费(一篇维基文章 80GB HBM),梯度下降是把信息压进少量比特的"存在性证明";内化上下文可在推理端省两个数量级 token。他们也明确反对"事实 vs 技能"二分("you can't really separate fact learning from... skill learning"——Jessy Lin)。
新访谈带来两处实质变化。第一,立场软化:不再是"杀死 RAG",而是"笔记 + 神经系统"双层。 Biderman 在 Latent Space 的说法几乎是给外部记忆平反:
"Every knowledge worker, if they can't write notes and they cannot document the events of the day, they would be at a disadvantage. But if you wipe their brain every evening, they would also be at a severe disadvantage. So we want to have the best of both worlds."「每位知识工作者如果不能写笔记,不能记录当天的事件,他们将处于不利地位。但如果你每晚都抹掉他们的记忆,他们也会处于严重不利的境地。所以我们希望能够拥有两者的最佳结合。」Dan Biderman · The AI Memory Problem: Why Long Context Isn't Enough
他甚至坦率承认了对手最强的论点——很难构造一个 in-context 必败、in-weights 必胜的案例:
"A thorny question in the research community is, can you come up with an example where only in-weights training would work, where in-context learning will fail? And turns out, it's very hard to devise such examples."「研究界的一个棘手问题是,您能否提出一个例子,只有在权重中的训练才有效,而上下文学习将失败?事实证明,设计这样的例子非常困难。」Dan Biderman · The AI Memory Problem: Why Long Context Isn't Enough
"I see all of these questions of continual learning and memory as questions of long context in disguise."「我将所有这些关于持续学习和记忆的问题看作是伪装的长上下文问题。」Dan Biderman · The AI Memory Problem: Why Long Context Isn't Enough
所以他的赌注从"机制优越"退到了"规模逼迫":18 个月内许多公司会坐拥"maybe trillions of tokens"的私有数据——两三年前这叫互联网级预训练语料——到那个量级,context rot(10M 窗口也躲不掉)加上重读成本会逼所有人走向 in-weights。产品形态也具体化了:cartridges(让模型预先研读语料、自我出题自测、再用梯度下降压成约 1000 倍压缩的"知识胶囊"),系统目标是"destroying pre-fill"——把训练算力挪到别的时间花,加载胶囊后直接开始 decode。至于"什么进权重、什么留笔记"的判据,他给出的答案是把球踢给训练本身:"the holy grail is have the model learn for itself... and have it decide when to go to each"(「圣杯就是让模型自我学习……并自主决定何时去各个地方」)——按显著性、频率、affordances 自己学会取舍。这句话请记住,阵营三会再次遇到它。
第二,也是全语料最戏剧性的事件:Jack Morris 加入了 Engram。 上一版"还想知道什么"的第一条是"想看一场把 Morris(每参数约 3.6 bits 的容量上限)和 Engram(权重内化)放对面的对谈"——结果对撞以入伙的方式发生了。而且 Morris 没有收回容量担忧,他在自己的新讲座里亲口承认天真内化必然撞墙:naive next-token 训练能把 loss 压到 0.0001、模型"完美记住"数据,然后一生成就崩掉;就算换成合成数据自学,也只是把墙推远:
"no matter sort of how much data we generate or how much we train, we kind of do plateau because there's this Almost like natural upper bound to how much you can learn in one go from D. But I think it turns out that there are more sophisticated things you can do that make the training gradually harder that make the model better over time."「无论我们生成多少数据或者训练多少,我们总是会达到一个平稳状态,因为从 D 中一次性学习的量几乎有一个自然的上限。不过我认为实际上你可以做更复杂的事情,让训练逐渐变得更困难,同时使模型随着时间的推移变得更好。」Jack Morris · Scaling Compute on Context
换言之:阵营一自己承认了数据墙/plateau 是真的,出路押在递归自我改进(AlphaGo 式——模型给自己出越来越难的题)上。眼下这只是一条"想要的曲线",公开材料里还没有实测版本。这是阵营一的生死线(见"都没说透的"第 3 条)。
世界观分歧仍在:Engram 认为未来是每人一个自己的模型——新访谈里升级成 Tamagotchi 比喻(权重归用户所有、越养越好),并预言长期会跑在个人设备上("个人电脑的新硬件已接近能推理近万亿参数模型")——这是对 Vinyals 工程约束的直接回击。
阵营二:别碰权重,用文件系统 —— 非参数记忆(Gemini: Oriol Vinyals)
Vinyals 站在 Engram 的正对面。他也认同这是一种"持续学习",但机制恰恰相反:episodic memory 应该落在文件系统这种非参数存储里,而不是权重里。理由一半是研究直觉,一半是极其现实的工程约束——一个模型要服务所有人,给每个用户配一份不同权重根本没法上规模:
"I think many, many of us call this kind of a form of continual learning. But I think the mechanism I want it to work kind of, or I mean, it's going to clearly work better and better is this kind of File system style like nonparametric."「我想许多人称这种形式为持续学习。但我认为我希望其运作的机制,或者说,显然会越来越好的是这种文件系统风格的非参数化机制。」Oriol Vinyals · Ep 87 Gemini Co-Lead
"It's a bit more convenient than integrating those back into the weights because even from a practical point of view, we try to serve one model at scale. So what it would be really like painful to have to serve one model with different memories to users."「这比将那些重新整合到权重中更方便,因为即使从实际角度来看,我们也试图以规模服务一个模型。因此,服务一个具有不同记忆的模型对用户来说会非常痛苦。」Oriol Vinyals · Ep 87 Gemini Co-Lead
注意这里的直接对撞:Engram 说"per-team 权重才是圣杯",Vinyals 说"per-user 权重是运维噩梦"。同一个事实(个性化权重难服务),一方当作要攻克的技术难关,另一方当作应该绕开的信号。Vinyals 留了一道门缝——如果硬件能支持个人权重,他也愿意做——但默认押注在"共享权重 + 个人知识库"上。
新语料对这个阵营的净效应:三面受敌,且零新代言人。 其一,Sutton 阵营从需求侧开火——Javed 明说批量更新(Cursor tab 式、几十万用户攒一批数据更新一次)"可以工作,但非常低效",他要的是"教我的模型非常具体的东西,改我那份权重";其二,Engram 从硬件侧拆墙(端侧万亿参数推理 + 把百万级 adapter 端点的磁盘↔HBM 交换当成公司核心 infra 问题在解);其三,Trajectory 从服务侧拆墙——开源的 continual-LoRA 训练栈把训练/采样分池并发,8 路并发训练的墙钟时间≈3 个串行任务,per-customer 权重的运维成本正在真实下降。"没法上规模"这条 2026 年初还成立的硬约束,正在被三路人马同时侵蚀。本批 7 篇里没有一位新受访者替非参数路线站台——这个沉默本身值得记录。
阵营三:分时程 → 分层级 —— in-context 与 weight update 各管一段(John Schulman + 新增 Trajectory/Arjun Karanam)
Schulman 不选边,而是把问题切开。他给出全语料最锋利的一条边界判断:
"I would expect in-context learning to help in a very short horizon regime and to be really hard to beat over a short time horizon, but I would expect weight updates to win over a longer time horizon."「我希望语境内学习在很短的时间范围内有所帮助,并且在很短的时间范围内很难被击败,但我希望权重更新能在更长的时间范围内获胜。」John Schulman · John Schulman on dead ends, scaling RL
他也提醒:如果只是一直 scale,"随便写下什么指标都会继续改进"——换句话说,continual learning 可能被 scaling 顺手解决,也可能需要一条新的 scaling law。他对 LoRA 的定位是"叠在 in-context 之上",而非取代它。这条分时程立场,恰好把阵营一和阵营二都收编成"各自在自己的时程上对"。
新语料把这个框架从"分时程"落地成了"分普适度"。 Trajectory 的 Karanam 在生产系统里给出了第一个可操作的划分判据——按信息对多少人成立来决定放哪一层:
"There's some information that's probably globally accurate, globally true. Things like a tool call repeatedly failing when trying to call a certain tool. That's probably relevant to everybody. And so this should be trained into the model and the model should get better at learning this tool. A certain user is like, I never want to use a sub-agent. Please, please, please don't do it. That's probably not something you should train to the model and leave to the context."「有些信息可能是全球准确、全球真实的。比如某个工具在尝试调用特定工具时反复失败。这可能与每个人都相关。所以这应该被训练进模型,模型应该在学习这个工具时变得更好。某个用户会说,我从来不想使用子代理。请、请、请不要这样做。这可能不是你应该训练到模型中的内容,留待上下文处理。」Arjun Karanam · Continual Learning: How AI Agents Get Better With Every Use
更重要的是他对这个判据的元判断——分层这件事本身不该由人来做,该被抽象掉:
"We no longer think of like, where in your RAM or where in your hard disk to save. That's the level that's abstracted based on what makes the most sense. We think about models versus harnesses versus context in the same way. … This is a scientific problem that can be solved. Let's do that. And then let's abstract that away."「我们不再考虑在 RAM 或硬盘上保存的位置。这是一个根据最合理的数据进行抽象的层次。我们以同样的方式考虑模型、工具和上下文。……这是一个可以解决的科学问题。让我们这样做。然后将其抽象。」Arjun Karanam · Continual Learning: How AI Agents Get Better With Every Use
注意趋同:这和阵营一 Biderman 的"圣杯是让模型自己决定进权重还是留笔记"是同一句话的工程版与研究版——两家公司立场不同(Engram 押权重、Trajectory 押整个系统),却独立收敛到"路由判据不该人写,该让系统学"。上一版"都没说透的"第一条(内化/外化判据空白)因此从"没人给"变成了"两个趋同的候选答案"——虽然都还没证明能 work。
阵营四(新):重建派 —— 换架构、从头学(Core Automation: Jerry Tworek / Rohan Anil;Oak Lab: Rich Sutton / Khurram Javed)
上一版的"侧翼一"是 Tworek 的社会学诊断(这研究必须在大规模上做、有能力的实验室都在忙别的)。这批语料里他完成了立场升级:与 Gemini 前 pre-training 负责人 Rohan Anil 共同创办 Core Automation,并把改良路线整个判了死刑:
"We believe, as I mentioned, that transformers are incapable of continual learning. There's no way how to put continual learning on transformers. So we know we have to find a different architecture."「我们相信,正如我提到的,变换器无法进行持续学习。没有办法在变换器上实现持续学习。所以我们知道必须找到不同的架构。」Jerry Tworek · Building the Automated AGI Lab
论证结构很干净:test-time 学习只有两条现成路——in-context(无遗忘、数据高效,"but it's not very scalable")和持续微调("have the issues of catastrophic forgetting... and neither of those are very solvable"「这会有灾难性遗忘的问题……而这两个问题都很难解决」)。两条都堵死,所以要在架构层表达一个可元学习的学习算法:
"My personal belief is we need to find an algorithm that we can meta-learn, that we can express on the architectural layer. That can represent how does learning look like."「我个人的信念是,我们需要找到一种算法,可以进行元学习,可以在结构层面表达出来。它能够表示学习的样子。」Jerry Tworek · Building the Automated AGI Lab
Sutton/Javed 的 Oak Lab 从另一个源头(Alberta Plan / bitter lesson 传统)到达几乎相同的结论,但手里多了一个具体的算法主张。当被问到灾难性遗忘,Sutton 的回答是全语料独一份的斩钉截铁——"But it's totally curable. You have to have the right algorithm."(「但这是完全可以治愈的。你必须要有正确的算法。」)解药有两味:
"first you need to do what we call step size optimization. And it means every weight in your network has to have a separate step size. So some will move fast, some will move slow. And you will have to meta-learn these step sizes for each weight. Most of your network will have weights that have tiny step sizes. So, then when you train on a new example, they don't get destroyed."「首先你需要做我们所说的步长优化。这意味着你网络中的每个权重都必须有一个单独的步长。所以有些会快速移动,有些会慢慢移动。你需要对每个权重进行元学习这些步长。你网络中大部分的权重步长很小。因此,当你在一个新实例上训练时,它们不会被摧毁。」
第二味是 continual backprop(发表于 Nature):持续注入随机初始化的新单元做 generate-and-test。但这副药有一个改良派无法下咽的服用说明——不能喂给现成模型:
"I don't think that you could take an existing model and say, I'm going to just start updating it with these algorithms because these algorithms meta learn how to learn. So really you have to say, I'm going to learn from scratch."「我认为你不能拿一个现有的模型并说,我将用这些算法开始更新它,因为这些算法是元学习如何学习的。所以实际上你必须说,我将从头开始学习。」Khurram Javed · Rich Sutton and Khurram Javed: Why AI Models Stop Learning
Sutton 对当前范式的否定比 Tworek 更彻底。对 LLM 助手是不是持续学习者,他只回了五个字:"Their weights never change."(「他们的权重从未改变。」)对各大实验室正在押注的合成数据,"No, that's just a big mistake."(「不,这真是个大错。」)——理由是 Big World Hypothesis:世界远比任何智能体复杂,合成数据被人类专家瓶颈锁死:
"But if all the engineers, OpenAI Anthropic or all the big Neolabs, the engineers went on vacation, who would generate the synthetic data? That's the question. It doesn't come from agent's experience."「但是如果所有的工程师,无论是 OpenAI 还是 Anthropic,或者所有大型 Neolabs 的工程师都去度假,谁来生成合成数据?这就是问题所在。它并不是来自于代理的经验。」Khurram Javed · Rich Sutton and Khurram Javed: Why AI Models Stop Learning
(这一枪不只打向大厂——Trajectory 的隐私方案恰恰是"从客户数据采样分布、合成生成训练集"。语料内部的隐性对撞,暂无人接招。)Sutton 给 LLM 的历史定位是敬而远之的:
"large language models are an amazing scientific breakthrough, a breakthrough in the skillful use of language by neural networks. … It's like 20% or a quarter of intelligence. There's more. We're not done."「大型语言模型是一个了不起的科学突破,是神经网络在语言熟练使用上的突破。……它大约占智能的 20% 或四分之一。还有更多。我们还没有完成。」
两家重建派的共同社会学判断,延续并强化了旧"侧翼一":大实验室结构性做不了这件事——Tworek("和基本所有大实验室都聊过")说军备竞赛期没人有心思试 transformer 替代品;Javed 说他们困在 local minimum:新范式"几乎不可能不先变差再变好",锁死在产品上的实验室走不了下坡路。两家的差异也清楚:Core Automation 押"最自动化的实验室"暴力搜索架构空间(自动生成 kernel、每天十个、一百个架构实验),Oak 押已有的具体算法路线图(Alberta Plan 12 步)。还有一处妙的互文:Anil 说他们的成功判据是"全队去度假一周,看实验室能不能自己变得更好";Javed 用"工程师都去度假谁来造合成数据"攻击现范式——同一个思想实验,一家当北极星,一家当武器。
侧翼二:这是范式已经 plateau 的证据(Rob Toews / Ari Morcos,+ Sutton/Anil 加固)
在 AI Vibe Check 里,Rob Toews 把 continual learning 当作"当前范式撞墙"的核心证据——不是一个待解的下一步,而是一个未被解决就说明 LLM 到顶了的根本缺陷:
"there are fundamental limitations that the current paradigm models have that aren't being addressed... things like continual learning or sample efficiency, those are fundamental problems that we're not seeing improvements happening in the current set of models. So I think there's no question that the models are plateauing."「当前的范式模型存在一些根本性的局限性,而这些局限性没有得到解决……像持续学习或样本效率之类的问题,都是我们在当前模型中没有看到改进的根本问题。所以我毫不怀疑这些模型正在趋于平稳。」Rob Toews · AI Vibe Check: The Actual Bottleneck
同场的 Ari Morcos 则把矛头调转——不是 AI plateau,是大家把 LLM 等同于 AI 太草率。新语料里这一侧翼从投资人观点升级成了一线研究主管的技术论证:Rohan Anil 指出 transformer 计算深度天生浅(约 100 层),靠 chain-of-thought 逐 token 补深度是"band-aid";Sutton 直接给 LLM 划了 20-25% 的智能占比、还补了一句"它们可能面临风险"。方向一致、结论不同:Toews 用 plateau 论证悲观,重建派用 plateau 论证换路。
侧翼三:学习信号从哪来?——微调经济学的续集(Kyle Corbitt / Baseten / 新增 Trajectory)
Engram 把 LoRA/adapter 微调当作 continual learning 的主力工具。但 OpenPipe 的 Kyle Corbitt——一个靠微调起家的人——给的现场经验要冷静得多:微调最主要的真实驱动力其实是"被迫用小模型(延迟)",而不是"学新知识";而且一旦上了微调,迭代就变慢、栈变僵。
"the main one I see that really drives fine-tuning is if you have to move to a smaller model, and it's typically for latency reasons."「我看到真正推动微调的主要原因是,如果你必须转向较小的模型,这通常是出于延迟的原因。」Kyle Corbitt · Why Fine-Tuning Lost and RL Won
不过 Corbitt 的北极星恰恰与 Engram 同向——他博文中写下、由主持人 Swyx 现场引述的团队目标正是让每个 agent 从真实世界经验中持续学习——只是他押的载体是 RL / 环境,而非 adapter。Corbitt 本人对这个愿景的确认毫不含糊:
"I super believe that. And that's basically the vision... If we get to a world where we build that, then I think it's just like the advantages are huge. They're clear. Everyone should just deploy their agents that way."「我非常相信这一点。这基本上就是……的愿景。如果我们能建立一个我们构建的那个世界,我认为优势是巨大的。它们很明显。每个人都应该以这种方式部署他们的 agents。」Kyle Corbitt · Why Fine-Tuning Lost and RL Won
推理厂商 Baseten 的 Tuhin Srivastava 则把它当成一个可产品化、快被抹平的基础设施问题——用 inference↔post-training 闭环加训练 API 把它"大致解决",视角比研究者乐观得多:
"we'll create the best training APIs to make it so continual learning becomes somewhat of a solved problem. It's not just like a discrete."「我们将创建最好的训练 API,使持续学习成为一个相对容易解决的问题。这不仅仅是一个离散的过程。」Tuhin Srivastava · Baseten CEO on the AI Inference Crunch
Trajectory(Windsurf/SWE-1 出身的 Malde + DeepMind/Apple 出身的联创)是这一格的新住户,也是第一家把"接好 pipeline"真做成产品并交付客户的——Harvey、Clay、Decagon、Rogo、Mercor;与 NVIDIA 合作在 Nemotron 上训 Harvey 的法律模型;首个客户 onboarding 从三个月压到一周内出模型。他们为什么非要碰权重?因为专业领域的容错率不给外挂留位置:
"For a field like legal, like getting 80% of the way there is the same thing as zero."「对于法律这样的领域,达到 80% 的结果与 0% 的结果是一样的。」Ronak Malde · Every product of the future will be a living system
他们最扎实的贡献是把"学习信号从哪来"这个问题做实了:thumbs up/down 没人点("你上一次在 Cursor 里点赞是什么时候?从来没有"),真信号是用户的纠正行为——undo、edit、retry;而现行 RL 把这些丰富信号全压成一个标量,是结构性浪费:
"The reason is RL, it's still taking all of this kind of useful information from the real world, like I mentioned, all the corrections and everything, and putting it into just one number. Which is really broken."「原因是强化学习仍然将所有这种有用的信息,从实际世界中获取的所有修正和其他内容,放入一个数字中。这实在是很糟糕。」Ronak Malde · Every product of the future will be a living system
他们的替代品是 OPSD/SDPO(把"特权信息/提示"塞给教师版自己、对齐逐 token 的 log-prob,不需要并行 rollout 基建),且已在 120B 模型、百次工具调用的任务上超过 RL 基线。但诚实的部分同样重要——规模化立刻暴露出新的失败模式:hint leakage(模型直接抄提示、跳过推理——reward hacking 的持续学习变体)和 but/wait 塌缩(教师反复纠偏把模型训成"maybe 机器")。而对全行业现状,Malde 给出了比 Baseten 冷静得多的自我定位:
"as a research community right now, we're in this zone of what I call pseudo continual learning, where there's some still level of like batch updates offline, and then re uploading the model."「作为一个研究社区,我们目前正处于我所称之为伪持续学习的阶段,在那里仍然存在一些批量更新离线,然后重新上传模型的情况。」Ronak Malde · Scaling up Continual Learning
上一版留下的落差判断(研究者当"没人破解的关卡",厂商当"接好 pipeline 的工程")现在有了更精确的版本:连把它当工程卖的人,也承认自己卖的还是"伪持续学习"——"离端到端解决方案还远得很"(Malde 原话转述)。Baseten 的"solved problem"乐观,在离炮火最近的同行那里得不到背书。顺带一条该进数字台账的量级:Malde 称行业每天在推理上花掉数百万亿 token,这些成败痕迹是眼下被丢弃的最大训练信号源。
都没说透的
- "内化 vs 外化"的判据:从空白到两个趋同的候选答案——但都还是支票。 上一版这里是空的。现在 Biderman 给了"显著性/频率/affordances,让模型自己学",Karanam 给了"普适度分层(全局真→权重,个人偏好→上下文),然后把路由本身抽象掉"。两把尺子这次终于在同一维度上(信息对多少人成立),且都把最终答案押给"系统自己学会路由"。但没人展示过一个真的学会了取舍的系统——Biderman 自己说"more breakthroughs are needed"。判据从"没人给"进步到"给了但没兑现"。
- 灾难性遗忘:从"被绕过"变成"正面交锋、结论相反"。 上一版抱怨没人正面讲遗忘。这批语料里它成了断层线本身:Sutton 说"完全可治"(per-weight 元学习步长 + continual backprop),但 Javed 补刀"必须从头训练";Tworek 说在 transformer 上"neither of those are very solvable";Engram 的态度介于两者("怎么训练而不摧毁模型"仍列为 open problem)。真正没说透的变成了:Sutton 的解药发表在 Nature,却没有任何 frontier lab 在 LLM 规模上复现——是没人信,还是试过不 work?语料里没人回答。
- 容量上限:对撞以最意外的方式发生,问题只解决了一半。 上一版最想看的"Morris(容量)×Engram(内化)"对谈,以 Morris 加入 Engram 收场。他没有放弃容量结论——反而亲口确认了 plateau/数据墙,并把出路押在"让训练逐渐变难"的递归自我改进上。天花板被承认了;能不能凿穿,眼下只有一张理想曲线图,没有公开的实测曲线。这仍是阵营一的生死线。
- 谁来评估"学对了":有了纹理,仍未闭环。 Trajectory 把 reward 从人工评分换成用户纠正行为,是实质进步;但立刻撞上 hint leakage 和 but/wait 塌缩——学习信号本身会被模型钻空子,这正是"模型悄悄变了之后怎么知道学的是对的"这个老问题的新化身。Malde 的答案(Act Two:给 PM 一块能看到哪里变好变坏的面板)本质上还是人肉监督。机制性的答案,全场依然空白。
- (新)改良派的数据 vs 重建派的时间表:两边都在用对方的短处定义自己。 改良派有客户、有指标,但自认"伪持续学习";重建派有第一性原理和 Nature 论文,但连 Javed 自己预告的"先变差再变好"那段下坡路都还没公开走过(Sutton 声称今天 2000 瓦就该能做到的事,没有任何 demo)。语料里没有一场对话让 Biderman/Malde 与 Sutton/Tworek 同台——四家公司在四个录音棚里各说各话。
我的看法
(以下是判断,不是事实。) 上一版我押:短期 Vinyals 的实用主义胜出、中期 Schulman 的分时程框架是对的。这批语料让我上调后者、下调前者。上调分时程,是因为它正在被工程化成"分普适度"(Trajectory),而且两个互不相识的团队——Engram 的研究侧和 Trajectory 的工程侧——独立收敛到同一句话:"路由判据不该人写,该让系统学"。互不通气的趋同通常是方向正确的信号。下调 Vinyals,是因为这个阵营在 7 篇新语料里零新代言人,而它的核心工程论据(per-user 权重没法上规模)正被并发 LoRA 池、百万 adapter 端点、端侧万亿参数三路同时拆除——那是一个此刻成立、但保质期肉眼可见的约束。新的主线赌注是改良 vs 重建。 我认为未来两三年改良派会在商业上碾压:它有客户、有数字、有周级迭代周期,而重建派按自己的说法还要先走一段"变差"的下坡。但语料里最诚实的三句话恰恰都来自改良派自己——Morris 承认 plateau、Malde 承认"伪持续学习"、Biderman 承认判据是 open problem——所以我不敢说重建派错了,只敢说重建派早了。决定性证据缺两块:(1) Engram 的递归自我改进曲线能否真的不 plateau——这决定"写进权重"是路还是墙;(2) 有没有人在有意义的规模上从头训一个元学习底座——这决定阵营四是哲学还是工程。对"必经关卡"这个共识,我的把握进一步上调(Tworek 和 Sutton 都已用创业行为投票);对"哪派赢",把握依然很低,且要加一条新的警告:这批受访者几乎人人都在卖持续学习——创始人密度比上一批更高——共识的幸存者偏差在加重,而不是减轻。
还想知道什么
- Engram 的自我改进实测曲线。(承接上版第一条——Morris×Engram 的对撞已以他入伙的方式兑现,容量天花板被亲口承认。)下一个要看的是:那条"训练逐渐变难、模型持续变好"的理想曲线有没有实验版本。如果递归自我改进在真实私有语料上依然 plateau,阵营一的故事就得重写。
- Continual backprop 在 LLM 规模上的第一次复现。 Sutton 说灾难性遗忘"完全可治"、算法发在 Nature,Javed 说必须从头训。谁来出这笔从头训的钱?多大规模算数?一场"frontier lab 训练工程师 × Oak Lab"的对质会立刻分辨这是被集体忽视的金矿,还是 toy-scale 不外推的老故事。
- learn-from-deployment 的严格前后对比。(上版第三条,部分兑现:Trajectory×Harvey 有"指标全面提升 + onboarding 从三个月到一周"的说法,但全是厂商口径,且 Malde 自认还在离线批量更新。)想要的是第三方可查的上线学习案例:学了三个月的模型 vs 第一天的模型,新任务提升多少、旧任务回归测试掉没掉。
- 真正的怀疑派仍然缺席——而且更缺了。 这批 7 篇里 6 篇的主讲是持续学习创业者;最接近反方的时刻是 Sonya Huang 在 Sutton 那场替 sim-training 和合成数据做的抵抗,但那是主持人的职业性抬杠。Biderman 自己都承认"很难设计出 in-context 必败的例子"——"长上下文 + 检索 + compaction 会一路吃掉这个需求"这个反方论点其实有弹药,却没有人全职扛它。
- (新)改良派与重建派同台。 最想看 Biderman vs Sutton:在冻结的 transformer 上挂 adapter 算不算"学习"?Sutton 对 LLM 的指控是"权重从未改变",那 LoRA 只改一小撮外挂权重的方案在他的定义里算什么?这个追问没人提过,而它正好落在两条断层线的交点上。
取材
- Memory and Continual Learning: Engram's Dan Biderman and Jessy Lin · 2026-06-27 · 38cea6160e7181a498ccefad30236956
- The AI Memory Problem: Why Long Context Isn't Enough (Dan Biderman / Engram) · 2026-07-27 · 3aaea6160e7181cfbac0e557c83ca7b6
- Scaling Compute on Context (Jack Morris / Engram) · 2026-08-22 · 3c4ea6160e7181b89f6dc70804705c4f
- Ep 87: Gemini Co-Lead on World Models, RL's Next Domains & Continual Learning (Oriol Vinyals) · 2026-05-25 · 36bea6160e71814d817ef4b66284a6cf
- Ep 81: Ex-OpenAI Researcher On Why He Left (Jerry Tworek) · id 2f9ea6160e71813c85c9cbd5e83c0a41
- He Left OpenAI To Think Bigger - EP 53 (Jerry Tworek) · id 2f1ea6160e718199be60df22d68ef204
- Building the Automated AGI Lab: Core Automation's Jerry Tworek and Rohan Anil · 2026-08-04 · 3b2ea6160e718118b925c75487ecafc9
- Rich Sutton and Khurram Javed: Why AI Models Stop Learning (Oak Lab) · 2026-08-22 · 3c4ea6160e718131b890f4e72f90f833
- John Schulman on dead ends, scaling RL, and building research institutions · 2025-12-20 · 2cfea6160e71817c96a4e510a6a373dc
- Continual Learning: How AI Agents Get Better With Every Use (Arjun Karanam / Trajectory) · 2026-08-22 · 3c4ea6160e7181e0adc7cd856b471297
- ⚡️Every product of the future will be a living system (Ronak Malde / Trajectory) · 2026-08-22 · 3c4ea6160e718148b018d4952c6608e2
- Scaling up Continual Learning (Ronak Malde / Trajectory) · 2026-08-22 · 3c4ea6160e7181d2ba5fef05c86fc589
- Why Fine-Tuning Lost and RL Won (Kyle Corbitt / OpenPipe) · 2025-10-17 · 28fea6160e718186bfe4e90dde1d3a7d
- Information Theory for Language Models (Jack Morris) · 23bea6160e7181d7bc8fe8b7ee98a4ec
- AI Vibe Check: The Actual Bottleneck In Research (Rob Toews / Ari Morcos) · 2d1ea6160e718151b03de5b615a3a9fa
- Baseten CEO Tuhin Srivastava on the AI Inference Crunch · 35dea6160e718145a7a3c5263827a3bb
未纳入(主题着墨极少):Vinod Khosla · Predicting the Future(254ea6160e7181949bc1d5f60ad75dcd);How To Navigate Your Career · Elad Gil(254ea6160e7181f1b649d01875182370);He Raised $800M Starting at 18(2b2ea6160e7181fe9f72d88b7cea078f)——这三篇未触及持续学习/记忆主题,未取材。