主题综述

对抗地基模型的应用层:假设模型变强还能让你更强吗 · Building Against the Grain

主题综述

更新日志

主流共识

第一点:「模型变好测试」已经从投资人黑话变成所有人的选品第一关。测什么?两条死刑判据:模型之上那层太薄,积不了值;模型变好后那层会消失,做不成持久生意。Cresta 的 Ping Wu 给出全场最完整的表述(并当场给出联络中心的通关答案):

"A model is a bunch of weights and data and itself is not going to provide a value, right? And now the question is how much you need to build on top of it to deliver that value. If that layer is very, very thin, then I would argue probably you don't have much opportunity to accrue value, right? And then also if that layer will be gone when the model gets better, there's no way you have a durable business. But that is not a case for contact centers and where a majority of the agencies are still on-premise and where a lot of, there are so many, look, on average agents in the Fortune 500, we look at some surveys, they interact with 8 to 10 different systems."
「模型是一堆权重和数据,它本身不会提供价值,对吧?现在的问题是,你需要在其之上构建多少才能交付该价值。如果那一层非常非常薄,那么我认为你可能没有太多机会来积累价值,对吧?此外,如果当模型变得更好时,那一层将不复存在,那么你就不可能拥有持久的业务。但联络中心的情况并非如此,大多数机构仍然是内部部署的,而且有很多,看看,平均而言,财富 500 强的座席,我们看一些调查,他们与 8 到 10 个不同的系统进行交互。」

同一个测试在不同人手里换了皮肤:Weinberg 的版本是"与企业 GPT license 的 Delta"(见分歧 D),Tuhin 的版本是"用户信号编码在哪"(见分歧 C),Redpoint 的版本是 80/20 配比(见分歧 B)。测试本身是共识,测试的答案才是分歧——这个测试也已坐进 mental-models 台账("模型变好测试 · Better-Models Test")。

第二点:价值向上积累,所以实验室必然向上爬——"实验室会下场做应用"是所有人的共同前提,不再是尾部风险。红杉的 Doug Leone 用数十年周期经验给出宏观面:

"It always accrues up. Just look at the gross margins as you move up markets. Look at the gross margin of chip companies. Look at the gross margins of the system companies. … But if we're looking over time, I think value is going to accrue to quote the application layer, what that ever looks like. You know, it's going to accrue up near the customer, near the money, near the business user."
「它总是向上积累。只要看看你向上移动市场时的毛利率就知道了。看看芯片公司的毛利率。看看系统公司的毛利率。……但如果我们纵观全局,我认为价值将会归于应用层,无论它最终会是什么样子。价值会累积在更靠近客户、更靠近资金、更靠近商业用户的地方。」

而这句话的镜像就是威胁本身:既然价值在上面,被商品化压力追赶的实验室一定往上爬。Redpoint 的 Patrick Chase 在 DeepSeek 冲击后把逻辑链说全了:

「第二,我认为它向模型公司表明,规模不是一个持久的护城河。…因此,我认为他们将寻求通过两种方式之一来构建他们的护城河,要么是通过像 OpenAI 这样向上移动堆栈的发行版,他们最近推出了一堆应用程序和代理的东西。或者通过专业化。就像 Jacob 刚才谈到的机器人例子。所以我认为他们会朝着这两个方向发展。但是,是的,模型正在商品化。」
— Patrick Chase · Ep 61: Redpoint's AI Investors

这不是理论推演,语料里全是已发生的案例:OpenAI 对 Granola 出了直接竞品(Mignano 亲历,他当年在 Lightspeed 深度参与 Granola)、Anthropic 组建整队做设计对打 Figma、公开宣布进军 legal(Harry Stebbings 骂这是追逐 AGI 却去抢律所午餐)。没有一个人以"实验室不会来"为前提做论证——分歧只在这件事多致命(见分歧 D)。这与姊妹主题 ai-moat-2026 里 Angelopoulos 的"实验室上爬对 Harvey 是风险"是同一条线。

第三点:模型与生产之间的距离,是应用层现阶段无争议的活路。Decagon 的 Jesse Zhang 给出需求侧证词——企业自己试过就知道:

"Some people experimented with GPT somewhat and they quickly realized that to actually get something production level, you need a lot more than that. You need essentially a whole framework for non-technical users to come in and build and adjust things. You need learning, monitoring, observability, the ability to run experiments, A-B testing, and stuff like that. Why build that internally?"
「有些人尝试过 GPT,但他们很快意识到,要真正达到生产水平,需要的远不止这些。本质上,你需要一个完整的框架,让非技术用户能够参与进来,构建和调整事物。你需要学习、监控、可观察性、运行实验、A-B 测试等等。为什么要内部构建这些?」

数字全都指向同一段距离:Fortune 500 座席平均跨 8-10 个没有 API 的老系统、50% 联络中心对话仍在 on-prem、auto-summary 要在 2 万座席跨洲呼叫中心落地(Ping Wu,"这些不是 AI 问题"——模型再强也不会替你修最后一公里);普通企业工作流要从 17 个、有时 50 个系统拉数据(Weinberg);模型今天的能力远超企业实际用法,缺的是部署基建(Ashwin)。Sequoia 主持人的收束被 Ping 认可:痛苦全在最后一公里,所以价值也全在应用层。但注意,这条共识自带保质期——见"都没说透的"第 4 条。

第四点:被吞名单本身没有争议。四类产品被跨阵营判死,连为应用层辩护最卖力的人也不辩护它们。其一,工作流没被 AI 重写的品类:

「我们在早期的人工智能初创公司浪潮中看到,出现了很多人工智能原生的概念或使用人工智能生成 PowerPoint。而且我认为这两种情况下的工作流程变化不大。你可以按照已经存在的产品,生成你正在寻找的东西。因此,我认为人工智能原生的 PowerPoint 平台可能是 Google,对吧?」
— Patrick Chase · Ep 61: Redpoint's AI Investors

其二,纯"执行"型产品(价值迁往"思考"型市场):

"You have an end of one network effects product. That, by the way, is sort of ahead of where I think the market is going in terms of moving from products focused on execution, which today are being subsumed by coding agents, to markets focused on thinking. And I think a lot of the thinking work is going to be done in products like Figma."
「你拥有一个最终的、具有网络效应的产品。顺便说一句,我认为这领先于市场的发展方向,即从专注于执行的产品,(这些产品现在正被编码代理所取代)转向专注于思考的市场。我认为很多思考工作将会在像 Figma 这样的产品中完成。」

("an end of one" 为 n-of-one 转写瑕疵。)其三,给一个模型进步后不会存在的职位造的 copilot:

「但事后看来,我认为会有更多的企业朝着这个方向发展,因为为一个可能不会存在的职位构建副驾驶是没有意义的,至少不会以几乎相同的方式存在。以一种能够从反馈循环中学习并做出更好预测的方式,将这个端到端的流程自动化可能更有意义。」
— Brendan Foody · Ep 68: Mercor Brendan Foody

其四,Ashwin 补充的"纯为人来干活设计的那类 SaaS"会承压(但软件整体不消失),以及 Tuhin 的"不往工作流里植入智能的存量软件公司"才是真正的灭绝时刻归属。注意这份名单的共同特征:死因都不是"实验室决定做你",而是模型的水平进步顺手覆盖——这为分歧 D 的裁决埋下伏笔。

分歧在哪

先立靶子。a16z 主持人转述的 2026 上半年主导叙事是:Anthropic/OpenAI 是"最后的创业公司",将接管一切,应用只是 thin UI + FTE 实施——本场语料几乎全员对此开火,但开火的方向彼此并不一致。真正的争论不是"应用层会不会被吞"(没人真持完全吞噬论),而是四个更细的战场:更强的模型对你是不是顺风(A vs B)、终局是不是应用层反向长出模型(C)、实验室意图算不算硬约束(D)、以及斜率本身能不能被读对(E)。

阵营 A · 顺斜率派:把产品建在「下一代模型会解锁」的位置

信条即标题的正方:assume models get better,选品选在当前模型刚好还做不到、下一代刚好解锁的位置。最完整的活样本是 Mercor 的 AI 面试官——2023 年 3 月用 GPT-4 做的原型是废品,但产品位置押对了:

「我记得在 2020 年或 2023 年 3 月底,当 GPT-4 问世时,我们就像是构建了我们的第一个 AI 面试官原型,但没有奏效。就像模型每两三个问题就会产生幻觉。所以,随着时间的推移,它一直在乘着这股惊人的顺风。……推理模型使它们在处理大量上下文、弄清楚什么重要、关注什么等方面变得更好。」
— Brendan Foody · Ep 68: Mercor Brendan Foody

这一侧的经济学论证由 Anish Acharya 给出——模型每变强一档,下游把新能力产品化并提价的速度跑赢成本上升:

"I think what we keep seeing is as the models get better, downstream players' ability to take those capabilities, productize them and raise prices has outstripped The Raisin Costs, right? … Like coding agents, right? What you can do with coding agents, Claude Code came out last February, is dramatically better. Is anybody here saying, well, I should go back and use Sonnet 3.7 because it's cheaper? You know, or I should use something other than Opus 4.5 or Codex 5.2. Like nobody is saying that because the capability is so much more powerful."
「我认为我们不断看到的是,随着模型变得更好,下游玩家利用这些能力、将其产品化并提高价格的能力已经超过了成本的提高,对吧?……就像编码代理,对吧?你可以用编码代理做什么,Claude Code 去年二月发布,已经有了显著的改进。有人会说,我应该回去使用 Sonnet 3.7,因为它更便宜吗?你知道,或者我应该使用 Opus 4.5 或 Codex 5.2 以外的东西。没有人会这么说,因为这些功能强大得多。」

("The Raisin Costs" ≈ the rising costs,转写瑕疵。)成本侧的顺风同样成立:推理与训练成本年降约 10 倍直接改善其上应用的利润结构(Patrick Chase),GPT-4.0 单 token 成本自发布以来降了 100 倍(Anish)。而"新模型直接解锁新产品"的最新实证来自 Decagon——为 Claude Code 这类场景造的推理模型,顺手解锁了他们的 Duet Autopilot(审查上百万条对话、自写测试与改进草案,创业初期"不可能"):

"It only became possible when all the reasoning models got better. And of course, Anthropic, OpenAI are making these reasoning models mostly for the cloud codes of the world. But they are also really good for Duet, for example. That was kind of like a moment where it's like, oh, wow. First of all, you can just see the improvement over time of the models."
「只有在所有推理模型进步时,才变得可能。当然,Anthropic、OpenAI 主要是为云代码世界开发这些推理模型。但它们对 Duet 也非常有用。那一刻就像是,哦,哇。首先,你可以看到模型随时间的改进。」

("cloud codes" 为 Claude Code 转写瑕疵。)但顺风的另一面是绞索。同一根进步曲线,把 Mercor 起家的众包标注模式杀死了——A 阵营自己提供了本主题最干净的"同一家公司同时站在曲线两侧"样本

「但随着模型变得越来越好,这种众包模式开始崩溃,因为你需要真正高质量的人才直接与研究人员合作……我认为这种趋势将继续下去,那些陷入超高容量众包渠道的公司可能会看到很多烧钱的情况。」
— Brendan Foody · Ep 68: Mercor Brendan Foody

那么事前怎么知道自己在顺风侧还是绞索侧?A 阵营给出的唯一可操作测试是需求弹性——模型抬升生产力时,你的品类需求会不会跟着爆炸:

「我想说的另一件事是,人们应该关注需求弹性非常大的领域。例如,我认为经济中需要构建多一百倍或一千倍的软件,对吧?……我们只需要这么多会计师,对吧?还有这么多的会计职能。因此,我们应该尽可能关注那些当我们能够提高总体生产力时,需求会大大增加的领域,这可能也是一个稳妥的选择。」
— Brendan Foody · Ep 68: Mercor Brendan Foody

这一派的生存姿势由 Redpoint 定调——不必自己造推理模型,但新能力出现时必须第一个带给客户:

「重要的是,你要对模型的发展方向保持敏感。因为这些模型的迭代速度很快,可能每三到六个月,你的公司就会面临一次灭绝级的事件。比如,如果推理模型出现了,你没有将其带给你的客户,但其他人却做了。所以,你必须对发展趋势保持敏感。但你不需要成为制造推理模型的人。」
— Jacob Effron · Ep 61: Redpoint's AI Investors

Mignano 把这一派的产品形态命名为 harness:与模型紧耦合、形成产品-模型互动飞轮的应用(Claude Code / Claude Cowork 是他举的原型)。注意 harness 是 A 阵营的极端形态——耦合越紧、顺风越足,但也把自己的命运跟单一实验室的斜率绑得越死。

阵营 B · 够好派:收益在模型之外,护城河刻意建在斜率外

反方旗帜是 Jesse Zhang。Harry Stebbings 给他出了道二选一:独家用最新模型一年 vs 一年内随意招任何工程师——

"Oh, the latter, for sure. No question. I actually don't think there's that much advantage in a lot of application layer solutions from having a better model. There is some advantage for sure."
「哦,当然是后者。毫无疑问。实际上,我不认为在很多应用层解决方案中,拥有更好的模型会有那么大的优势。当然,肯定有一些优势。」

他的归因很明确:客服的瓶颈不是推理而是指令遵循,模型已经 good enough,收益来自围绕模型构建的那一整圈——

"I think the models are good enough for our use case, yes. But I think most of the gains, the other way to put it, most of the gains in what we do are from building around the models. Can you get it to be really accurate and orchestrate well? Can you have this platform around it that makes it really easy to tell when stuff's not so good and can be improved and automatically improves and so on? So I would choose having just unlimited access to the great engineers over probably most things right now."
「我认为这些模型对于我们的用例来说已经足够好了,是的。但我认为我们所获得的大部分收益,换句话说,我们在所做的事情中获得的大部分收益都来自于围绕模型构建。你能让它变得非常准确并协调得很好吗?你能围绕它建立一个平台,使其能够很容易地判断出什么时候东西不太好,并且可以改进,并自动改进等等吗?所以我宁愿选择拥有无限量的优秀工程师,而不是现在的大部分东西。」

Redpoint 把这个立场做成了可检验的结构性配比:

「我们寻找显著的产品深度,或者其他团队难以复制的东西。我认为 Motif 就是一个很好的例子,他们在云端构建 Autodesk。显然,AI 将是他们工作的一部分,但他们的解决方案可能是 80% 的工作流程,20% 的模型,而不是 80% 的模型,20% 的工作流程。我认为这对其他人复制它的难度有很大影响。」
— Patrick Chase · Ep 61: Redpoint's AI Investors

同场 Effron 宣布上一代护城河叙事("数据资产让我的模型更好")被实战证伪,真护城河是 UX、产品广度等成千上万件小事——恰好是不随底层模型变强而贬值的那部分("千件小事护城河"已入 mental-models 台账)。Ping Wu 则把 B 的立场精细化成按用例拆分——哪里顺模型、哪里补模型:

"For AI agent by itself, I think the foundation model itself is already pretty good. You just need to get the best out of it, at least for a digital channel for chat. But for other use cases, there's a lot of opportunity to fine-tune the models and to make them for tasks like summarization, for tasks like auto-completion sentences, and that kind of stuff."
「对于 AI 代理本身,我认为基础模型本身已经相当不错了。你只需要充分利用它,至少对于聊天等数字渠道来说是这样。但对于其他用例,有很多机会可以对模型进行微调,并使它们适用于诸如摘要、自动完成句子之类的任务。」

Decagon 悖论——本节最重要的观察:同一家公司同时坐在 A、B 两边。Decagon 90% 的工作流跑在微调开源小模型上(约一年多前因语音延迟主动离开前沿模型,剩余 10% 用闭源前沿模型做探索性项目),旗舰新品 Duet Autopilot 却是被前沿推理模型解锁的(见阵营 A);276e 里 Jesse 说模型在指令遵循上已 good enough,3b2e 里 Ashwin 却说指令遵循恰是模型变强的有效维度、让产品面从紧路径客服扩到开放式销售对话。Jesse 自己的收束是:等待清单存在(voice-to-voice、小模型开箱即智能),但商业瓶颈不在模型侧、在公司建设速度。这说明 A vs B 可能根本不是公司级选择,而是 feature 级选择——但语料里所有人都在公司级别上争论(见"都没说透的"第 3 条)。

B 阵营还有一条独有的定价论据(Jesse):贴着模型的中间层会被按"模型成本+加成"定价、天然被模型层挤压,应用层若产品做得够厚,则对标所解决的业务问题——人力预算通常比软件预算大一个数量级。离模型越远、离业务问题越近,价值捕获越不受模型变强/降价的挤压。这与 Doug Leone 的"价值向上积累"在机制层面互为表里。

阵营 C · 合流派:应用层反向长出模型层

这是语料里最新鲜的一派,它拒绝"顺模型还是防模型"的提问方式,答案是:把模型内化。判据最干净的表述来自 Baseten 的 Tuhin——被 Sarah Guo 用"独立应用层到底存不存在"逼问时:

"I think the application layer will exist for a number of reasons. One is because I think this idea that what is valuable to a company is the user signal that they can gather, that only they can gather. And to the extent that that is encoded In a model, I think a lot of their business will be at risk, but to the extent that it is encoded in workflows, that is where they will be able to develop modes."
「我认为应用层会存在有几个原因。首先,我认为对于企业来说,唯一有价值的是他们能收集到的独家用户信号。如果这些信号只编码在模型里,我认为他们的业务将面临很大风险;但如果信号编码在工作流中,他们就能建立起护城河。」
Tuhin Srivastava · Baseten CEO Tuhin Srivastava

("modes" 为 moats 转写瑕疵。)机制在下一步:实验室结构性拿不到应用内的用户信号(他举深入临床工作流与 EMR 的 Abridge),掌握信号者反而能把它当奖励信号后训练长程 agent 专用模型——防吞噬的武器正是从吞噬者那里学来的。多步工作流(支持工单进来通常有 1 到 20 个动作,非 one-shot)就是通用前沿模型够不到、专用模型落地的位置。门槛问题由 Foody 回答——RFT 让应用层定制第一次划算:

"Whereas in reinforcement fine-tuning, you instead define the outcome that you care about. … And the reason I'm so optimistic about it taking off is that it's like, Profoundly data-efficient, right? And it finally makes sense to customize models at the application layer."
「而在强化微调中,你定义的是你关心的结果。……我之所以如此乐观地认为它会流行起来,是因为它非常高效,对吧?它终于让在应用层定制模型变得有意义了。」

数百到数千条样本即可(对比 SFT 时代数万到数十万对仍常拿不到想要的能力);推理能力会被基础模型全部带来,应用层剩下的可守空间是公司知识库与"什么算好"的定义。终局表述来自 Ashwin:

"So I think there will always be a space for application layer companies. Maybe in the long term, application layer companies just become labs for specific verticals, you know, because your primary product ends up being the models that are just really good at doing those specific tasks. But I think the application layer is probably here to stay."
「所以我认为应用层公司始终会有其存在的空间。也许从长远来看,应用层公司只是变成特定领域的实验室,你知道吗,因为你的主要产品最终就是那些在特定任务上表现良好的模型。但我认为应用层可能会持续存在。」
Ashwin Sreenivas · Decagon's Playbook (a16z)

C 阵营还给出了时序方法论,部分调和了 A 与 B——先骑最强前沿模型证明有值得优化的东西(A 的姿势),再后训练叛逃出斜率(B 想要的结果):

"go prove to yourself We're the best-in-class model that you have something worth optimizing. … there was that meme, which was like, it was like two years ago. It feels like no GPUs, pre-product market fit. It's like no post-training pre-product market fit is what happened."
「首先要在顶尖模型上证明你拥有值得优化的东西。……两年前有个梗,那就是 “没有 GPU,就没有产品市场契合度”。现在的情况变成了 “没有训练后调整,就没有产品市场契合度”。」
Tuhin Srivastava · Baseten CEO Tuhin Srivastava

("We're" ≈ with the,转写瑕疵。)供给侧证据显示合流已在发生:Baseten 约 95% 的 token 量跑在定制模型上、"没人在跑 vanilla 开源权重";Decagon 90% 工作流在微调开源小模型上。如果 C 为真,"应用层 vs 地基模型"这个对立本身正在过时——双向渗透:实验室向上做产品,应用层向下养模型,中间相遇。

阵营 D · 实验室意图:它算不算选品硬约束

覆盖问题里最拧巴的一个战场:OpenAI/Anthropic 会不会做你的产品?该不该据此选品?最硬的威胁表述来自 Foody:

「我绝对属于这样一种观点,即 OpenAI 现在是,而且将来也会是一家产品公司,而不是 API 公司。我认为很多 API 功能将会变得商品化,关键在于你如何与所有客户、联系人整合,随着时间的推移,他们能够产生很大的定价权。」
— Brendan Foody · Ep 68: Mercor Brendan Foody

他的终局推演更狠:通用 API 只容得下一个玩家(大概率是现排名前两位实验室之一),其余价值挤向每个垂直、每个客户用例的应用层定制——应用层没死,但只剩定制这条活路。然而全场对威胁的最有价值贡献是 Weinberg 的重定义——威胁不是实验室"决定进你的垂直"(垂直进攻),而是通用模型-产品的常规改进把你的价值水平抹平:

"I think just moving fast enough on product. That is always, I think, the biggest existential threat for all the application layer companies. And it's not necessarily that Anthropic or OpenAI are tomorrow going to put 50% of their resources after the legal vertical or tax vertical or anything like that. But they're just improving their product and models and the value of your product is going to go down unless there is a massive Delta between what your product does and what you could get from an enterprise GPT license, right?"
「我认为是在产品方面推进得不够快。我认为,这始终是所有应用层公司最大的生存危机。不一定是因为 Anthropic 或 OpenAI 明天会把他们 50% 的资源投入到法律垂直领域或税务垂直领域之类的。但他们只是在改进他们的产品和模型,除非你的产品所做的事情与你可以从企业 GPT 许可中获得的东西之间存在巨大的差异,否则你的产品的价值将会下降,对吧?」

据此他的选品罗盘不是盯同行,而是每天读实验室的 roadmap——预判客户的哪些前沿问题会被实验室"顺手"解决:

"And so it's just a constant existential threat of how do you make sure you get to like escape velocity on product and So you have enough of a product mode for them to not run you over. And I think about that daily. Like when I'm thinking about competitors, the main thing I think about is just I'm more bullish on these labs than most people I think. I mean, a lot of people are. I'm very bullish. They have incredible talent. And I think more about what are the frontier problems that our customers have that they're going to solve later."
「因此,这是一个持续存在的生存危机,即如何确保你在产品方面达到逃逸速度,从而拥有足够的产品模式,使他们无法超越你。我每天都在考虑这个问题。就像当我在考虑竞争对手时,我主要考虑的是我对这些实验室比大多数人更乐观。我是说,很多人都是。我非常乐观。他们拥有令人难以置信的人才。我更多地考虑的是我们的客户拥有的前沿问题,他们稍后会解决这些问题。」

("product mode" 为 moat 转写瑕疵。)他给出的走出 wrapper 三件套:非 AI 核心软件("这实际上会非常有区分度")、专有数据、支撑 agentic 规模的企业级基建——同行 90% 招前端工程师赢 demo,Harvey 的 EPD 约 40% 是 Databricks 级基础设施工程师,去年处理近 5 亿份文档。

豁免论阵地由 Anish 和 Mignano 把守。Anish 的结构性论证:实验室会复刻 primitive、甚至做产品营销(他点名 Claude 的法律包装),但不会优先做功能表面厚重的市场,而且——

"Perhaps, I just think that the model companies have ambitions in so many directions that it's hard for them to prioritize building opinionated UIs for the legal community. I also think in many of these categories, again, being multi-model is important. And OpenAI is only going to ever give you OpenAI models, right? Anthropics is only going to give you their models. Same with Google. So if you are multi-model rich feature surface, I think being an apps company is better."
「也许吧,我只是认为模型公司在很多方向都有雄心壮志,因此他们很难优先为法律界构建有主见的 UI。我也认为在许多这些类别中,同样,多模型很重要。而 OpenAI 只会给你 OpenAI 模型,对吧?Anthropic 也只会给你他们的模型。Google 也是如此。所以,如果你是多模型、功能丰富的应用,我认为成为一家应用公司更好。」

多模型聚合是应用公司的结构性位置:各家实验室大致同步创新、80% 能力互为替代、20% 各有专长(价值多在这 20%),实验室自己永远给不了聚合。他的选品推论是"weird wins"——做模型能反映、但实验室做起来不自在的品类(陪伴类产品用户欢迎但实验室不适,Grok 除外),以及产品周期律:在位者只会把既有品类做得更好,周期前不存在的 native 品类归初创。Mignano 则拿亲历作证——他深度参与的 Granola 被 OpenAI 出了直接竞品、Notion 也出了,威胁真实,但:

"we can say that we live in a world where the labs and the hyperscalers can Take over any product in any market, but the reality is that's been the story of technology and innovation since the beginning of time. There are always going to be startups and founders and entrepreneurs that specialize and do the really hard things before anyone else has thought of them that end up prevailing. … So I hear you that the labs can kind of go into any application layer, but not only do I think that that's not true, I also just think it's not really fun."
「所以我们可以说我们生活在一个实验室和超大规模企业可以在任何市场的任何产品上接管的世界,但实际上,这种情况自古以来就是技术和创新的故事。总会有初创公司、创始人和企业家专注于在其他人想到之前做非常艰难的事情,最终胜出。……所以我听到你说实验室可以进入任何应用层,但我不仅认为这不是真的,我还认为这并不是很有趣。」
Mike Mignano · 20VC: Mike Mignano, USV

他的算术:赢家通常只拿约 30% 市场,剩下 70% 任人争夺;他的护城河:组织内沉淀的 context 不可弃,这个时代拼抢先与速度;Abridge 在医疗监管上磨了近十年,监管审批本身就是对抗实验室下场的护城河。Harry Stebbings 现场提供两条佐证:Anthropic 组整队打 Figma,Figma 照样数十亿收入、赛道多玩家(实验室下场并非二元生死局);他甚至骂 Anthropic 公开进军 legal 是"追逐 AGI 却去抢律所午餐"的愚蠢决定。Tuhin 同样否定"Claude 做设计吃掉 Figma"式叙事——灭绝时刻属于不往工作流里植入智能的存量软件公司,不属于 AI 原生应用。最后一条证词把 D 战场搅成共生关系:Weinberg 说 OpenAI 作为 Harvey 的投资人反而要他路由到最好的模型,协议里没有绑定条款(Opus 4.5 发布后流量显著转向),应用层的反馈本身对实验室有价值。

策展人裁定:D 战场的表面分歧(会不会来)小于实质分歧(来了致不致命)。把 Weinberg 和 Anish 拼起来读,两件事同时为真:实验室不会为你的垂直做有主见的 UI(Anish),但它的水平产品每改进一次,你的 Delta 就被抹掉一截(Weinberg)。所以可操作的约束不是"OpenAI 会不会做我的产品",而是"裸 ChatGPT 的下一个版本会不会顺手做到我的 80%"。被吞名单(共识第四点)的死因全部符合后者、无一符合前者——这是本综述最想钉住的一根钉子。

附带战场 E · 同一条斜率,四种读法

A 到 D 的所有立场都建立在"你能读对斜率"上,但语料对斜率本身怎么读存在真分歧。Weinberg 主张分段读——不同用例在不同曲线上:

"I think that we're seeing a plateau in performance for consumer use cases. … You don't need better reasoning to solve these problems. What you need is different context. … On the enterprise, I think things are going to keep going, especially CodeGen. I think we are not going to see a plateau in CodeGen. I think that is going to get much better really, really fast."
「我认为我们看到了消费用例的性能达到了一个瓶颈。……你不需要更好的推理能力来解决这些问题。你需要的是不同的上下文。……在企业方面,我认为情况会继续发展,尤其是 CodeGen。我认为我们不会看到 CodeGen 出现瓶颈。我认为它会变得越来越好,而且会非常快。」

Ping Wu 却否定可预测性本身——与互联网/移动浪潮不同,AI 的底层持续产出零到一的非线性惊喜:

"But for AI, I feel there's so many surprises as the underlying model gets better. There are things that even the authors for transformer paper will not have imagined some of the capability that just came after the large language models. And that continues to surprise us. So I do think that, you know, a lot of the improvements is nonlinear. It's really from zero to one continuous happening at the bottom layer."
「但对于 AI 来说,我感觉随着底层模型的改进,会有很多惊喜。即使是 transformer 论文的作者,也无法想象大型语言模型出现后的一些能力。这件事不断给我们带来惊喜。所以我确实认为,很多改进是非线性的。实际上是从零到一的持续发生,在底层不断发生。」

Foody 提醒别把 benchmark 斜率错当端到端替代斜率——两者之间隔着多年的评估与工具使用构建期,这正是应用层不被立刻吞掉的缓冲带:

"But the truth of the matter is like there is a lot between being really good at SweetBench and like replacing software engineering. … We're going to need a lot of evals for agents. And that build out is not is going to be a lot longer than, you know, a couple year time horizon."
「但事实是,在擅长 SweetBench 和取代软件工程之间,还有很长的路要走。……我们将需要大量的智能体评估。而且这项构建工作将比,你知道的,几年时间要长得多。」

("SweetBench" 为 SWE-bench 转写瑕疵;能力悬垂的另一面是他说的"考试满分却干不了基本助理活"——那正是应用层的产品空间。)最被低估的一条来自 Weinberg,它同时削弱 A 的紧迫感与 D 的恐惧——capability overhang 大到下注根本不必依赖下一代模型:

"The other thing that I feel like folks don't realize is everything could pause. Like both of those companies could stop developing things right now. And the amount of saturation of AI that would just happen to the economy would still skyrocket. We're so far from just the ability of the models right now being integrated into daily life. People do not know how to use these systems. … And so I think if both companies literally just stopped shipping things, their revenues would still explode because there are going to be so many companies building on top of their models."
「我觉得人们没有意识到的另一件事是,一切都可能暂停。就像这两家公司现在都可以停止开发任何东西。而人工智能对经济的渗透程度仍然会飙升。距离目前这些模型的能力被整合到日常生活中还差得很远。人们不知道如何使用这些系统。……所以我认为,如果这两家公司真的停止出货,它们的收入仍然会爆炸式增长,因为会有很多公司在它们模型的基础上构建应用。」

Mignano 的数字与之呼应:企业 80% 的非编码任务用非前沿模型即可完成。注意 Weinberg 一人横跨 E 的两端——他既是"CodeGen 只会更陡"的顺斜率读者,又是"一切暂停也无妨"的 overhang 论者;这不矛盾:前者关于威胁(Delta 被抹平的速度),后者关于机会(已发生进步的消化期还长)。如果 overhang 为真,"assume models get better" 甚至不需要模型继续变强也成立——应用层此刻吃的是已发生进步的消化红利。

都没说透的

1. Delta 的动力学没人量化。 Weinberg 要求"与企业 GPT license 保持巨大 Delta",Anish 说下游产品化+提价的速度跑赢成本上升——前者暗示应用价值被模型改进持续侵蚀,后者说被持续放大。两个判断方向相反,却从未正面相撞。crux 是:模型每改进一档,红利在实验室与应用层之间按什么变量分成?语料里连候选变量都没人列。 2. "模型变好测试"的幸存者偏差没被处理。 Foody 的 AI 面试官是事后被推理模型救活的样本;同期同样押"下一代解锁"而死掉的公司没有名单。事前区分顺风侧/绞索侧的方法,语料里只有半个(需求弹性测试)——而 Mercor 起家的众包业务当年大概也自认在顺风侧。测试在事后叙事里百发百中,在事前的命中率无人报告。 3. Decagon 悖论没人点破。 同一家公司 90% 工作流在微调开源小模型上(离开斜率),旗舰功能靠前沿推理模型解锁(骑上斜率)。这暗示 A/B 之争是 feature 级而非公司级的——"选品"应该拆成"选组合":哪些能力线永久外包给实验室、哪些内化成自有模型、哪些等下一代。但全部语料都在公司级辩论,没人给出组合的划分原则。 4. 鸿沟护城河的半衰期,只有 Ashwin 敢标注失效条件。 共识第三点(模型-生产距离)是全场最厚的安全垫,但它是消耗品:

"I think in the short term, actually, it is the ability to work with enterprise resources. And what I mean by this is that the capability of models today is far greater than they are being used for within the enterprise. … There's a lot of Just infrastructure and software that you need to build around these models to make them deployable within an enterprise, to make them work with all the legacy systems that these companies have. And so I think for the next few years, that's probably going to be the primary thing that these models need to be able to work. Now, once that gets commoditized because the agents can build that on the fly, that I don't know in three years from now."
「我认为在短期内,实际上是与企业资源合作的能力。我所说的是,目前模型的能力远远超过它们在企业中的实际应用。……为了使这些模型可以在企业内部署,使它们能够与这些公司拥有的所有遗留系统协同工作,你需要构建大量的基础设施和软件。所以我认为在接下来的几年里,这可能是这些模型需要能够运行的主要条件。现在,一旦这变得商品化,因为代理可以动态构建,我不知道三年后会是什么样子。」
Ashwin Sreenivas · Decagon's Playbook (a16z)

这条诚实没有被任何人接住:如果 agent 能动态搭建集成/部署层,Ping Wu 的"8-10 个无 API 老系统"、Jesse 的"整套框架"、Weinberg 的企业级基建同时开始折旧。Foody 的对冲(若模型真强到那步,经济里其他人类环节同样不保)是姿态不是回答——"大家一起死"不构成不测算半衰期的理由。 5. 实验室意图作为约束,信息上不可操作。 Weinberg 每天猜实验室 roadmap,但创业者没有验证渠道;OpenAI 同时是 Harvey 的投资人和 Granola 的直接竞争者——同一实验室对不同应用公司的行为完全不一致。"实验室会不会做 X"作为选品输入,方差大到近乎抛硬币;语料里唯一的降方差启发式是 Anish 的 feature-surface/weird 判据,但它自己也没有反例检验(Grok 已经在做实验室"不自在"的品类)。 6. 多模型护城河与 harness 飞轮互斥,没人调停。 Anish 说应用公司的结构性价值是聚合多家模型(实验室永远只给自家模型);Mignano 说最顺斜率的产品形态是与单一模型紧耦合的 harness 飞轮。一个要松耦合、一个要紧耦合,两者不能同时最大化——这是 A 阵营内部没打起来的架。

我的看法

判断一(把握度:中高):标题问题"假设模型变强还能让你更强吗"的正确回答方式不是站队,而是三个可独立打分的测试——(1) 需求侧弹性:模型抬升生产力时你的品类需求是否弹性扩张(软件 100-1000 倍 vs 会计固定,Foody);(2) 编码位置:你的差异化编码在模型能力里(会被下一代覆写)还是模型外的信号/工作流/业务逻辑里(Tuhin 判据,全场最干净的一句话);(3) 租期置换:你依赖的"模型-生产鸿沟"是租来的护城河,问题只是租期内能否置换成产权资产——组织内 context、专有数据、后训练出的自有模型。三项全过,模型变强让你更强;过两项,你在跟折旧赛跑;过一项以下,你就是 wrapper 这个词的定义本身。支撑最强的是三项测试各有多源独立证词;最弱处是第 3 项的"租期"没人敢报数(Ashwin 的"三年后我不知道"是唯一的诚实标注)。

判断二(把握度:中)实验室意图作为选品约束被系统性高估。语料里实验室真下场的案例(Granola、Figma)都没有出现处决;被吞名单上的死者(AI PPT、执行型产品、众包标注、给将消失职位的 copilot)死因全是模型水平进步顺手覆盖,无一是实验室定向进攻。所以选品时该问的不是"OpenAI 会不会做这个",而是"裸旗舰产品的下一个版本会不会顺手做到我的 80%"——把揣测实验室 roadmap 的精力,换成持续测量自己与裸模型产品的盲测 Delta。把握度只有中:豁免论证据全是幸存者(有先发沉淀的公司),且若实验室开始用 API 流量数据系统性定向选品(Patrick Chase 说的向上移动堆栈从机会主义变成流程),豁免区会快速收窄。

判断三(把握度:中高)C 阵营(合流)是方向上最可能的终局,但常被时间性误读。"应用公司变成垂直实验室"不是与 A/B 并列的第三选项,而是 A→B 的时序通道:先骑前沿模型证明有值得优化的东西,再用后训练把"什么算好"的定义叛逃进自有模型(Tuhin 两段论)。供给侧数据说明这不是愿景而是进行时——Baseten 95% token 跑定制模型、Decagon 90% 工作流在微调开源小模型。真正的开放变量是 RFT 类技术把养自有模型的门槛降到多低、多快(当前数百到数千条样本),这决定合流是头部特权还是普遍路径。若为普遍路径,本主题五年后的标题会反过来:不是"应用层如何对抗地基模型",而是"地基模型如何对抗一万个垂直实验室"。

还想知道什么

取材

10 篇 CORE:

擦边未纳入(评级非 CORE,正文不取引用):