推理经济学 · Inference Economics
主题综述
更新日志
- 2026-08-24 — 新增 10 篇入册、引用 5 篇(Eric Vishria / Fireworks 后训练课 / Engram Jack Morris / vLLM Simon Mo 补引 / Stripe)。本轮有两处真正的改写、一处补漏。 (1) 阵营 A 第一次拿到硬数字,方向还是反的。 我上两轮持续下调“软件层护城河”(Modal 开源 DFlash、Baseten 自陈量化/speculator 总会有开源版),而 Benchmark 的 Eric Vishria 从投资端给出一个此前语料完全缺的量:同一个开源模型、同一批 NVIDIA 硬件,Fireworks 与通用云的速度差约 5x,吞吐差还是“多倍”。这不是护城河的叙事,是护城河的读数——而且它恰好落在“可复制的那部分被开源掉、跑得快的那部分是运营”这条缝上。阵营 A 相应改写,「都没说透的」第一条从“没有一方拿出数字”降级为“有了性能数字、仍缺留存数字”。(2) 阵营 H 被它自己的人复杂化了。 Engram 上两轮的卖点是“把成本从 inference 挪回 training、省两个数量级 token”;本轮同公司的 Jack Morris 直接承认这条路会撞上一堵合成数据墙——从私有数据造合成数据再训练,最终会把合成数据学完、曲线走平。于是他把整件事重述成另一个问题:“同样的数据,怎么塞进更多算力”。这是一次立场的实质位移:阵营 H 从“省推理成本”变成“把推理算力换个地方花”,它不再是 Jevons 的解药,而是 Jevons 的又一个出口。阵营 H 已按此改写。(3) 阵营 K 长出了自己的解药,也长出了新的可疑之处。 Lin Qiao 上轮抛出“scaling into bankruptcy”,本轮她给了药方并标了价:后训练把推理成本降 5–10 倍,等价于“同样预算撑 5–10 倍流量”,口号是 “own your own intelligence, not rent”。要注意这是卖后训练的人给出的降本倍数,且与阵营 A 的 5x、Baseten 的 2–4x 是互不重叠的三条降本路径,语料里没人把它们叠在一起算过总账。另有两处补强:Vishria 用云市场的 40-30-20 + CloudFlare 给阵营 D 的“中间层会死”提了一个寡头式反例(多个千亿美元赢家,而非零和);Stripe 给主流共识第三点补了一个带斜率的 Jevons 读数——Minions 从年初的每周 1,200 个 PR 涨到近期每周 7,000 个、占全公司 PR 约 30%,且明说不是为了砍成本结构。补漏:上一轮 changelog 声称引用了 vLLM Simon Mo 那一集(
3b8ea6…4095),但正文实际零引用——本轮已在阵营 F 补上引文,并把“审核/guardrail 误伤把企业推向开放权重”这条动因写进去。 - 2026-08-10 — 新增 14 篇入册,引用 5 篇(Fireworks Lin Qiao / Baseten 推理工程 Masterclass / vLLM-InferAct Simon Mo / Anthropic PM Dianne Penn / xAI Igor Babushkin)。本轮有一处真正的改写。 「都没说透的」里挂了两轮的那条——"降的是同等质量单价,还是被上涨的 per-task token 量吃掉了"——Lin Qiao 第一次正面给了框架:"not all tokens are equal",并把优化拆成两层(少用 token / 每 token 更值钱),该 bullet 已相应改写而不再是纯缺口。另有三处补强:一是 Lin Qiao 的 10x 降价 → 100x 用量给了主流共识第一点一个可证伪的三年期数字,并把成本地板从 Clay Bavor 的"能源与 GPU"进一步下钻到"晶体管/供应链",阵营 J 因此更硬;二是 Baseten 的 Philip Kiely + Ali Taha 第一次把"2–4x 优化"拆成可复现的乘法栈(量化 ~1.7x × speculator ~2x × disagg),同时指出这些环节几乎都有开源 checkpoint 可白拿——这是阵营 A 软件护城河被自我掏空的第二个独立证据(第一个是上轮 Modal 开源 DFlash);三是新增阵营 K「扩张到破产」——Lin Qiao 把"PMF ≠ durable business"讲成推理经济学在买方侧的硬约束,这是此前语料里缺的一条:不是中间层会不会死,而是客户会不会先被自己的成功撑死。Jevons 那条则拿到一个新的文化侧证词(Garry Tan 的"年花 10 万美元 token = 提前活在 2028 年"),但仍无账单弹性数据,缺口不变。
- 2026-07-27 — 新增 6 篇(20VC Open vs Frontier / Modal CTO Akshat Bubna / Accel / 20VC App Layer Glean / Lab of the Future / AI Memory Dan Biderman)。本轮几乎全部落在强化已有判断、而非改写。 Jevons(主流共识第三点)一次拿到三份独立的一线账单证词:Glean 的 Arvind Jain「年度 AI 预算一两个月就超支」、Accel「7 倍公司被 CFO 叫去『let it rip』、看涨每月 5 亿美元 token 花销」、Sierra 的 Clay Bavor「顶尖工程师年烧 $100k token、占工程师薪资将从 3.8% 涨到 20%」。模型路由 / quality-per-dollar(第四点)被 Glean(把「挑便宜模型」直接做成核心卖点:cost control)和 Sierra(按任务混搭模型)再顶一层,独立信源已到七八个。真正复杂化的有两处:一是 Clay Bavor + Accel 给出对「价格趋近计算成本」终局的最强反驳——对前沿智能的需求无上限、成本地板是能源与算力(新增阵营 J);二是 Modal 把自家推理性能优势(DFlash)开源上游,亲手削平了阵营 A 押注的「软件层护城河」。AI Memory 的 Dan Biderman 用 KV cache 80GB 的系统级数字补强了阵营 H。Lab of the Future(Lila Science)与本主题关系很弱,未引用。
- 2026-07-16 — 引用忠实度修复(全站审计):9 处——重引逐字 2 条(Noam Brown、Dan Biderman)、更正归属 2 条("zero marginal cost" 系 Anish Acharya 非 Josh Elman;Opus 4.7 比价观察系 Gabe Pereyra 非 Ev Randle)、其余 5 条经逐字稿复核确认已符合原话。二次修复补记:1 处(重引 1 · 降级转述 0)——阵营 H(Engram)四行对话补回被略去的 Shaun Maguire 原话("Sonya works at Fireworks. She really loves it."),消除未标注的内部剪辑。
- 2026-07-06 — 新增 8 篇(Harvey/Gabe Pereyra、Benchmark AI Bets、Mark Chen、Kevin Weil、Engram、Josh Elman、Self-Driving Lab、Noam Brown)。材料上确有实质改变:Harvey 和 Benchmark 把"模型路由 / quality-per-dollar"从边缘话题抬成新的一条主流共识(见「主流共识」新增第四点),并给出了此前语料缺的具体账单数字(单次 query $20、单次审查 $20,000、"$10M 账单");Benchmark 的"高毛利=红旗""distillation 让开源逼近 95%"直接补强了 McGrew 的"价格=计算成本"终局(阵营 D)与 Stephanie 的"开源/闭源 gap 决定推理供应商命运"(阵营 B);Engram 提出"把成本从 inference 挪到 training"的第三条路,Noam Brown 的 test-time compute 则把"推理成本"本身变成一个随预算滑动的变量——两者一起复杂化了「都没说透的」里对 Jevons 的讨论。Mark Chen(Cooking with OpenAI)与 Self-Driving Lab 两集与本主题关系很弱,未引用。
- 2026-06-11 — 取材升级为逐字稿全文。把 podwise 摘要层的三手转述换成原话:Tri Dao 的"也许 100 倍?"、"工作负载向 Transformer/MoE 收敛、给芯片对手开门"、Tuhin 的 Jevons 都换成逐字。Redpoint、Stephanie、McGrew 几集是英文原音、podwise 仅存中文译文,无英文可逐字引用,故改为转述(McGrew 的"律师不再稀缺"比喻保留为转述要点)。
- 2026-05-20 — 首次综述。基于 9 篇访谈(Baseten Tuhin Srivastava、Together.AI Tri Dao、Fal.ai、vLLM/Inferact、Nvidia Brev/Dynamo、Bob McGrew、Redpoint、Stephanie Palazzolo、a16z Nathan Labenz)。
主流共识
第一点:推理成本在以每年约一个数量级的速度下降,这个量级几乎没有反对。
"In the last couple years inference cost has probably come down, maybe 100x …"「过去这几年,推理成本大概降了,也许 100 倍……」Tri Dao · Ep 74: Chief Scientist of Together.AI
本轮 Sierra 的 Clay Bavor 给了这条最具冲击力的一个具体倍数——他用 GPT-4 级别智能作锚点,量出了"等质量 token 单价"的塌陷幅度:
"It's now 1,300th the cost for an intelligence equivalent token."「现在智能等价令牌的成本降低到了 1,300 分之一。」
Redpoint 的投资人也给了同量级的判断(英文原音、podwise 仅存中文,故转述):LLM 的推理和训练成本每年下降约 10 倍,直接改善了在其上构建的应用公司的利润结构。
本轮 Fireworks 的 Lin Qiao 给了这条共识第一个带期限、可证伪的版本——而且她把降价和用量绑成一个连体判断:
"So overall, I can imagine 10x cost reduction in the next three years. And this 10x cost reduction will drive 100x usage."「所以总体来说,我可以想象在接下来的三年内,成本将减少十倍。而这种十倍的成本降低将推动一百倍的使用量。」Lin Qiao · 20VC: Are OpenAI and Anthropic Overvalued?
她给的近端数字更激进——明年底 token 总量"20 到 100 倍",理由是"我们现在处于 S 曲线爆发的非常早期阶段"。
而 Baseten 的 Philip Kiely 和 Ali Taha 本轮第一次把"降本 2–4x"这个一直以口号形式流传的数字,拆成了一个可复现的乘法栈——这是全语料里对"成本怎么降下来的"最具体的一次交代:
"It's like, I think it's about like 30 to 40% from 16 to 8, and then another 30 to 40% multiplied from 8 to 4. So that doesn't quite get you a 2x, but like, roughly a 2x. Speculator, roughly a 2x. DISAG on top of that, if you're able to get enough hardware and put enough traffic through it, another roughly a 2x."「我认为从 16 到 8 大约是 30% 到 40%,再乘以 8 到 4 的另一个 30% 到 40%。所以这并不能完全让你达到 2 倍,但差不多就是 2 倍。投机者,差不多 2 倍。如果你能获得足够的硬件并让足够的流量通过,再增加一个大约 2 倍。」Ali Taha · The Inference Engineering Masterclass
Philip Kiely 顺手给了一个衡量"这个领域还有多少肉"的行业级标尺——用金融量化研究做参照:
"if you look at highly optimized domains like, say, finance, if you're in finance, you measure how much better you got in basis points. It's like, oh, I got five basis points better, like 1 20th of 1% better. That's huge news because everything is so optimized. When we publish optimizations, it's 20%, it's 100%, it's 200%. So there's still probably like a lot further to go, honestly. Like, you'll know that influence is pretty much solved when researchers start publishing about how they got 1% faster at something."「如果你观察像金融这样高度优化的领域……你会用基点来衡量你的进步有多大。就像,我得到了五个基点的改善,也就是 1/20 的 1% 更好。这可是个大消息,因为一切都已如此优化。当我们发布优化时,都是 20%、100%、200%。所以,老实说,可能还有很多潜力可以挖掘。当研究人员开始发布他们如何在某件事情上提速 1% 时,你就知道影响差不多解决了。」Philip Kiely · The Inference Engineering Masterclass
第二点:推理负载本身在变质——从静态、同尺寸的请求变成 dynamic、agentic、长上下文,对调度和内存提出全新的问题。
"What if the hardest problem in artificial intelligence isn't training smarter models, but simply keeping them running?"「如果说人工智能领域最难的问题不是训练更聪明的模型,而是简单地保持它们的运行呢?」Matt Bornstein(a16z,主持人开场旁白,非嘉宾原话) · Inferact: Building the Infrastructure That Runs Modern AI
本轮 Modal 的 Akshat Bubna 从供应商一线证实了这条:他们最大的用例已经是 elastic inference,流量是 diurnal、突发的,"从零到一"扩容让位给"一小时内从 1000 张 GPU 弹到 1500 张"——这正是负载变质带来的新调度问题。AI Memory 的 Dan Biderman 则从内存端给了一个骇人的量级:长上下文推理的 KV cache 消耗大到与整个模型权重同数量级(见阵营 H)。
第三点:Jevons paradox 在生效——成本降低没有压缩总开支,而是把开发者引向更复杂、更耗 compute 的 agentic workflows。Harvey 的 Gabe Pereyra 给了这条最直白的一线证词——agentic 转向把单位账单直接拉到了荒谬量级:
"We have simple like assistant type queries where you say, you know, draft me a document that a single query can cost $20. We have like a review product where you can upload 100,000 contracts and ask the models to review them. And some of those can cost $20,000. And so it is just getting incredibly expensive."「我们有一些简单的助手类型查询,比如说,给我起草一份文件,而单个查询可以花费 20 美元。我们还有一个审查产品,你可以上传 100,000 份合同并要求模型进行审查。其中一些可能会花费 20,000 美元。所以这变得非常昂贵。」Gabe Pereyra · Harvey Co-Founder on the Token Pricing Reckoning
本轮这条 Jevons 一次拿到三份互不相干的一线账单证词。Glean 的 Arvind Jain(企业买方视角)——预算根本关不住:
"given that AI has become so expensive, we hear stories all the time about companies coming up with a annual budget for AI and they run past that within a month or two."「考虑到 AI 变得如此昂贵,我们经常听到公司制定 AI 的年度预算,并且在一个月或两个月内就超支。」Arvind Jain · 20VC: Why OpenAI and Anthropic Won't Win the App Layer
Accel 增长团队(投资人视角)——他们做了一份 CFO 调查,结论是"花更多"压倒性地打赢"省一点",而且看涨到荒谬量级(逐字稿仅把说话人标为 Speaker,故归属为团队):
"we did this survey of developers and we asked them how many of them had a CFO who was telling them to spend less on consumption versus more. And we actually found that seven times more companies are being told to like let it rip and spend more."「我们对开发者进行了一项调查,询问他们中有多少人有 CFO 告诉他们在消费上要减少开支,而不是增加。我们实际上发现,七倍的公司被告知要尽情花费,增加开支。」
Sierra 的 Clay Bavor(企业内部视角)——把这条 Jevons 落成一个可验证的比率预测:token 支出正在从工程师薪资的零头,涨向一大块:
"top engineers who are really leaning in to Claude Code, Codex, and so on, are spending more than $100,000 on a run rate basis on tokens per year. That's a meaningful fraction of an engineering salary."「那些真正投入 Claude Code、Codex 等的顶尖工程师,年均在代币上的支出超过 100,000 美元。这在工程师薪水中是一个相当可观的比例。」
"I would not bet on 3.8%. I would bet on much closer to 20%."「我不会押注于 3.8%。我会赌更接近 20%。」
本轮这条 Jevons 多了一个文化侧的证词——它把"多花 token"从成本问题重述成了一种套利。Lenny 转述 YC 的 Garry Tan:
"If you're willing to spend $100,000 a year right now on tokens, you're living the way somebody in 2028 is going to live. Because by then, it'll be really cheap. Everyone can work this way. But there's this alpha opportunity right now to just live in the future, go crazy on token spend."「如果你愿意现在每年花 10 万美元在代币上,你就生活在 2028 年某人的生活方式。因为到那时,代币会变得非常便宜。每个人都可以这样工作。但是现在有一个 alpha 机会,可以生活在未来,疯狂地花费代币。」Lenny Rachitsky(转述 Garry Tan) · Anthropic's first technical PM on token maxing
Anthropic 的 Dianne Penn 没有接这个框架,而是把它翻转了一次——token 花销是输入不是目标,值得盯的产出是实验次数:
"It's almost like token spin is more the input. And really, the output is what you described of experimentation. And I think if we were orienting, like goals around experimentation, I feel like that, that might be the better framing of the outcomes."「这几乎是代币支出更多是输入。而实际输出就是你所描述的实验。我觉得如果我们围绕实验设定目标,我觉得那可能是结果的更好框架。」Dianne Penn · Anthropic's first technical PM on token maxing
这是语料里第一次有人对"token maxing"这个口号做出限定——而且说话的人来自卖 token 的那一方。
2026-08 新增:Stripe 给这条 Jevons 补了一个带斜率的读数——而且明说不是为了省钱。 大多数 Jevons 证词是"预算超了""让它跑",Stripe 的 CTO 给的是同一指标在半年里的两个点:
"we blogged about minions, I think in January, February, and they were doing 1,200, you know, PRs per week. And last week, I think 7,000 PRs came from minions. Wow. Yeah. And about 30% of our PRs in that week came from minions."「我们在一月和二月左右写了关于 Minions 的博客,他们每周做 1200 个 PR。而上周,我想说有 7000 个 PR 来自 Minions。哇。是啊。在那一周,大约 30% 的 PR 来自小黄人。」(中文行把 Minions 译作"小黄人",照录)Will Gaybrick(Stripe,Minions 内部编码 agent)· Stripe’s AI Strategy: Build More, Not Less
半年约 6 倍的 agent 产出增长,落到全公司 PR 的 30%。更要紧的是他们把用途讲反了——不是拿效率去砍成本结构:
"Companies have skewed in that direction where they've seen This new agentic efficiency and power as a way to optimize cost structure. Our belief, I'm being a little cheeky, but build everything."「各公司都朝这个方向倾斜,把这种新的 agentic 效率与能力当成优化成本结构的手段。我们的信念——我说得有点调皮——是:把一切都造出来。」(中文为本文迻译)Will Gaybrick(Stripe)· Stripe’s AI Strategy: Build More, Not Less
这是本主题里第一份把 Jevons 的两端都摆出来的一线读数:投入侧(agent 产出 6 倍)与用途侧(明确不换成裁员,而是换成更多产品)。它离"账单弹性曲线"仍差一步——PR 数不是 token 数,30% 也不是钱——但比此前所有"CFO 让我们尽情花"的调查口径都硬。
第四点:"哪个模型最好"正在让位于"哪个模型能用最低价格解决这个任务"——模型路由 / quality-per-dollar 成了新的一层经济学。 这条以前只是 Baseten 论点的一个侧面,本轮已被 Harvey、Benchmark、Kevin Weil、Josh Elman、Glean、Sierra 从企业、投资、研究、消费多个互不相干的位置独立顶成共识。Gabe Pereyra 把它讲成一个从"能力受限"到"成本受限"的相变:
"Up until recently, we've always been capability constrained. And so we always wanted to use the largest model … But that has changed in the past six months where now we are consuming like a huge number of tokens."「直到最近,我们一直受到能力的限制。所以我们总是希望使用最大的模型……但在过去六个月中,这种情况发生了变化,现在我们正在消耗大量的令牌。」Gabe Pereyra · Harvey Co-Founder on the Token Pricing Reckoning
"Increasingly, it's not just which model is the best; it's which model can solve the task at the lowest price point."「越来越多的人关心的不是哪种模型最好,而是哪个模型能以最低的价格解决任务。」Gabe Pereyra · Harvey Co-Founder on the Token Pricing Reckoning
本轮 Glean 的 Arvind Jain 把这条从"工程实践"抬成"商业模式"——路由本身就是他们卖给企业的核心价值(cost control):
"90% or greater of use cases can now be fully handled by many, many different models, including open source models. So there is definitely commoditization from that perspective. In fact, like, you know, we at Lean, that's actually one of our core value adds to our customers, you know, which is cost control. … we actually pick the right model for you. And if you're okay with using open source models, we'll use them, you know, when we think it's appropriate, when it's going to generate a high quality answer."「90% 或更高的用例现在可以通过许多不同的模型,包括开源模型,完全处理。因此,从这个角度来看,显然是商品化。实际上,像你知道,我们在 Lean,这实际上是我们为客户提供的核心价值之一,你知道,成本控制。……我们实际上会为你选择合适的模型。如果你愿意使用开源模型,我们会在认为合适的时候使用它们,以生成高质量的答案。」Arvind Jain · 20VC: Why OpenAI and Anthropic Won't Win the App Layer
Benchmark 的 Ev Randle 从投资人视角给了同一件事的镜像——他甚至把"高毛利"重新定义成了 AI 时代的红旗,因为它意味着没人真在用你的 AI:
"AI inference costs a lot of money. And if you have an AI product with high gross margins, that means that no one's using your AI features."「AI 推理成本很高。如果你有一个毛利率高的 AI 产品,这意味着没有人在使用你的 AI 功能。」Ev Randle · Benchmark's AI Bets
OpenAI 的 Kevin Weil 则点出了这层经济学的根源——推理不像传统软件那样边际成本趋零,它每次调用都真金白银地烧钱,这既是 B2B 先起飞的原因,也是路由必须存在的原因:
"Models also cost money to use. In a relative sense, much more than like traditional, you know, get a database and pay network costs and stuff like that. You start having costs right away as a business …"「使用模型也需要花费。在相对意义上,比传统的……获取数据库和支付网络费用要贵得多。作为一家公司,你一开始就会产生成本……」Kevin Weil · AI Is Crossing the Frontier of Human Knowledge
本轮 Lin Qiao 把这条共识从"挑模型"推进到"挑 token"——她指出比较单价本身就是个错误的比法,因为不同模型解同一个任务要吐的 token 数差好几倍:
"Not all tokens are equal. I think we should establish a best practice to evaluate the token economy per task, because different models have different ways of spitting out tokens. Some are much more verbose than the other. So you can imagine one model is 2x cheaper than the other, but it's 2x more verbose to solve the same task. And then they're the same cost."「并不是所有的代币都是平等的。我认为我们应该建立一种最佳实践,以评估每个任务的代币经济,因为不同的模型有不同的发放代币的方式。有些代币的发放比其他的要冗长得多。所以你可以想象一个模型的成本是另一个的一半,但它解决同一任务的代币数量是另一个的两倍。然后它们的成本就一样了。」Lin Qiao · 20VC: Are OpenAI and Anthropic Overvalued?
她据此把优化拆成两个互不重叠的层次——"解一个任务少用 token"和"每个 token 更值钱"——第三层才是基础设施(GPU、内存、供应链)。这是本主题追问了两轮的那条缺口("降的是单价还是被 per-task token 量吃掉了")第一次拿到框架性的回答。
分歧在哪
阵营 A · "软件层是护城河"——Baseten / Modal 的立场
Tuhin Srivastava (Baseten) 把推理拆成两层并明确押注上层:
"GPUs as a service is not sticky. … Inference with the software layer included is incredibly sticky."「GPU 即服务并不具备粘性。……包含软件层的推理则具有极强的粘性。」Tuhin Srivastava · Baseten CEO on the AI Inference Crunch
"what is valuable to a company is the user signal that they can gather, that only they can gather. And to the extent that that is encoded In a model, I think a lot of their business will be at risk, but to the extent that it is encoded in workflows, that is where they will be able to develop modes."「我认为对于企业来说,唯一有价值的是他们能收集到的独家用户信号。如果这些信号只编码在模型里,我认为他们的业务将面临很大风险;但如果信号编码在工作流中,他们就能建立起护城河。」Tuhin Srivastava · Baseten CEO on the AI Inference Crunch
本轮 Modal 的 Akshat Bubna 是这条"软件层赢"最新、最具体的一票——他明确说,能不能找到 GPU、能不能跑模型早已不是差异点,弹性、真·scale-to-zero、跨 17 家云的可靠性层才是:
"with these endpoints, we are way more elastic, as you said, than anyone else. And you have true scaling to zero. You have true burstiness. And in practice, that matters a lot more to people than just finding the GPU and running model code."「正如你所说,通过这些端点,我们比其他任何人都更加灵活。你可以实现真实的缩放到零。你可以实现真正的突发性。在实践中,这对人们来说比仅仅找到 GPU 并运行模型代码更重要得多。」Akshat Bubna · Why AI Infrastructure Must Evolve for Agent Experience
但 Modal 同时给阵营 A 埋了一颗自爆弹:他们把自己的推理性能优势(block-based speculator DFlash,带来 2–4x 加速)直接开源、上游进 SGLang——等于亲手把"软件层护城河"里最硬的那块技术抹平:
"by using open source DFlash, you can get the same performance as you would with one of the proprietary providers."「通过使用开源的 DFlash,你可以获得与任何一个专有提供者相同的性能。」Akshat Bubna · Why AI Infrastructure Must Evolve for Agent Experience
也就是说,阵营 A 里 Baseten 押的"软件粘性"和 Modal 押的"弹性/可靠性"是同一类论点,但 Modal 恰恰在证明:软件层里可被量化复制的那部分(kernel、speculator)正在被从业者自己开源掉,长期能守住的只剩下不可复制的运营(多云容量、调度、可靠性)。这条内部张力此前语料里没有。
本轮 Baseten 自己的工程师给了同一条自爆弹的第二个独立证据。 当被问到"一个普通人拿到一台 B200 想自己托管,要做多少功课"时,Ali Taha 的回答等于承认那条乘法栈里的每一环都能白拿:
"You don't need to quantize the model yourself. There's always going to be like an open source quantized checkpoint. NVIDIA is going to push one out if no one else does. Usually the providers will have their own spec deck that they've trained as well. You don't need to train your own spec deck. You can just use that as well."「你不需要自己量化模型。总会有一个开源的量化 checkpoint。如果没人发,NVIDIA 会发一个。通常供应商也会有他们自己训练好的 spec deck。你不需要训练自己的 spec deck,直接用就行。」Ali Taha · The Inference Engineering Masterclass
那护城河还剩什么?按他们自己的叙述,剩下的是运营与形态——disagg 部署第一次跑通"非常困难"、speculator 要和主模型抢同一块卡的编排问题、以及 Philip Kiely 提到的用量形态迁移(试用期按 token 付费,粘住之后转 dedicated 按小时租):
"if you're pushing like millions of tokens per hour, if you just pay per hour instead of pay per token."「如果你每小时推送数百万个令牌,按小时收费会更便宜,而不是按令牌收费。」Ali Taha · The Inference Engineering Masterclass
值得记的是,这条"重度用户会从按 token 迁到按小时"如果成立,那么整个语料里以"token 单价"为坐标的争论,对最大的那批客户其实已经不适用了——他们买的是产能,不是 token。
2026-08 新增:阵营 A 终于有了一个可读的数字——而且是从阵营外递过来的。 我在前两轮持续下调这条护城河(Modal 把 DFlash 开源、Baseten 工程师自陈量化与 speculator 迟早都有开源版本)。Benchmark 的 Eric Vishria 从投资端给出的读数把这个下调按住了一半:变量控制得很干净——同一个开源模型、同一批 NVIDIA 硬件,差别只剩“谁在跑”:
"The performance difference for a Fireworks versus a cloud provider is like 5x. And that is just the speed performance."「Fireworks 与云供应商之间的性能差异大约是 5 倍。而这仅仅是速度性能。」
他随即点出更难被外部看到的那一半——吞吐差异只有懂这门生意的经济结构的人才看得见:
"Then you add on top of that throughput, which is not visible externally, only visible if you know the economics of these businesses. And you're like, wait a minute, this is the same open source model with the same NVIDIA hardware. And there's a 5x performance difference and a multiple x throughput difference."「然后你在此基础上加上吞吐量,这在外部是看不见的,只有当你了解这些业务的经济结构时才能看到。你会想,等一下,这是同一个开源模型,配同样的 NVIDIA 硬件,却有 5 倍的性能差异和数倍的吞吐差异。」(中文为本文迻译)
这条数字和"软件层正在被开源掉"并不矛盾,它精确地划出了分界线:能写成 checkpoint、能进上游仓库的那部分(量化、speculative decoding、kernel)确实在被开源掉;而"把一个 4 万亿参数的模型在真实流量下持续跑满"是运营,不是算法,外人连看都看不见。阵营 A 的正确形态因此应该收窄——护城河不在软件层整体,在运营 + 不可外部观测的吞吐经济学。注意信源立场:Vishria 是 Fireworks 的投资人,这个 5x 对他有利;但它至少是语料里第一个把变量控住的比较。
阵营 B · "开源在逼近前沿、模型层在被商品化"——记者与买方视角的怀疑
Stephanie Palazzolo (The Information) 给的是 Camp A 的直接反驳(英文原音、仅存中文,故转述):推理供应商被怀疑"不过是 GPU 经销商"——尽管融资凶猛,却很难证明其高估值;而且它们的命运被绑死在一条线上——开源模型相对闭源模型的性能差距,推理供应商本质上是这条 gap 的代理。
Redpoint 给了同方向的实证——switching cost 在塌(同为英文原音转述):他们组合里很多公司几天内就从 Anthropic 切到 DeepSeek、推理成本降 80–90%;LLM 之间切换成本极低,公司可以按成本 / 性能随意换供应商。
Benchmark 的 Ev Randle 把 Stephanie 那条"gap 决定命运"的抽象判断落成了一个具体机制——distillation(蒸馏):只要开源能持续逼到前沿的 95%,前沿实验室对 token 收溢价的能力就会被结构性压掉。
"if at any point it seems like capabilities are actually hitting an absolute ceiling, And distillation continues as it has historically. And the open source actually gets, you know, 95% as good as wherever the ceiling of capabilities tops out. That's a really scary situation for the Frontier Labs. … you'd have a much, much greater impact from open source depressing their ability to have pricing power and charge a premium for the tokens that they're producing."「如果在任何时候似乎能力实际上达到了绝对上限,并且蒸馏仍然像历史上那样进行。而开源实际上可以达到您知道的能力上限的 95%。这对于 Frontier Labs 来说是一个非常可怕的情况。……开源会大大影响他们的定价能力,降低对他们所生产的代币收取溢价的能力。」Ev Randle · Benchmark's AI Bets
本轮 Glean 的 Arvind Jain 把这条怀疑从"假说"推到了"正在发生"——他给了三个此前语料缺的硬判断:开源已便宜一个数量级、OpenAI 传闻要大砍价、以及"模型业务本身没那么赚钱":
"with open source, like, you know, it actually is an order of magnitude cheaper prices. I actually heard rumors that OpenAI was going to drastically reduce their model prices in response to these developments like competition as an open source."「随着开源的出现,实际上价格要便宜一个数量级。我听说 OpenAI 可能会大幅降低他们的模型价格,以应对这样的竞争。」Arvind Jain · 20VC: Why OpenAI and Anthropic Won't Win the App Layer
"The model business on its own is actually probably not as lucrative as everybody believes, but these companies now have a lot more things. They're no longer model companies only."「模型业务本身实际上可能没有大家想象中那么有利可图,但这些公司现在有了更多的业务。他们不再只是模型公司。」Arvind Jain · 20VC: Why OpenAI and Anthropic Won't Win the App Layer
Arvind 甚至给了一个时间表:三年内大多数企业负载会跑在开源模型上,而拐点就在 GLM 5.2 逼进前沿三个月内那一刻。Sierra 的 Clay Bavor 从另一端给了同一件事的供给侧解释——中国开源的强,本质是"蒸馏美国前沿模型",而美国实验室出于自保不会自己发布同能力的开源权重:
"if you can't build frontier models yourself, okay, maybe the next best approach is to distill them and offer them up."「所以如果你自己不能建立前沿模型,好的,也许下一个最佳选择就是提炼它们并提供出来。」
阵营 C · "硬件可移植性是神话——但赢家也轮换"——Tri Dao 的双重立场
Tri Dao 既给 Nvidia 站台,又给挑战者留了门:
"I would say hardware portability is kind of a myth. Simply, you know, even for our Nvidia chips, like generation to generation, they change a lot … Even for Nvidia, every generation, they essentially have to rewrite all the code … So even hardware portability, even between generations, isn't quite there."「我认为硬件可移植性有点像神话。简单地说,你知道,即使是我们的 Nvidia 芯片,从一代到一代,它们也发生了很大的变化……即使对 Nvidia 来说,每一代他们基本上都要重写所有代码……所以即使是硬件的可移植性,即使在几代产品之间,也还不够好。」Tri Dao · Ep 74: Chief Scientist of Together.AI
"Obviously, Nvidia is dominant for a couple of reasons. They design very good chips and they build very good software. And that creates this ecosystem where people build on that. … But I think certainly we'll see a lot of competitors entering the space as the workload starts to be a little bit more sort of coalescing around on the architecture side, you know, transformer and MOE and so on. It becomes a little bit easier to design the chips for that kind of workload, right?"「显然,Nvidia 占据主导地位有两个原因。他们设计出非常好的芯片,并且构建非常好的软件。这就创造了一个人们在此基础上构建的生态系统。……但我认为,随着工作负载开始更多地围绕架构方面(例如 Transformer 和 MOE 等)整合,我们肯定会看到很多竞争者进入这个领域。针对这种工作负载设计芯片变得容易一些,对吧?」Tri Dao · Ep 74: Chief Scientist of Together.AI
这一立场把战场推到 hardware-software co-design。
阵营 D · "agent 价格会被压到计算成本"——McGrew 的终局推演
Bob McGrew(OpenAI 前研究负责人) 给出最悲观(对推理供应商而言)的版本(该集英文原音、podwise 仅存中文,故以下为转述):因为竞争,agent 的价格可能被压到只剩计算成本,从而侵蚀掉一切建立在"专业稀缺"上的经济模式。他的比喻很直白——律师贵是因为时间稀缺;但一旦你把律师做成 AI 模型,就等于有了无限多个律师,于是它一点都不稀缺了。而价值会"逃"到哪里?McGrew 押的是:最有价值的机会在那些对"模型之外的领域"有深刻理解的应用——比如把 AI 接进既有业务流程的企业方案。
两条旧证词从两个相反方向打这个终局。一边补强:Harvey 的 Gabe Pereyra 观察到,Opus 4.7 比 5.5 贵 3 倍、性能只好 10–20%,而这种细微的性能差在多家供应商 + 开源追赶下会被互相压价:
"Opus 4.7 is three times more expensive than 5.5, but it's 10 or 20% more performant. But these are going to cause pressure on each other. And then if open source catches up, you're also going to have pricing pressure."「Opus 4.7 的价格是 5.5 的三倍,但其性能仅提高了 10% 或 20%。但这些会相互施加压力。如果开源跟上了,你也会面临定价压力。」Gabe Pereyra · Harvey Co-Founder on the Token Pricing Reckoning
另一边复杂化:OpenAI 的 Noam Brown 指出,在 test-time compute 时代,"一个 agent 值多少钱"根本不是一个固定数——模型能力是你投入预算的函数:
"The capability of the model is a function of how much money you put into it, basically. If you give it a budget of $10,000, it can do a lot more than what it can do with a budget of $10. Give it a budget of $10 million, it can do even more."「模型能力基本上是你投入多少钱的函数。如果你给它一个 10000 美元的预算,它能做的比拥有 10 美元预算时多得多。给它 1000 万美元的预算,它能做的更多。」Noam Brown · Why Traditional Benchmarks Fail Modern AI Models
但 Noam 也给了 McGrew 阵营一个反向弹药——解一道给定难题的成本本身在按代际暴跌:
"the cost of Disproving the Erdos unit distance conjecture drops by like 10 or 100x with every model release cycle, probably in some cases more. … Yeah, just go on vacation and come back two months later and then it's a thousand times cheaper."「反驳 Erdős 单位距离猜想的成本在每次模型发布周期中下降了大约 10 或 100 倍,在某些情况下可能更多。……是的,放假去度假,过两个月再回来,然后便宜了千倍。」Noam Brown · Why Traditional Benchmarks Fail Modern AI Models
2026-08 新增:Vishria 用云市场的收敛史给这条终局提了一个寡头式反例。 McGrew 的推演是"价格趋近计算成本 → 无差异化 → 中间层被压死",但 Vishria 指出 2014 年"AWS 会吃掉一切"的判断错得离谱,错因不在那些被碾死的公司,而在低估了市场本身的体量:
"Is AWS the biggest? I think it's like a 40-30-20 split. You ended up with an oligopoly of that. And even outside of those big three, you have CloudFlare, which is A cloud provider in a different sort, which is another $100 billion company."「AWS 是最大的?我认为大约是 40-30-20 的划分。你最终得到了一个寡头垄断。即使在这三大巨头之外,你还有 CloudFlare,它是另一种云服务提供商,也是一家价值 1000 亿美元的公司。」
他的结论是这里存在大量零和式思维(转述)。注意这不是对阵营 D 的正面反驳,是对它的一个尺度修正:价格照样趋近成本、毛利照样被压,但市场足够大时,"低毛利"和"千亿美元公司"可以同时成立(AWS 本身就是低毛利生意)。这把"谁先死"这一问从"中间层会不会死"改写成"中间层会剩下几家"——而后者恰好是阵营 A(运营护城河)与阵营 F(开源摊平)在争的东西。
阵营 E · "在巨头打架的缝里挑窄市场"——Fal.ai 的策略
Fal.ai 的 Gorkem 和 Batuhan 选择根本不和 LLM 推理玩家正面打——他们的论点是 inference 经济学的现实是"分赛道":
"We chose to be a leader or play to be a leader in this fast-growing niche market rather than trying to go against Google or OpenAI or Anthropic."「我们选择成为这个快速增长的利基市场的领导者,而不是试图与 Google 或 OpenAI 或 Anthropic 竞争。」Gorkem / Batuhan · History of Generative Media with Fal.ai
"Whenever something new comes up, we are the first one to optimize it. First one to adapt our inference engine to it."「每当有新的东西出现,我们总是第一个优化它,第一个调整我们的推理引擎来适应它。」Gorkem / Batuhan · History of Generative Media with Fal.ai
阵营 F · "Diversity wins"——开源基础设施视角
vLLM / Inferact 的 Simon Mo 和 Woosuk Kwon 给的是另一种结构性预测:
"What we believe is diversity will triumph that sort of single of anything at all."「我们相信多样性会战胜任何单一的事物。」Simon Mo · Inferact
"Having this community all work together for this open-source, we have the execution beyond any single entity can have."「拥有这个社区一起为开源项目努力,我们的执行力超越了任何单一实体所能达到的水平。」Simon Mo · Inferact
Modal 本轮的"开源上游 DFlash"其实是这条阵营 F 的一个新注脚:连闭源推理平台都在把自己的性能优势喂回开源社区,这在为"多样性/开源赢"背书的同时,直接掏空了阵营 A 的软件护城河。
2026-08 补引(上一轮遗漏):vLLM 的 Simon Mo 给了这条阵营最强的一个定位比喻,以及一条被低估的采用动因。 先是定位——推理引擎不是中间件,是基础设施层,硬件厂商反过来要向它对齐:
"VLLM is an inference engine. It is kind of like databases and operating system and other critical software to power AGI, NVIDIA, AMD, Google. Their newest chip will make sure VLM can run on them. And in a lot of cases, they use VLM as a benchmark while bridging almost a 10x gap."「vLLM 是一个推理引擎。它有点像数据库、操作系统这类驱动 AGI 的关键软件。NVIDIA、AMD、Google 的最新芯片都会确保 vLLM 能跑在上面。很多时候,他们把 vLLM 当作基准,同时弥合近 10 倍的差距。」(中文为本文迻译;"VLM"为转写瑕疵,指 vLLM)Simon Mo · The Engine Powering Open-Source AI
更值得记的是采用动因——他给的不是价格,是控制权:闭源 API 的审核策略会对正当的专业工作流误伤,这本身就在把企业推向开放权重:
"If moderation is never solved, in the future people will go to open-weight by default because that is where you know for sure you can control your guardrail for trusted use cases."「如果审核问题始终解决不了,未来人们会默认转向开放权重,因为那是你唯一能确保为可信用例掌控自己护栏的地方。」(中文为本文迻译)Simon Mo · The Engine Powering Open-Source AI
这条在本主题里是新的:此前"企业转开源"的动因清一色是价格(Glean 的成本控制、Lin Qiao 的破产风险)。合规与误伤是一条与价格无关的独立推力——它意味着即使推理价格降到零,开放权重的采用也不会回落。他同时给开放权重的可持续性提了一个制度性的类比(转述):训练前沿模型的 CapEx 需要类似制药业的经济激励与商业授权来回流,否则没人有动力做下一轮。
阵营 G · "垂直整合到 SOL"——Nvidia / Nebius 的反向押注
Nvidia 的 Kyle Kranen 和 Nader Khalil 不接受"多样性赢"也不接受"软件层赢"——他们的逻辑是只有 hardware-model co-design 才能逼近物理极限:
"Before trying to layer reality back in of like, why can't this be delivered at some date? Let's just understand the physics. What is the theoretical limit to like, how fast this can go?"「在试图重新加入现实之前——比如,为什么不能在某个日期交付?——让我们先理解物理。理论上它能跑多快?」Nader Khalil · NVIDIA's AI Engineers: Agent Inference at Planetary Scale
本轮 Accel 增长团队从投资人视角给了同一逻辑的公司化身——Nebius 这类"垂直整合的下一代 hyperscaler"(自建数据中心、自研机架、自控软件栈),赌的正是"控住产能就能吃下指数级增长的推理需求"。这与阵营 F 的"多样性赢"在底层架构观上几乎对立。(逐字稿仅中文,故转述其对 Nebius 垂直整合"从数据中心到软件全拥有、以此高效交付推理"的判断。)
阵营 H · "把成本从 inference 挪回 training"——Engram 的第三条路
Engram 的 Dan Biderman 和 Jessy Lin 提出的路线跟前面所有阵营都不同:与其在推理端优化,不如在权重里内化上下文,用一次性的轻量训练换掉每次调用都要重读的巨型 system prompt——把 token 消耗砍两个数量级:
"The fact that you don't have to research things and re-read things and the fact that you don't have to write monstrous system prompts. … That can give you, you know, two orders of magnitude reduction in token inference consumption. … answer, you know, within 100 tokens what the best frontier models would consume 100,000 tokens."「你不必研究事物和重新阅读事物的事实,以及你不必写出庞大的系统提示。……这可以让你,知道,减少两个数量级的令牌推断消耗。……在 100 个令牌内回答,而最佳前沿模型可能需要消耗 10 万个令牌。」Dan Biderman · Memory and Continual Learning: Engram
本轮 Dan Biderman 的第二场访谈(AI Memory)给了这条路线此前缺的系统级数字——把"长上下文很贵"从口号变成一个可量的物理事实:让 LLaMA-70B 读一篇维基百科文章,GPU 上的 KV cache 就膨胀到与整个模型权重同数量级:
"if you take a LLAMA 70D model and you load one article from Wikipedia … The brain state of the model when reading this few tens of kilobytes is like 80 gigabytes. 80 gigabytes on the HBM of the GPU. … And the entire set of parameters of this model would be like 140 or so gigabytes … this one article about Taylor Swift is like same order of magnitude memory consumption on the GPU. So it's highly memory inefficient. That's a systems problem."「如果你拿一个 LLAMA 70D 模型,并加载一篇来自维基百科的文章……当模型阅读这几十千字节的内容时,其大脑状态就像是 80GB 一样。在 GPU 的 HBM 上有 80 GB。……而这个模型的所有参数总共大约是 140 GB……而这篇关于泰勒·斯威夫特的文章在 GPU 上的内存消耗也是同样数量级。所以它的内存使用效率非常低。这是一个系统问题。」Dan Biderman · The AI Memory Problem: Why Long Context Isn't Enough
他也承认,这套"把 token 效率变成硬指标"的紧迫感是最近才起来的——反过来印证了主流共识第三点里 Jevons 的真实压力:
"One is token efficiency and cost, which is a major issue that wasn't actually an issue when we started the company late last year and became more urgent now."「首先是令牌效率和成本,这是一个重大问题,当我们去年年底创办公司时并不是一个问题,现在变得更加紧迫。」Dan Biderman · The AI Memory Problem: Why Long Context Isn't Enough
值得记的是,第一场 Engram 访谈里坐着 Fireworks 的 Sonya Huang,她对"agent 跑几天的巨额推理成本"给了推理供应商最赤裸的立场——高推理成本是好事:
— Jessy Lin: "… I think a lot of what people are worried about these days is the huge inference costs of running these agents like for days on end."
— Sonya Huang: "High inference costs a good thing."
— Jessy Lin: "I mean, consuming tokens for what?"
— Shaun Maguire: "Sonya works at Fireworks. She really loves it."
— Sonya Huang: "I love inference."
「——Jessy:人们现在最担心的是持续几天运行这些代理的巨额推理成本。——Sonya:高推理成本是件好事。——Jessy:我是说,消耗代币是为了什么呢?——Shaun:Sonya 在 Fireworks 工作。她非常喜欢这份工作。——Sonya:我喜欢推理。」
— Memory and Continual Learning: Engram
这段对话把整个主题的张力压成了三行——供应商爱推理成本,客户想消灭它,而 Engram 想把它挪到别处。
2026-08 新增:Engram 自己把这条路线的天花板说出来了,阵营 H 因此需要改写。 同公司的 Jack Morris 讲得很直白——从私有数据造合成数据再训练,会撞上一堵合成意义上的数据墙:
"It's kind of like a data wall in the synthetic sense where when you create synthetic data from D and train on it, you eventually hit this upper bound where like you've learned all of the synthetic data and then you have to do it again."「这有点像在合成意义上的数据墙,当你从 D 创建合成数据并对其进行训练时,最终你会达到一个上限,像是你已经学习了所有合成数据,然后你必须重新进行。」Jack Morris · Scaling Compute on Context — Jack Morris, Engram
他也承认公司早期的曲线正是这个形状(转述:一开始画出来的就是那条会走平的蓝线,因为"一次性从 D 里能学到的东西有个自然上限"),出路是让训练递归地变难——用模型自己生成越来越难的任务把曲线重新抬起来。于是他把整件事重新表述成一个不再省钱的问题:
"how do you scale more compute given the same data?"「在同样的数据下,你怎么塞进更多算力?」(中文为本文迻译)Jack Morris · Scaling Compute on Context — Jack Morris, Engram
这句话把阵营 H 的性质改了。 Dan Biderman 那一版是成本论证(10 万 token 的活用 100 token 干完、KV cache 省下来);Jack Morris 这一版是 scaling 论证——同样的私有数据,可以无止境地投入更多算力去榨深度。两者不矛盾,但结论方向相反:前者把推理算力省掉,后者把它挪到一个同样没有上限的地方去烧。如果后者才是这条路线的终态,那么阵营 H 就不是 Jevons 的解药,而是 Jevons 的第 N 个出口——推理账单降下去,训练/自我改进账单涨上来。语料里没有人对着这两个版本追问过一句:净 token 支出到底是降还是升。
阵营 I · "把便宜的推理推到端上"——Josh Elman 的消费侧视角
Josh Elman 与 a16z 的 Anish Acharya 在同一场对话里从消费 App 的角度接住了同一根线:Acharya 点出推理有实际边际成本、逼着消费产品从免费转向订阅,Elman 接着给出破局点——把简单推理下放到设备端:
"Because there's no zero marginal cost of distribution, inference costs money, you can't really build a mass market free product without a massive balance sheet."「因为没有边际分发成本,推理要花钱,你其实不能没有庞大的资产负债表建立一个大众市场的免费产品。」Anish Acharya(a16z,主持人) · What's Next for Consumer AI
"We're going to be figuring out with the models even that you can run on iPhones or on laptops, how to push more and more of the … less complex inference that needs to be done onto device to lower the cost … And then you only send the more complex stuff up."「我们将会发现如何在 iPhone 或笔记本电脑上运行的模型中,通过将越来越多需要在设备上进行的……不复杂的推理转移到设备上来降低成本……然后你只发送更复杂的东西上去。」Josh Elman · What's Next for Consumer AI
本轮 Sierra 的 Clay Bavor 给这条"端上便宜"加了一个明确的边界:端侧能改善部分消费体验,但缓解不了服务器侧的根本瓶颈——前沿负载受限于手机的热功耗,只能回到数据中心那排 TPU/GPU。Elman 的"简单的放端上、复杂的送云端"和 Kevin Weil、Harvey、Glean 的"模型路由"其实是同一条经济学在多个层面(端/云、模型编排、供应商选择)的重复——都在为主流共识第四点背书。
阵营 J · "前沿智能需求无上限,成本地板是能源与算力"——Clay Bavor / Accel 的反 doom
Sierra 的 Clay Bavor 和 Accel 增长团队 给了对阵营 D "价格趋近计算成本 → 中间层被压死"最直接的一个反驳。他们不否认价格在跌,但把结论从"margin 归零、生意死"改写成"地板是真的、需求无上限、大家都在长"。Clay Bavor 的两块论证:一是需求端根本没到顶——
"So, I think we have not yet appreciated the unbounded demand for, call it frontier levels of intelligence."「所以,我认为我们尚未充分认识到对,称其为,前沿智能水平的无边需求。」
二是成本端有一条物理地板——就算开源避开了托管前沿模型的 margin stack,最底层的输入仍是被约束的电力与 GPU:
"if you have unbounded demand for frontier level intelligence or GPUs to run open waste models and the rate limiter is the number of Blackwells and H100s you have, you end up with kind of a floor on the cost of tokens because you've got to pay for the energy, you've got to pay for the compute."「如果你对前沿水平的智能或用于运行开放权重模型的 GPU 有无限的需求,而限制因素是你拥有的 Blackwells 和 H100 的数量,那么你最终会发现代币的成本有一个底线,因为你必须支付能源费用,必须支付计算费用。」
Accel 增长团队从投资端给了同一立场的宏观版本——token 消费的走向完全由 capability frontier 决定,只要能力还在涨,需求就会一路上修;但他们也点了 Jevons 的一个刹车条件:价值不回来,就会有 governor(制动器):
"it's only going as far as the value It receives back, right? And so there is going to be a governor against if we don't see value back from it."「但它只会走到它所得到的价值,对吗?因此,如果我们没有看到价值回报,就会有一个制约因素。」
这条阵营 J 和阵营 D 并不是硬对立——两边都同意价格向成本靠拢,分歧在"然后呢":D 说地板足够低、无差异化、中间层死;J 说地板由能源/算力钉住、需求无上限,所以真正的约束会从"margin 竞争"转成"电力与 GPU 供给能不能跟上"。
本轮 Lin Qiao 把这条地板又往下钻了一层——不是能源、不是 GPU,而是一颗晶体管:整条制造链从来没有为 100 倍扩张设计过。
"We are bottlenecked by the lower part of the AI cake in terms of supply chain, being energy. Being energy, being chips, in the physical world, how fast we can manufacture. Because in the history, all these industries are designed for massive scaling. Speaking about 100x scaling, no one was designed for that. I talked with many manufacturers. It's kind of bottlenecked by small parts. Transistor."「在供应链方面,我们被人工智能蛋糕的下层瓶颈困住,而能源是关键。能源、芯片,在物理世界中,我们能多快制造。因为在历史上,所有这些行业都是为大规模扩展而设计的。说到 100 倍的扩展,没有一个行业是为此设计的。我和许多制造商进行了交谈。这有点被小零件瓶颈困住了。晶体管。」Lin Qiao · 20VC: Are OpenAI and Anthropic Overvalued?
她同时给了这条约束一个期限:一年到一年半内不会变,两三年后会松——这恰好和她的"三年 10x 降价"是同一个时钟。也就是说阵营 J 在本轮拿到了一个内部一致的时间模型:短期供给绑死、价格降不动;中期供给松开、降价兑现、用量放大 100 倍。
阵营 K · "扩张到破产"——Lin Qiao 提出的买方侧硬约束
这是本轮新出现的一条线,它把推理经济学的落点从"谁赚得到钱"挪到了"谁付得起钱"。Lin Qiao 指出 SaaS 时代 PMF 约等于可持续生意,而这个等式已经断了:
"During SaaS time, product market fit and the doable business almost are equivalent to each other. … Now, product market fit and durable business are two separate concepts. … Customers want to pay them, and they really value their product, but they cannot scale because once they scale, they could scale into bankruptcy. Have you heard about scaling to bankruptcy? That's a real problem."「在 SaaS 时代,产品市场适配和可持续商业几乎是等同的。……现在,产品市场适配和持久业务是两个独立的概念。……客户愿意为他们付费,并且他们非常重视他们的产品,但他们无法扩展,因为一旦他们扩展,他们可能会扩展到破产。你听说过扩展到破产吗?这是一个真正的问题。」Lin Qiao · 20VC: Are OpenAI and Anthropic Overvalued?
而且她认为在位者比初创更危险,因为他们的流量正是负债:
"It's even a bigger problem for incumbents. … They have a huge amount of traffic. … Once they roll out those AI features, they're going to reach to all their customer base and they cannot afford to do it. Because the CFO look at their cost proposal, cost forecasting is kind of, there's no way you can justify this"「对于现有企业来说,这甚至是一个更大的问题。……他们有大量的流量。……一旦他们推广这些 AI 功能,就会覆盖到所有客户基础,他们无法承担。因为 CFO 看着他们的成本提案、成本预测,你无法证明这一点。」Lin Qiao · 20VC: Are OpenAI and Anthropic Overvalued?
注意这条与阵营 J 的关系很微妙:Accel 说 Jevons 会有一个 "value governor"(价值不回来就刹车),Lin Qiao 描述的是同一个刹车已经踩下去的样子——只不过踩下它的不是价值判断,是 CFO 的成本预测表。而她给的解药,正好落回阵营 B 和 F:控制自己的开放权重模型。
2026-08 新增:Lin Qiao 给自己提的病开了药方,并且标了价。 上一轮她只诊断(PMF ≠ durable business、扩张到破产),本轮她把解法讲成一个两段论——先是护城河,后是单位经济:
"So then post-training becomes a very appealing solution because post-training allows you to basically encode, codify your unique taste Into a model that no one can steal from. Because it's very easy to clone and copy application as is, as you all know, right? From coding agent, it's very easy. So from screenshot, boom, generate the same or even better app."「因此,后训练成为一个非常吸引人的解决方案,因为后训练让你基本上能够将你独特的品味编码成一个无人可以窃取的模型。因为像大家所知道的那样,克隆和复制应用程序是非常简单的,对吧?从编码代理来说,这很容易。所以从截图开始,生成相同或甚至更好的应用程序。」Lin Qiao · Post-Training Is How You Keep Your Taste
关键是第二段,她把降本幅度直接说成了数字:
"And second is you can post-train a model that bring down the cost five to ten times."「第二是你可以后训练一个模型,使成本降低五到十倍。」Lin Qiao · Post-Training Is How You Keep Your Taste
"And then that means you can support five to ten times much higher traffic with the same budget. And your unit of economics of scaling is so much better than you avoid scaling into bankruptcy."「这意味着你可以用相同的预算支持五到十倍更高的流量。而且你的扩展经济单位比避免破产要好得多。」Lin Qiao · Post-Training Is How You Keep Your Taste
口号是 "own your own intelligence, not rent"——把"租智能"改成"拥有智能",而拥有的起点是数据(她的原话:intelligence is derivative of data)。她给的启动时点也很具体:PMF 之后才做后训练,因为那时才有足够量的真实生产数据(转述)。
要点有三。 一是这条把阵营 K 从纯诊断变成了完整闭环——扩张到破产的病因是"用别人的通用模型解自己的窄任务",药是把窄任务烧进自己的权重。二是它与本主题另外两条降本路径互不重叠:Baseten 的推理栈优化(量化 × speculator × disagg,约 2–4x)、Vishria 记录的运营层性能差(约 5x)、以及这里的后训练(5–10x)——三者原则上可以相乘,但语料里没有任何一集把它们叠在一起算过总账,也没人说过它们是否会互相抵消(后训练出的小模型未必吃得到同样的推理栈红利)。三是信源立场必须标注:Fireworks 卖的正是后训练与推理,5–10x 是卖方给的倍数,且这一集本身是一堂产品课,不是第三方评测。
顺带把阵营 K 与阵营 B 的连接补实:她的药方恰恰要求企业控制自己的开放权重模型——这也是为什么"开源商品化"和"买方付不起"在她这里是同一条因果链的两端,而不是两个独立观察。
都没说透的
- "软件层粘性"是否真的扛得过一次性的迁移成本?(2026-08 部分被回答) 本轮 Vishria 给了此前完全缺的性能数字——同模型同硬件下 Fireworks 与通用云差约 5x 速度、"多倍"吞吐——这把争论从"软件层有没有优势"推进到"优势在哪一层":可写成 checkpoint 的算法优化确实在被开源掉(Modal 的 DFlash、Baseten 自陈的量化/speculator),跑不掉的是运营与吞吐经济学。但缺的那半仍然缺:性能差 ≠ 留存差,没有一家给出按 ACV 分层的 NDR。而且 5x 出自 Fireworks 的投资人之口,需要一个买方侧的独立复现(引文见「阵营 A」)。 Tuhin 的 Baseten 论点和 Redpoint 的"几天切换 DeepSeek 省 80%"实证是直接矛盾的,而本轮 Modal 又加了一层反讽——它把自己软件层里可复制的性能优势(DFlash)主动开源了。没有一方拿出具体客户长期留存数据:Baseten 30x 增长是新增还是续费没拆,Modal 的"弹性/可靠性"到底带来多少 NDR 也没有数字。如果软件层里能被量化的部分正在被从业者自己开源掉,剩下守得住的"运营护城河"值多少钱,没人算。
- Jevons paradox 多久会被消费侧的预算上限阻断? 本轮 Jevons 的一线证词密度暴涨(Glean 的"预算一两月超支"、Accel 的"7 倍公司被叫去 let it rip""看涨每月 5 亿美元 token""每季度都上修"、Clay 的"3.8% → 20%"),但仍然没人给出企业 AI 总预算的真实弹性曲线——全是方向性判断和调查口径,不是账单数据。反作用力也第一次被点名:Accel 说 Jevons 有个"value governor"(价值不回来就刹车),Glean 把"路由省钱"直接做成产品——但这两股力量谁跑得快,语料里还是没有数据。
- "推理成本"到底指哪个数?(本轮部分被回答) Noam Brown 揭了 test-time compute 让"推理成本"变成一条随预算滑动的曲线;Clay Bavor 从另一端钉了能源/算力的物理地板。本轮 Lin Qiao 第一次给了框架——"not all tokens are equal",并把优化拆成"解一个任务少用 token"与"每 token 更值钱"两层,等于承认单价和 per-task 用量必须一起看。但框架不是数据:仍然没有一集把"等质量单价"和"每任务 token 量"这两条曲线叠进同一张图(Clay 的"1/1300"是前者,Harvey 的"$20,000 一次审查"是后者),也没人公布过 Lin Qiao 呼吁的那套 per-task token economy 基准。缺口从"没人意识到"降级为"没人量过"。
- 重度用户正在离开 token 计价,而所有争论还建立在 token 单价上。 Baseten 本轮提到,跑到每小时百万级 token 的客户会迁到按小时租的 dedicated 容量。如果最大的那批需求是按产能而不是按 token 采购的,那么"token 价格趋近计算成本"这个终局对他们根本不适用——他们买的就是计算成本。没有一集讨论过这两种计价模式各占多少量。
- 模型路由被当成了免费的银弹,可它自己就是个未解难题。 主流共识第四点里,路由被七八个独立信源当成"同样的活尽量用便宜模型干"的默认答案,但只有做过路由的 Dan Biderman 泼了冷水——"It's an unsolved thing. There's been progress on it, but a lot more work is required to actually route things to the right model, the right time, the right cost." 路由本身的准确率、判错成本、以及在模型版本每周变动下的维护成本,没有任何一集给出数字。
- 如果"代理价格 = 计算成本"成立,哪种业务模型先死? McGrew 抛出、Benchmark 的 distillation 补强、Glean 的"OpenAI 传闻砍价 + 模型业务没那么赚"再推一把,但仍然没人接住"谁先死"这一问。最直接的输家是按 token / 按调用收费的中间层,语料里没有任何一家做这种业务的人承认这一点,全部声称"我们有软件层 / 我们有路由 / 我们把成本挪到 training / 我们控住产能"。而 Glean 顺口点出的另一层——"一旦转向 consumption,就没有捆绑优势,要拿到同样收入得做十倍的工作"——把这条追问从"中间层"扩到了整个应用层的收入模型,同样没人展开。
- (2026-08 新增)三条降本路径能不能相乘,没人算过。 本主题现在同时挂着三个降本倍数,且互不重叠:推理栈优化 2–4x(Baseten:量化 × speculator × disagg)、运营/供应商选择 约 5x(Vishria)、后训练自有模型 5–10x(Lin Qiao)。三者名义上可以叠乘到两个数量级,但没有任何一集讨论过它们是否互斥——例如后训练出的小模型是否还吃得到同样的推理栈红利、自建后训练是否会让你失去供应商的运营优势。这是当前语料里最容易算、却完全没人算的一笔账。
- (2026-08 新增)阵营 H 到底降不降净支出? Dan Biderman 版的 Engram 是成本论证(省两个数量级 token);Jack Morris 版是 scaling 论证(同样数据、塞进更多算力,因为合成数据墙必须靠递归变难来突破)。同一家公司的两个版本,对"净 token 支出"的结论方向相反,而没有一集把推理侧省下的和训练/自我改进侧新增的放在同一张账单上。若后者占优,阵营 H 就应该从"Jevons 的解药"重新归类为"Jevons 的又一个出口"。
- (2026-08 新增)合规/误伤这条非价格推力有多大? Simon Mo 指出闭源 API 的审核会对正当专业工作流误伤,因而"审核问题不解决,未来默认走开放权重"。这是本主题里第一条与价格无关的开源采用动因——意味着即使推理降到白菜价,开放权重的份额也不会回落。但没人量过:有多少企业迁移是被误伤推走的,而不是被账单推走的。
- 新架构(MoE、MLA、SSM 等)的速度是否真的快于 Nvidia 重写代码的速度? Tri Dao 暗示了但没量化。这是判断 Nvidia 护城河会不会松动的关键变量。
我的看法
判断(不是事实):这场争论里"推理是新瓶颈"是共识、"价值落点"是分歧——而分歧更多是赌时间窗,不是赌终局。短期(1–2 年)软件层粘性是真的(多云协调、kernel 优化、长尾客户化),Camp A 对;中期(3–5 年)开源 stack 会把这层粘性吃掉一大半,Camp F 和 Camp B 对;长期 McGrew 的"价格 = 计算成本"成立的概率是高的,但前提是模型差异化继续收敛——如果某家实验室真做出代际差距大的模型,整个论断就反转。所以这套论点的强度很大程度上取决于 performance-plateau 这个主题的走向(见姊妹主题)。
我对这个判断的把握:中等。最强的一环是"开源 stack 长期吃掉中间层"——这条已被 vLLM 的实际市占验证,本轮 Glean 的"三年内多数企业负载跑开源""开源便宜一个数量级""OpenAI 传闻砍价"又给它加了买方侧的实测;连闭源推理平台 Modal 都在开源自己的性能优势,这几乎是自我实现。最弱的一环仍是"Jevons paradox 的净效应"——证词密度这轮暴涨,但依旧全是方向性判断,缺账单弹性数据。
上一轮我调整了一处:过去我把"路由 / quality-per-dollar"当成 McGrew 终局的前置动作,方向不变,但Dan Biderman 提醒我别把路由当免费银弹——它自己是未解的研究问题,判错成本没人量过。同时,Clay Bavor + Accel 的阵营 J 是当时见到的对"价格→零 margin→中间层死"最有力的反驳:它没否认价格在跌,而是把约束换成了物理地板(能源、GPU 供给)。所以我此前倾向认为,接下来两年真正的裁决变量不是"margin 会不会归零",而是"电力/先进封装/GPU 供给"与"企业预算弹性"这两条硬约束里哪条先绑住。
本轮我把这个判断收得更紧了一点。 Lin Qiao 的阵营 K 让我意识到,我一直把"企业预算弹性"当成一条会缓慢弯曲的曲线,但"scaling into bankruptcy"描述的是一个不连续的东西:不是预算慢慢用完,是 CFO 在成本预测表上直接否掉整个 rollout。如果这条在位者身上比在初创身上更常见(她的说法),那么推理需求的增长曲线可能不是平滑的 S 型,而是被一层一层的采购否决切成台阶——而每一级台阶的高度,正好由那一刻开源模型能便宜多少来决定。这让阵营 K 和阵营 B(开源商品化)实际上是同一条因果链的两端,而不是两个独立观察。
我对这一点的把握:中等偏低——它目前只有 Lin Qiao 一个信源,而她卖的正是这个问题的解药。需要一个买方侧的独立证词才能立住。
同时我下调了一点对"软件层护城河"的估计。上轮 Modal 开源 DFlash 我读作个案;本轮 Baseten 的工程师直接说量化 checkpoint 和 speculator "总会有开源版本、NVIDIA 不发也会有人发"——两个独立信源指向同一件事,那更像是这个层的结构性质而不是巧合。剩下守得住的确实只有运营(多云容量、disagg 编排、可靠性)和计价形态,而这两样都比技术更难被外部验证。
2026-08-24 增补:本轮我做了一次方向相反的修正。 前两轮我一路下调"软件层护城河",理由是从业者自己在把优势开源掉。Vishria 的 5x 让我意识到我把两件事混成了一件: 被开源掉的是"能写进仓库的东西",守得住的是"看不见的东西"——同模型同硬件下 5 倍速度差、数倍吞吐差,靠的不是某个 kernel,而是持续把巨型模型在真实流量下跑满的运营能力,而这恰恰是外部(包括我)最难证伪的部分。 所以我把阵营 A 从"正在被自己掏空"改判为"正在被切成两半,其中一半在快速贬值,另一半不可外部观测"。这不是升档,是把不确定性放回了正确的位置。
第二处修正更实质:我不再把阵营 H 当作 Jevons 的对冲。 Jack Morris 说出"同样的数据、怎么塞进更多算力"的那一刻,Engram 的路线就从省钱变成了另一条 scaling 曲线。 这意味着本主题里几乎每一条"降本"路线——路由、后训练、端上推理、上下文内化——最终都会被重新表述成一条新的花钱曲线。这不是巧合,是这个行业的默认动作:任何腾出来的算力预算都会立刻被更贵的用法吃掉。 如果这条观察成立,那么"推理成本会不会压死中间层"就是个问错的问题;该问的是"下一条吃掉盈余的曲线是什么"。
第三,关于降本倍数我保持怀疑。三条路径(2–4x / 5x / 5–10x)分别由卖推理栈、投推理公司、卖后训练的人给出,而且每一条都在暗示另外两条不够用。 在没有一份把它们叠在同一张账单上的第三方拆解之前,我倾向把它们当作三份销售材料,而不是三个可相乘的因子。
我对本轮修正的把握:阵营 A 那条中等(单一信源、有利益相关,但变量控制干净);阵营 H 那条中等偏上(是当事人自陈的立场位移,不是外部推测)。
还想知道什么
- Baseten / Together / Fireworks / Modal 的真实客户留存与扩展数据——3 家以上跑了 18 个月以上的客户、按 ACV 分层的 NDR 数据。没有这个,"软件层粘性"是叙事不是事实;尤其在 Modal 已经把性能优势开源之后,更需要用留存数字证明护城河还在。
- 企业 AI 总开支的真实增长曲线——不是 TAM 估算、不是"7 倍公司 let it rip"这种调查口径,是 Fortune 500 公司 2024–2026 的实际推理账单。Jevons paradox 的净效应只能用账单数据回答。
- 一份模型路由的真实成本/收益拆解——某家公司上了路由后,token 账单降了多少、判错率多少、维护成本多少。Dan Biderman 说路由未解,需要一个量化案例才能判断它到底省下多少、又新增多少隐性成本。
- 一个跨架构迁移成本的具体案例——某家公司从 H100 迁到 B200 / TPU / Trainium 用了多少工程师月、性能恢复到多少。Tri Dao 说"hardware portability 是神话"需要这个数字才能落地。
- DeepSeek / GLM 后的"开源 / 闭源"差距数据——Stephanie 说推理供应商的命运绑定在这条 gap 上,Glean 说 GLM 5.2 已把它压进三个月内。需要至少 2–3 个独立 benchmark(不只是 MMLU)的逐月对比,才能判断这条 gap 是在缩小还是在锁定。
- (2026-08 新增)一份把三条降本路径叠在一起的第三方拆解——同一家公司、同一负载,分别上推理栈优化、换供应商、做后训练,各自省下多少、叠加后省下多少、有没有互相抵消。这是当前最缺、也最容易做的一个实验。
- (2026-08 新增)Engram 路线的净 token 账单——把"推理端省下的"与"递归自我改进烧掉的"放进同一张表。如果净支出是升的,阵营 H 需要重新归类。
- 一份"app 层吃掉推理利润"的反例——一家专注 inference 优化、维持了 40%+ 毛利、且客户留存高的公司。如果三年内一个都找不到,McGrew 的"价格 = 计算成本"基本上自证。
取材
- Tuhin Srivastava (Baseten) · 2026-05-11 ·
35dea6160e718145a7a3c5263827a3bb - Tri Dao (Together.AI) · 2025-09-11 ·
26bea6160e7181f39b48fd0fba93d842 - Gorkem / Batuhan (Fal.ai) · 2025-09-06 ·
266ea6160e7181d5a2bed15472fcbfad - Simon Mo / Woosuk Kwon (vLLM / Inferact) · 2026-01-31 ·
2f9ea6160e718111815bf871f04ddd3b - Bob McGrew (former OpenAI Research) · 2025-06-18 ·
216ea6160e7181a4abe1e0c576c28050 - Stephanie Palazzolo (The Information) · 2025-08-07 ·
248ea6160e71818fb7a4cf78a04a75ba - Redpoint AI Investors · 2025-04-28 ·
1e3ea6160e7181dc895ff3e77430e7ae - Kyle Kranen / Nader Khalil (NVIDIA Brev / Dynamo) · 2026-03-12 ·
320ea6160e71812c9d7ed4b2a8e30e83 - Nathan Labenz on AI slowdown · 2025-10-15 ·
28dea6160e718189ae7bcf6cbddefe24 - Gabe Pereyra (Harvey) · 2026-05-18 ·
387ea6160e71816d928afff83182d03f - Ev Randle (Benchmark) · 2026-05-29 ·
390ea6160e7181848860ca758a56d9ab - Noam Brown (OpenAI) · 2026-06 ·
38cea6160e71819db9edf75b0e6eb94d - Dan Biderman / Jessy Lin (Engram) · 2026-06 ·
38cea6160e7181a498ccefad30236956 - Josh Elman × Anish Acharya (a16z) · 2026-06 ·
38cea6160e718164ba74d098db7cc325 - Kevin Weil (OpenAI) · 2026-06 ·
38fea6160e7181d9862cd6a455019494 - Clay Bavor (Sierra) · 2026-07-06 ·
395ea6160e718112a7a1dba860d7381f - Akshat Bubna (Modal) · 2026-07-13 ·
39cea6160e718139a154e87365fd53e7 - Accel 增长团队 · 2026-07-13 ·
39cea6160e71817c8437f09acf9e2013 - Arvind Jain (Glean) · 2026-07-13 ·
39cea6160e718145b093d79633bd3280 - Rafa Gómez-Bombarelli 等 (Lila Science) · 2026-07-17 ·
3a0ea6160e7181309f08d5135f750f56 - Dan Biderman (Engram / AI Memory) · 2026-07-27 ·
3aaea6160e7181cfbac0e557c83ca7b6 - Lin Qiao (Fireworks) · 2026-07-28 ·
3abea6160e71817bbf52d7ce90b8d38f - Philip Kiely / Ali Taha (Baseten 推理工程 Masterclass) · 2026-08-04 ·
3b2ea6160e71817bb609c9ceb8824f85 - Dianne Penn (Anthropic, 首位技术 PM) · 2026-08-04 ·
3b2ea6160e7181c39fa3f0b4340ee088 - Igor Babushkin (xAI) · 2026-08-04 ·
3b2ea6160e7181f39365eebabdab8679 - Simon Mo (vLLM / InferAct) · 2026-08-10 ·
3b8ea6160e71814095f6dea8dfa2ba34(上一轮列入但未引用,本轮已补引) - Eric Vishria (Benchmark) — A Decade of Lessons Investing in Software & Hardware · 2026-08-22 ·
3c4ea6160e718177ae1ccb6b71ca57b2 - Lin Qiao (Fireworks) — Post-Training Is How You Keep Your Taste · 2026-08-22 ·
3c4ea6160e71815aa1a7dbcb3113e2ed - Jack Morris (Engram) — Scaling Compute on Context · 2026-08-22 ·
3c4ea6160e7181b89f6dc70804705c4f - Stripe — AI Strategy: Build More, Not Less · 2026-08-22 ·
3c4ea6160e7181a9896edde1e499c5de(仅取 Minions/PR 与"build everything"一段)