主题综述

推理经济学 · Inference Economics

主题综述

更新日志

主流共识

第一点:推理成本在以每年约一个数量级的速度下降,这个量级几乎没有反对。

"In the last couple years inference cost has probably come down, maybe 100x …"
「过去这几年,推理成本大概降了,也许 100 倍……」

本轮 Sierra 的 Clay Bavor 给了这条最具冲击力的一个具体倍数——他用 GPT-4 级别智能作锚点,量出了"等质量 token 单价"的塌陷幅度:

"It's now 1,300th the cost for an intelligence equivalent token."
「现在智能等价令牌的成本降低到了 1,300 分之一。」

Redpoint 的投资人也给了同量级的判断(英文原音、podwise 仅存中文,故转述):LLM 的推理和训练成本每年下降约 10 倍,直接改善了在其上构建的应用公司的利润结构。

本轮 Fireworks 的 Lin Qiao 给了这条共识第一个带期限、可证伪的版本——而且她把降价和用量绑成一个连体判断:

"So overall, I can imagine 10x cost reduction in the next three years. And this 10x cost reduction will drive 100x usage."
「所以总体来说,我可以想象在接下来的三年内,成本将减少十倍。而这种十倍的成本降低将推动一百倍的使用量。」

她给的近端数字更激进——明年底 token 总量"20 到 100 倍",理由是"我们现在处于 S 曲线爆发的非常早期阶段"。

而 Baseten 的 Philip Kiely 和 Ali Taha 本轮第一次把"降本 2–4x"这个一直以口号形式流传的数字,拆成了一个可复现的乘法栈——这是全语料里对"成本怎么降下来的"最具体的一次交代:

"It's like, I think it's about like 30 to 40% from 16 to 8, and then another 30 to 40% multiplied from 8 to 4. So that doesn't quite get you a 2x, but like, roughly a 2x. Speculator, roughly a 2x. DISAG on top of that, if you're able to get enough hardware and put enough traffic through it, another roughly a 2x."
「我认为从 16 到 8 大约是 30% 到 40%,再乘以 8 到 4 的另一个 30% 到 40%。所以这并不能完全让你达到 2 倍,但差不多就是 2 倍。投机者,差不多 2 倍。如果你能获得足够的硬件并让足够的流量通过,再增加一个大约 2 倍。」

Philip Kiely 顺手给了一个衡量"这个领域还有多少肉"的行业级标尺——用金融量化研究做参照:

"if you look at highly optimized domains like, say, finance, if you're in finance, you measure how much better you got in basis points. It's like, oh, I got five basis points better, like 1 20th of 1% better. That's huge news because everything is so optimized. When we publish optimizations, it's 20%, it's 100%, it's 200%. So there's still probably like a lot further to go, honestly. Like, you'll know that influence is pretty much solved when researchers start publishing about how they got 1% faster at something."
「如果你观察像金融这样高度优化的领域……你会用基点来衡量你的进步有多大。就像,我得到了五个基点的改善,也就是 1/20 的 1% 更好。这可是个大消息,因为一切都已如此优化。当我们发布优化时,都是 20%、100%、200%。所以,老实说,可能还有很多潜力可以挖掘。当研究人员开始发布他们如何在某件事情上提速 1% 时,你就知道影响差不多解决了。」

第二点:推理负载本身在变质——从静态、同尺寸的请求变成 dynamic、agentic、长上下文,对调度和内存提出全新的问题。

"What if the hardest problem in artificial intelligence isn't training smarter models, but simply keeping them running?"
「如果说人工智能领域最难的问题不是训练更聪明的模型,而是简单地保持它们的运行呢?」
Matt Bornstein(a16z,主持人开场旁白,非嘉宾原话) · Inferact: Building the Infrastructure That Runs Modern AI

本轮 Modal 的 Akshat Bubna 从供应商一线证实了这条:他们最大的用例已经是 elastic inference,流量是 diurnal、突发的,"从零到一"扩容让位给"一小时内从 1000 张 GPU 弹到 1500 张"——这正是负载变质带来的新调度问题。AI Memory 的 Dan Biderman 则从内存端给了一个骇人的量级:长上下文推理的 KV cache 消耗大到与整个模型权重同数量级(见阵营 H)。

第三点:Jevons paradox 在生效——成本降低没有压缩总开支,而是把开发者引向更复杂、更耗 compute 的 agentic workflows。Harvey 的 Gabe Pereyra 给了这条最直白的一线证词——agentic 转向把单位账单直接拉到了荒谬量级:

"We have simple like assistant type queries where you say, you know, draft me a document that a single query can cost $20. We have like a review product where you can upload 100,000 contracts and ask the models to review them. And some of those can cost $20,000. And so it is just getting incredibly expensive."
「我们有一些简单的助手类型查询,比如说,给我起草一份文件,而单个查询可以花费 20 美元。我们还有一个审查产品,你可以上传 100,000 份合同并要求模型进行审查。其中一些可能会花费 20,000 美元。所以这变得非常昂贵。」

本轮这条 Jevons 一次拿到三份互不相干的一线账单证词。Glean 的 Arvind Jain(企业买方视角)——预算根本关不住:

"given that AI has become so expensive, we hear stories all the time about companies coming up with a annual budget for AI and they run past that within a month or two."
「考虑到 AI 变得如此昂贵,我们经常听到公司制定 AI 的年度预算,并且在一个月或两个月内就超支。」

Accel 增长团队(投资人视角)——他们做了一份 CFO 调查,结论是"花更多"压倒性地打赢"省一点",而且看涨到荒谬量级(逐字稿仅把说话人标为 Speaker,故归属为团队):

"we did this survey of developers and we asked them how many of them had a CFO who was telling them to spend less on consumption versus more. And we actually found that seven times more companies are being told to like let it rip and spend more."
「我们对开发者进行了一项调查,询问他们中有多少人有 CFO 告诉他们在消费上要减少开支,而不是增加。我们实际上发现,七倍的公司被告知要尽情花费,增加开支。」

Sierra 的 Clay Bavor(企业内部视角)——把这条 Jevons 落成一个可验证的比率预测:token 支出正在从工程师薪资的零头,涨向一大块:

"top engineers who are really leaning in to Claude Code, Codex, and so on, are spending more than $100,000 on a run rate basis on tokens per year. That's a meaningful fraction of an engineering salary."
「那些真正投入 Claude Code、Codex 等的顶尖工程师,年均在代币上的支出超过 100,000 美元。这在工程师薪水中是一个相当可观的比例。」
"I would not bet on 3.8%. I would bet on much closer to 20%."
「我不会押注于 3.8%。我会赌更接近 20%。」

本轮这条 Jevons 多了一个文化侧的证词——它把"多花 token"从成本问题重述成了一种套利。Lenny 转述 YC 的 Garry Tan:

"If you're willing to spend $100,000 a year right now on tokens, you're living the way somebody in 2028 is going to live. Because by then, it'll be really cheap. Everyone can work this way. But there's this alpha opportunity right now to just live in the future, go crazy on token spend."
「如果你愿意现在每年花 10 万美元在代币上,你就生活在 2028 年某人的生活方式。因为到那时,代币会变得非常便宜。每个人都可以这样工作。但是现在有一个 alpha 机会,可以生活在未来,疯狂地花费代币。」
Lenny Rachitsky(转述 Garry Tan) · Anthropic's first technical PM on token maxing

Anthropic 的 Dianne Penn 没有接这个框架,而是把它翻转了一次——token 花销是输入不是目标,值得盯的产出是实验次数:

"It's almost like token spin is more the input. And really, the output is what you described of experimentation. And I think if we were orienting, like goals around experimentation, I feel like that, that might be the better framing of the outcomes."
「这几乎是代币支出更多是输入。而实际输出就是你所描述的实验。我觉得如果我们围绕实验设定目标,我觉得那可能是结果的更好框架。」

这是语料里第一次有人对"token maxing"这个口号做出限定——而且说话的人来自卖 token 的那一方。

2026-08 新增:Stripe 给这条 Jevons 补了一个带斜率的读数——而且明说不是为了省钱。 大多数 Jevons 证词是"预算超了""让它跑",Stripe 的 CTO 给的是同一指标在半年里的两个点:

"we blogged about minions, I think in January, February, and they were doing 1,200, you know, PRs per week. And last week, I think 7,000 PRs came from minions. Wow. Yeah. And about 30% of our PRs in that week came from minions."
「我们在一月和二月左右写了关于 Minions 的博客,他们每周做 1200 个 PR。而上周,我想说有 7000 个 PR 来自 Minions。哇。是啊。在那一周,大约 30% 的 PR 来自小黄人。」(中文行把 Minions 译作"小黄人",照录)
Will Gaybrick(Stripe,Minions 内部编码 agent)· Stripe’s AI Strategy: Build More, Not Less

半年约 6 倍的 agent 产出增长,落到全公司 PR 的 30%。更要紧的是他们把用途讲反了——不是拿效率去砍成本结构:

"Companies have skewed in that direction where they've seen This new agentic efficiency and power as a way to optimize cost structure. Our belief, I'm being a little cheeky, but build everything."
「各公司都朝这个方向倾斜,把这种新的 agentic 效率与能力当成优化成本结构的手段。我们的信念——我说得有点调皮——是:把一切都造出来。」(中文为本文迻译)

这是本主题里第一份把 Jevons 的两端都摆出来的一线读数:投入侧(agent 产出 6 倍)与用途侧(明确不换成裁员,而是换成更多产品)。它离"账单弹性曲线"仍差一步——PR 数不是 token 数,30% 也不是钱——但比此前所有"CFO 让我们尽情花"的调查口径都硬。

第四点:"哪个模型最好"正在让位于"哪个模型能用最低价格解决这个任务"——模型路由 / quality-per-dollar 成了新的一层经济学。 这条以前只是 Baseten 论点的一个侧面,本轮已被 Harvey、Benchmark、Kevin Weil、Josh Elman、Glean、Sierra 从企业、投资、研究、消费多个互不相干的位置独立顶成共识。Gabe Pereyra 把它讲成一个从"能力受限"到"成本受限"的相变:

"Up until recently, we've always been capability constrained. And so we always wanted to use the largest model … But that has changed in the past six months where now we are consuming like a huge number of tokens."
「直到最近,我们一直受到能力的限制。所以我们总是希望使用最大的模型……但在过去六个月中,这种情况发生了变化,现在我们正在消耗大量的令牌。」
"Increasingly, it's not just which model is the best; it's which model can solve the task at the lowest price point."
「越来越多的人关心的不是哪种模型最好,而是哪个模型能以最低的价格解决任务。」

本轮 Glean 的 Arvind Jain 把这条从"工程实践"抬成"商业模式"——路由本身就是他们卖给企业的核心价值(cost control):

"90% or greater of use cases can now be fully handled by many, many different models, including open source models. So there is definitely commoditization from that perspective. In fact, like, you know, we at Lean, that's actually one of our core value adds to our customers, you know, which is cost control. … we actually pick the right model for you. And if you're okay with using open source models, we'll use them, you know, when we think it's appropriate, when it's going to generate a high quality answer."
「90% 或更高的用例现在可以通过许多不同的模型,包括开源模型,完全处理。因此,从这个角度来看,显然是商品化。实际上,像你知道,我们在 Lean,这实际上是我们为客户提供的核心价值之一,你知道,成本控制。……我们实际上会为你选择合适的模型。如果你愿意使用开源模型,我们会在认为合适的时候使用它们,以生成高质量的答案。」

Benchmark 的 Ev Randle 从投资人视角给了同一件事的镜像——他甚至把"高毛利"重新定义成了 AI 时代的红旗,因为它意味着没人真在用你的 AI:

"AI inference costs a lot of money. And if you have an AI product with high gross margins, that means that no one's using your AI features."
「AI 推理成本很高。如果你有一个毛利率高的 AI 产品,这意味着没有人在使用你的 AI 功能。」
Ev Randle · Benchmark's AI Bets

OpenAI 的 Kevin Weil 则点出了这层经济学的根源——推理不像传统软件那样边际成本趋零,它每次调用都真金白银地烧钱,这既是 B2B 先起飞的原因,也是路由必须存在的原因:

"Models also cost money to use. In a relative sense, much more than like traditional, you know, get a database and pay network costs and stuff like that. You start having costs right away as a business …"
「使用模型也需要花费。在相对意义上,比传统的……获取数据库和支付网络费用要贵得多。作为一家公司,你一开始就会产生成本……」

本轮 Lin Qiao 把这条共识从"挑模型"推进到"挑 token"——她指出比较单价本身就是个错误的比法,因为不同模型解同一个任务要吐的 token 数差好几倍:

"Not all tokens are equal. I think we should establish a best practice to evaluate the token economy per task, because different models have different ways of spitting out tokens. Some are much more verbose than the other. So you can imagine one model is 2x cheaper than the other, but it's 2x more verbose to solve the same task. And then they're the same cost."
「并不是所有的代币都是平等的。我认为我们应该建立一种最佳实践,以评估每个任务的代币经济,因为不同的模型有不同的发放代币的方式。有些代币的发放比其他的要冗长得多。所以你可以想象一个模型的成本是另一个的一半,但它解决同一任务的代币数量是另一个的两倍。然后它们的成本就一样了。」

她据此把优化拆成两个互不重叠的层次——"解一个任务少用 token"和"每个 token 更值钱"——第三层才是基础设施(GPU、内存、供应链)。这是本主题追问了两轮的那条缺口("降的是单价还是被 per-task token 量吃掉了")第一次拿到框架性的回答。

分歧在哪

阵营 A · "软件层是护城河"——Baseten / Modal 的立场

Tuhin Srivastava (Baseten) 把推理拆成两层并明确押注上层:

"GPUs as a service is not sticky. … Inference with the software layer included is incredibly sticky."
「GPU 即服务并不具备粘性。……包含软件层的推理则具有极强的粘性。」
"what is valuable to a company is the user signal that they can gather, that only they can gather. And to the extent that that is encoded In a model, I think a lot of their business will be at risk, but to the extent that it is encoded in workflows, that is where they will be able to develop modes."
「我认为对于企业来说,唯一有价值的是他们能收集到的独家用户信号。如果这些信号只编码在模型里,我认为他们的业务将面临很大风险;但如果信号编码在工作流中,他们就能建立起护城河。」

本轮 Modal 的 Akshat Bubna 是这条"软件层赢"最新、最具体的一票——他明确说,能不能找到 GPU、能不能跑模型早已不是差异点,弹性、真·scale-to-zero、跨 17 家云的可靠性层才是:

"with these endpoints, we are way more elastic, as you said, than anyone else. And you have true scaling to zero. You have true burstiness. And in practice, that matters a lot more to people than just finding the GPU and running model code."
「正如你所说,通过这些端点,我们比其他任何人都更加灵活。你可以实现真实的缩放到零。你可以实现真正的突发性。在实践中,这对人们来说比仅仅找到 GPU 并运行模型代码更重要得多。」

但 Modal 同时给阵营 A 埋了一颗自爆弹:他们把自己的推理性能优势(block-based speculator DFlash,带来 2–4x 加速)直接开源、上游进 SGLang——等于亲手把"软件层护城河"里最硬的那块技术抹平:

"by using open source DFlash, you can get the same performance as you would with one of the proprietary providers."
「通过使用开源的 DFlash,你可以获得与任何一个专有提供者相同的性能。」

也就是说,阵营 A 里 Baseten 押的"软件粘性"和 Modal 押的"弹性/可靠性"是同一类论点,但 Modal 恰恰在证明:软件层里可被量化复制的那部分(kernel、speculator)正在被从业者自己开源掉,长期能守住的只剩下不可复制的运营(多云容量、调度、可靠性)。这条内部张力此前语料里没有。

本轮 Baseten 自己的工程师给了同一条自爆弹的第二个独立证据。 当被问到"一个普通人拿到一台 B200 想自己托管,要做多少功课"时,Ali Taha 的回答等于承认那条乘法栈里的每一环都能白拿:

"You don't need to quantize the model yourself. There's always going to be like an open source quantized checkpoint. NVIDIA is going to push one out if no one else does. Usually the providers will have their own spec deck that they've trained as well. You don't need to train your own spec deck. You can just use that as well."
「你不需要自己量化模型。总会有一个开源的量化 checkpoint。如果没人发,NVIDIA 会发一个。通常供应商也会有他们自己训练好的 spec deck。你不需要训练自己的 spec deck,直接用就行。」

那护城河还剩什么?按他们自己的叙述,剩下的是运营与形态——disagg 部署第一次跑通"非常困难"、speculator 要和主模型抢同一块卡的编排问题、以及 Philip Kiely 提到的用量形态迁移(试用期按 token 付费,粘住之后转 dedicated 按小时租):

"if you're pushing like millions of tokens per hour, if you just pay per hour instead of pay per token."
「如果你每小时推送数百万个令牌,按小时收费会更便宜,而不是按令牌收费。」

值得记的是,这条"重度用户会从按 token 迁到按小时"如果成立,那么整个语料里以"token 单价"为坐标的争论,对最大的那批客户其实已经不适用了——他们买的是产能,不是 token。

2026-08 新增:阵营 A 终于有了一个可读的数字——而且是从阵营外递过来的。 我在前两轮持续下调这条护城河(Modal 把 DFlash 开源、Baseten 工程师自陈量化与 speculator 迟早都有开源版本)。Benchmark 的 Eric Vishria 从投资端给出的读数把这个下调按住了一半:变量控制得很干净——同一个开源模型、同一批 NVIDIA 硬件,差别只剩“谁在跑”:

"The performance difference for a Fireworks versus a cloud provider is like 5x. And that is just the speed performance."
「Fireworks 与云供应商之间的性能差异大约是 5 倍。而这仅仅是速度性能。」

他随即点出更难被外部看到的那一半——吞吐差异只有懂这门生意的经济结构的人才看得见:

"Then you add on top of that throughput, which is not visible externally, only visible if you know the economics of these businesses. And you're like, wait a minute, this is the same open source model with the same NVIDIA hardware. And there's a 5x performance difference and a multiple x throughput difference."
「然后你在此基础上加上吞吐量,这在外部是看不见的,只有当你了解这些业务的经济结构时才能看到。你会想,等一下,这是同一个开源模型,配同样的 NVIDIA 硬件,却有 5 倍的性能差异和数倍的吞吐差异。」(中文为本文迻译)

这条数字和"软件层正在被开源掉"并不矛盾,它精确地划出了分界线:能写成 checkpoint、能进上游仓库的那部分(量化、speculative decoding、kernel)确实在被开源掉;而"把一个 4 万亿参数的模型在真实流量下持续跑满"是运营,不是算法,外人连看都看不见。阵营 A 的正确形态因此应该收窄——护城河不在软件层整体,在运营 + 不可外部观测的吞吐经济学。注意信源立场:Vishria 是 Fireworks 的投资人,这个 5x 对他有利;但它至少是语料里第一个把变量控住的比较。

阵营 B · "开源在逼近前沿、模型层在被商品化"——记者与买方视角的怀疑

Stephanie Palazzolo (The Information) 给的是 Camp A 的直接反驳(英文原音、仅存中文,故转述):推理供应商被怀疑"不过是 GPU 经销商"——尽管融资凶猛,却很难证明其高估值;而且它们的命运被绑死在一条线上——开源模型相对闭源模型的性能差距,推理供应商本质上是这条 gap 的代理。

Redpoint 给了同方向的实证——switching cost 在塌(同为英文原音转述):他们组合里很多公司几天内就从 Anthropic 切到 DeepSeek、推理成本降 80–90%;LLM 之间切换成本极低,公司可以按成本 / 性能随意换供应商。

Benchmark 的 Ev Randle 把 Stephanie 那条"gap 决定命运"的抽象判断落成了一个具体机制——distillation(蒸馏):只要开源能持续逼到前沿的 95%,前沿实验室对 token 收溢价的能力就会被结构性压掉。

"if at any point it seems like capabilities are actually hitting an absolute ceiling, And distillation continues as it has historically. And the open source actually gets, you know, 95% as good as wherever the ceiling of capabilities tops out. That's a really scary situation for the Frontier Labs. … you'd have a much, much greater impact from open source depressing their ability to have pricing power and charge a premium for the tokens that they're producing."
「如果在任何时候似乎能力实际上达到了绝对上限,并且蒸馏仍然像历史上那样进行。而开源实际上可以达到您知道的能力上限的 95%。这对于 Frontier Labs 来说是一个非常可怕的情况。……开源会大大影响他们的定价能力,降低对他们所生产的代币收取溢价的能力。」
Ev Randle · Benchmark's AI Bets

本轮 Glean 的 Arvind Jain 把这条怀疑从"假说"推到了"正在发生"——他给了三个此前语料缺的硬判断:开源已便宜一个数量级、OpenAI 传闻要大砍价、以及"模型业务本身没那么赚钱":

"with open source, like, you know, it actually is an order of magnitude cheaper prices. I actually heard rumors that OpenAI was going to drastically reduce their model prices in response to these developments like competition as an open source."
「随着开源的出现,实际上价格要便宜一个数量级。我听说 OpenAI 可能会大幅降低他们的模型价格,以应对这样的竞争。」
"The model business on its own is actually probably not as lucrative as everybody believes, but these companies now have a lot more things. They're no longer model companies only."
「模型业务本身实际上可能没有大家想象中那么有利可图,但这些公司现在有了更多的业务。他们不再只是模型公司。」

Arvind 甚至给了一个时间表:三年内大多数企业负载会跑在开源模型上,而拐点就在 GLM 5.2 逼进前沿三个月内那一刻。Sierra 的 Clay Bavor 从另一端给了同一件事的供给侧解释——中国开源的强,本质是"蒸馏美国前沿模型",而美国实验室出于自保不会自己发布同能力的开源权重:

"if you can't build frontier models yourself, okay, maybe the next best approach is to distill them and offer them up."
「所以如果你自己不能建立前沿模型,好的,也许下一个最佳选择就是提炼它们并提供出来。」

阵营 C · "硬件可移植性是神话——但赢家也轮换"——Tri Dao 的双重立场

Tri Dao 既给 Nvidia 站台,又给挑战者留了门:

"I would say hardware portability is kind of a myth. Simply, you know, even for our Nvidia chips, like generation to generation, they change a lot … Even for Nvidia, every generation, they essentially have to rewrite all the code … So even hardware portability, even between generations, isn't quite there."
「我认为硬件可移植性有点像神话。简单地说,你知道,即使是我们的 Nvidia 芯片,从一代到一代,它们也发生了很大的变化……即使对 Nvidia 来说,每一代他们基本上都要重写所有代码……所以即使是硬件的可移植性,即使在几代产品之间,也还不够好。」
"Obviously, Nvidia is dominant for a couple of reasons. They design very good chips and they build very good software. And that creates this ecosystem where people build on that. … But I think certainly we'll see a lot of competitors entering the space as the workload starts to be a little bit more sort of coalescing around on the architecture side, you know, transformer and MOE and so on. It becomes a little bit easier to design the chips for that kind of workload, right?"
「显然,Nvidia 占据主导地位有两个原因。他们设计出非常好的芯片,并且构建非常好的软件。这就创造了一个人们在此基础上构建的生态系统。……但我认为,随着工作负载开始更多地围绕架构方面(例如 Transformer 和 MOE 等)整合,我们肯定会看到很多竞争者进入这个领域。针对这种工作负载设计芯片变得容易一些,对吧?」

这一立场把战场推到 hardware-software co-design。

阵营 D · "agent 价格会被压到计算成本"——McGrew 的终局推演

Bob McGrew(OpenAI 前研究负责人) 给出最悲观(对推理供应商而言)的版本(该集英文原音、podwise 仅存中文,故以下为转述):因为竞争,agent 的价格可能被压到只剩计算成本,从而侵蚀掉一切建立在"专业稀缺"上的经济模式。他的比喻很直白——律师贵是因为时间稀缺;但一旦你把律师做成 AI 模型,就等于有了无限多个律师,于是它一点都不稀缺了。而价值会"逃"到哪里?McGrew 押的是:最有价值的机会在那些对"模型之外的领域"有深刻理解的应用——比如把 AI 接进既有业务流程的企业方案。

两条旧证词从两个相反方向打这个终局。一边补强:Harvey 的 Gabe Pereyra 观察到,Opus 4.7 比 5.5 贵 3 倍、性能只好 10–20%,而这种细微的性能差在多家供应商 + 开源追赶下会被互相压价:

"Opus 4.7 is three times more expensive than 5.5, but it's 10 or 20% more performant. But these are going to cause pressure on each other. And then if open source catches up, you're also going to have pricing pressure."
「Opus 4.7 的价格是 5.5 的三倍,但其性能仅提高了 10% 或 20%。但这些会相互施加压力。如果开源跟上了,你也会面临定价压力。」

另一边复杂化:OpenAI 的 Noam Brown 指出,在 test-time compute 时代,"一个 agent 值多少钱"根本不是一个固定数——模型能力是你投入预算的函数

"The capability of the model is a function of how much money you put into it, basically. If you give it a budget of $10,000, it can do a lot more than what it can do with a budget of $10. Give it a budget of $10 million, it can do even more."
「模型能力基本上是你投入多少钱的函数。如果你给它一个 10000 美元的预算,它能做的比拥有 10 美元预算时多得多。给它 1000 万美元的预算,它能做的更多。」

但 Noam 也给了 McGrew 阵营一个反向弹药——解一道给定难题的成本本身在按代际暴跌

"the cost of Disproving the Erdos unit distance conjecture drops by like 10 or 100x with every model release cycle, probably in some cases more. … Yeah, just go on vacation and come back two months later and then it's a thousand times cheaper."
「反驳 Erdős 单位距离猜想的成本在每次模型发布周期中下降了大约 10 或 100 倍,在某些情况下可能更多。……是的,放假去度假,过两个月再回来,然后便宜了千倍。」

2026-08 新增:Vishria 用云市场的收敛史给这条终局提了一个寡头式反例。 McGrew 的推演是"价格趋近计算成本 → 无差异化 → 中间层被压死",但 Vishria 指出 2014 年"AWS 会吃掉一切"的判断错得离谱,错因不在那些被碾死的公司,而在低估了市场本身的体量:

"Is AWS the biggest? I think it's like a 40-30-20 split. You ended up with an oligopoly of that. And even outside of those big three, you have CloudFlare, which is A cloud provider in a different sort, which is another $100 billion company."
「AWS 是最大的?我认为大约是 40-30-20 的划分。你最终得到了一个寡头垄断。即使在这三大巨头之外,你还有 CloudFlare,它是另一种云服务提供商,也是一家价值 1000 亿美元的公司。」

他的结论是这里存在大量零和式思维(转述)。注意这不是对阵营 D 的正面反驳,是对它的一个尺度修正:价格照样趋近成本、毛利照样被压,但市场足够大时,"低毛利"和"千亿美元公司"可以同时成立(AWS 本身就是低毛利生意)。这把"谁先死"这一问从"中间层会不会死"改写成"中间层会剩下几家"——而后者恰好是阵营 A(运营护城河)与阵营 F(开源摊平)在争的东西。

阵营 E · "在巨头打架的缝里挑窄市场"——Fal.ai 的策略

Fal.ai 的 Gorkem 和 Batuhan 选择根本不和 LLM 推理玩家正面打——他们的论点是 inference 经济学的现实是"分赛道":

"We chose to be a leader or play to be a leader in this fast-growing niche market rather than trying to go against Google or OpenAI or Anthropic."
「我们选择成为这个快速增长的利基市场的领导者,而不是试图与 Google 或 OpenAI 或 Anthropic 竞争。」
"Whenever something new comes up, we are the first one to optimize it. First one to adapt our inference engine to it."
「每当有新的东西出现,我们总是第一个优化它,第一个调整我们的推理引擎来适应它。」

阵营 F · "Diversity wins"——开源基础设施视角

vLLM / Inferact 的 Simon Mo 和 Woosuk Kwon 给的是另一种结构性预测:

"What we believe is diversity will triumph that sort of single of anything at all."
「我们相信多样性会战胜任何单一的事物。」
Simon Mo · Inferact
"Having this community all work together for this open-source, we have the execution beyond any single entity can have."
「拥有这个社区一起为开源项目努力,我们的执行力超越了任何单一实体所能达到的水平。」
Simon Mo · Inferact

Modal 本轮的"开源上游 DFlash"其实是这条阵营 F 的一个新注脚:连闭源推理平台都在把自己的性能优势喂回开源社区,这在为"多样性/开源赢"背书的同时,直接掏空了阵营 A 的软件护城河。

2026-08 补引(上一轮遗漏):vLLM 的 Simon Mo 给了这条阵营最强的一个定位比喻,以及一条被低估的采用动因。 先是定位——推理引擎不是中间件,是基础设施层,硬件厂商反过来要向它对齐:

"VLLM is an inference engine. It is kind of like databases and operating system and other critical software to power AGI, NVIDIA, AMD, Google. Their newest chip will make sure VLM can run on them. And in a lot of cases, they use VLM as a benchmark while bridging almost a 10x gap."
「vLLM 是一个推理引擎。它有点像数据库、操作系统这类驱动 AGI 的关键软件。NVIDIA、AMD、Google 的最新芯片都会确保 vLLM 能跑在上面。很多时候,他们把 vLLM 当作基准,同时弥合近 10 倍的差距。」(中文为本文迻译;"VLM"为转写瑕疵,指 vLLM)

更值得记的是采用动因——他给的不是价格,是控制权:闭源 API 的审核策略会对正当的专业工作流误伤,这本身就在把企业推向开放权重:

"If moderation is never solved, in the future people will go to open-weight by default because that is where you know for sure you can control your guardrail for trusted use cases."
「如果审核问题始终解决不了,未来人们会默认转向开放权重,因为那是你唯一能确保为可信用例掌控自己护栏的地方。」(中文为本文迻译)

这条在本主题里是新的:此前"企业转开源"的动因清一色是价格(Glean 的成本控制、Lin Qiao 的破产风险)。合规与误伤是一条与价格无关的独立推力——它意味着即使推理价格降到零,开放权重的采用也不会回落。他同时给开放权重的可持续性提了一个制度性的类比(转述):训练前沿模型的 CapEx 需要类似制药业的经济激励与商业授权来回流,否则没人有动力做下一轮。

阵营 G · "垂直整合到 SOL"——Nvidia / Nebius 的反向押注

Nvidia 的 Kyle Kranen 和 Nader Khalil 不接受"多样性赢"也不接受"软件层赢"——他们的逻辑是只有 hardware-model co-design 才能逼近物理极限

"Before trying to layer reality back in of like, why can't this be delivered at some date? Let's just understand the physics. What is the theoretical limit to like, how fast this can go?"
「在试图重新加入现实之前——比如,为什么不能在某个日期交付?——让我们先理解物理。理论上它能跑多快?」

本轮 Accel 增长团队从投资人视角给了同一逻辑的公司化身——Nebius 这类"垂直整合的下一代 hyperscaler"(自建数据中心、自研机架、自控软件栈),赌的正是"控住产能就能吃下指数级增长的推理需求"。这与阵营 F 的"多样性赢"在底层架构观上几乎对立。(逐字稿仅中文,故转述其对 Nebius 垂直整合"从数据中心到软件全拥有、以此高效交付推理"的判断。)

阵营 H · "把成本从 inference 挪回 training"——Engram 的第三条路

Engram 的 Dan Biderman 和 Jessy Lin 提出的路线跟前面所有阵营都不同:与其在推理端优化,不如在权重里内化上下文,用一次性的轻量训练换掉每次调用都要重读的巨型 system prompt——把 token 消耗砍两个数量级:

"The fact that you don't have to research things and re-read things and the fact that you don't have to write monstrous system prompts. … That can give you, you know, two orders of magnitude reduction in token inference consumption. … answer, you know, within 100 tokens what the best frontier models would consume 100,000 tokens."
「你不必研究事物和重新阅读事物的事实,以及你不必写出庞大的系统提示。……这可以让你,知道,减少两个数量级的令牌推断消耗。……在 100 个令牌内回答,而最佳前沿模型可能需要消耗 10 万个令牌。」

本轮 Dan Biderman 的第二场访谈(AI Memory)给了这条路线此前缺的系统级数字——把"长上下文很贵"从口号变成一个可量的物理事实:让 LLaMA-70B 读一篇维基百科文章,GPU 上的 KV cache 就膨胀到与整个模型权重同数量级:

"if you take a LLAMA 70D model and you load one article from Wikipedia … The brain state of the model when reading this few tens of kilobytes is like 80 gigabytes. 80 gigabytes on the HBM of the GPU. … And the entire set of parameters of this model would be like 140 or so gigabytes … this one article about Taylor Swift is like same order of magnitude memory consumption on the GPU. So it's highly memory inefficient. That's a systems problem."
「如果你拿一个 LLAMA 70D 模型,并加载一篇来自维基百科的文章……当模型阅读这几十千字节的内容时,其大脑状态就像是 80GB 一样。在 GPU 的 HBM 上有 80 GB。……而这个模型的所有参数总共大约是 140 GB……而这篇关于泰勒·斯威夫特的文章在 GPU 上的内存消耗也是同样数量级。所以它的内存使用效率非常低。这是一个系统问题。」

他也承认,这套"把 token 效率变成硬指标"的紧迫感是最近才起来的——反过来印证了主流共识第三点里 Jevons 的真实压力:

"One is token efficiency and cost, which is a major issue that wasn't actually an issue when we started the company late last year and became more urgent now."
「首先是令牌效率和成本,这是一个重大问题,当我们去年年底创办公司时并不是一个问题,现在变得更加紧迫。」

值得记的是,第一场 Engram 访谈里坐着 Fireworks 的 Sonya Huang,她对"agent 跑几天的巨额推理成本"给了推理供应商最赤裸的立场——高推理成本是好事

— Jessy Lin: "… I think a lot of what people are worried about these days is the huge inference costs of running these agents like for days on end."
— Sonya Huang: "High inference costs a good thing."
— Jessy Lin: "I mean, consuming tokens for what?"
— Shaun Maguire: "Sonya works at Fireworks. She really loves it."
— Sonya Huang: "I love inference."
「——Jessy:人们现在最担心的是持续几天运行这些代理的巨额推理成本。——Sonya:高推理成本是件好事。——Jessy:我是说,消耗代币是为了什么呢?——Shaun:Sonya 在 Fireworks 工作。她非常喜欢这份工作。——Sonya:我喜欢推理。」
Memory and Continual Learning: Engram

这段对话把整个主题的张力压成了三行——供应商爱推理成本,客户想消灭它,而 Engram 想把它挪到别处。

2026-08 新增:Engram 自己把这条路线的天花板说出来了,阵营 H 因此需要改写。 同公司的 Jack Morris 讲得很直白——从私有数据造合成数据再训练,会撞上一堵合成意义上的数据墙:

"It's kind of like a data wall in the synthetic sense where when you create synthetic data from D and train on it, you eventually hit this upper bound where like you've learned all of the synthetic data and then you have to do it again."
「这有点像在合成意义上的数据墙,当你从 D 创建合成数据并对其进行训练时,最终你会达到一个上限,像是你已经学习了所有合成数据,然后你必须重新进行。」

他也承认公司早期的曲线正是这个形状(转述:一开始画出来的就是那条会走平的蓝线,因为"一次性从 D 里能学到的东西有个自然上限"),出路是让训练递归地变难——用模型自己生成越来越难的任务把曲线重新抬起来。于是他把整件事重新表述成一个不再省钱的问题:

"how do you scale more compute given the same data?"
「在同样的数据下,你怎么塞进更多算力?」(中文为本文迻译)

这句话把阵营 H 的性质改了。 Dan Biderman 那一版是成本论证(10 万 token 的活用 100 token 干完、KV cache 省下来);Jack Morris 这一版是 scaling 论证——同样的私有数据,可以无止境地投入更多算力去榨深度。两者不矛盾,但结论方向相反:前者把推理算力省掉,后者把它挪到一个同样没有上限的地方去烧。如果后者才是这条路线的终态,那么阵营 H 就不是 Jevons 的解药,而是 Jevons 的第 N 个出口——推理账单降下去,训练/自我改进账单涨上来。语料里没有人对着这两个版本追问过一句:净 token 支出到底是降还是升。

阵营 I · "把便宜的推理推到端上"——Josh Elman 的消费侧视角

Josh Elman 与 a16z 的 Anish Acharya 在同一场对话里从消费 App 的角度接住了同一根线:Acharya 点出推理有实际边际成本、逼着消费产品从免费转向订阅,Elman 接着给出破局点——把简单推理下放到设备端:

"Because there's no zero marginal cost of distribution, inference costs money, you can't really build a mass market free product without a massive balance sheet."
「因为没有边际分发成本,推理要花钱,你其实不能没有庞大的资产负债表建立一个大众市场的免费产品。」
Anish Acharya(a16z,主持人) · What's Next for Consumer AI
"We're going to be figuring out with the models even that you can run on iPhones or on laptops, how to push more and more of the … less complex inference that needs to be done onto device to lower the cost … And then you only send the more complex stuff up."
「我们将会发现如何在 iPhone 或笔记本电脑上运行的模型中,通过将越来越多需要在设备上进行的……不复杂的推理转移到设备上来降低成本……然后你只发送更复杂的东西上去。」

本轮 Sierra 的 Clay Bavor 给这条"端上便宜"加了一个明确的边界:端侧能改善部分消费体验,但缓解不了服务器侧的根本瓶颈——前沿负载受限于手机的热功耗,只能回到数据中心那排 TPU/GPU。Elman 的"简单的放端上、复杂的送云端"和 Kevin Weil、Harvey、Glean 的"模型路由"其实是同一条经济学在多个层面(端/云、模型编排、供应商选择)的重复——都在为主流共识第四点背书。

阵营 J · "前沿智能需求无上限,成本地板是能源与算力"——Clay Bavor / Accel 的反 doom

Sierra 的 Clay Bavor 和 Accel 增长团队 给了对阵营 D "价格趋近计算成本 → 中间层被压死"最直接的一个反驳。他们不否认价格在跌,但把结论从"margin 归零、生意死"改写成"地板是真的、需求无上限、大家都在长"。Clay Bavor 的两块论证:一是需求端根本没到顶——

"So, I think we have not yet appreciated the unbounded demand for, call it frontier levels of intelligence."
「所以,我认为我们尚未充分认识到对,称其为,前沿智能水平的无边需求。」

二是成本端有一条物理地板——就算开源避开了托管前沿模型的 margin stack,最底层的输入仍是被约束的电力与 GPU:

"if you have unbounded demand for frontier level intelligence or GPUs to run open waste models and the rate limiter is the number of Blackwells and H100s you have, you end up with kind of a floor on the cost of tokens because you've got to pay for the energy, you've got to pay for the compute."
「如果你对前沿水平的智能或用于运行开放权重模型的 GPU 有无限的需求,而限制因素是你拥有的 Blackwells 和 H100 的数量,那么你最终会发现代币的成本有一个底线,因为你必须支付能源费用,必须支付计算费用。」

Accel 增长团队从投资端给了同一立场的宏观版本——token 消费的走向完全由 capability frontier 决定,只要能力还在涨,需求就会一路上修;但他们也点了 Jevons 的一个刹车条件:价值不回来,就会有 governor(制动器)

"it's only going as far as the value It receives back, right? And so there is going to be a governor against if we don't see value back from it."
「但它只会走到它所得到的价值,对吗?因此,如果我们没有看到价值回报,就会有一个制约因素。」

这条阵营 J 和阵营 D 并不是硬对立——两边都同意价格向成本靠拢,分歧在"然后呢":D 说地板足够低、无差异化、中间层死;J 说地板由能源/算力钉住、需求无上限,所以真正的约束会从"margin 竞争"转成"电力与 GPU 供给能不能跟上"。

本轮 Lin Qiao 把这条地板又往下钻了一层——不是能源、不是 GPU,而是一颗晶体管:整条制造链从来没有为 100 倍扩张设计过。

"We are bottlenecked by the lower part of the AI cake in terms of supply chain, being energy. Being energy, being chips, in the physical world, how fast we can manufacture. Because in the history, all these industries are designed for massive scaling. Speaking about 100x scaling, no one was designed for that. I talked with many manufacturers. It's kind of bottlenecked by small parts. Transistor."
「在供应链方面,我们被人工智能蛋糕的下层瓶颈困住,而能源是关键。能源、芯片,在物理世界中,我们能多快制造。因为在历史上,所有这些行业都是为大规模扩展而设计的。说到 100 倍的扩展,没有一个行业是为此设计的。我和许多制造商进行了交谈。这有点被小零件瓶颈困住了。晶体管。」

她同时给了这条约束一个期限:一年到一年半内不会变,两三年后会松——这恰好和她的"三年 10x 降价"是同一个时钟。也就是说阵营 J 在本轮拿到了一个内部一致的时间模型:短期供给绑死、价格降不动;中期供给松开、降价兑现、用量放大 100 倍。

阵营 K · "扩张到破产"——Lin Qiao 提出的买方侧硬约束

这是本轮新出现的一条线,它把推理经济学的落点从"谁赚得到钱"挪到了"谁付得起钱"。Lin Qiao 指出 SaaS 时代 PMF 约等于可持续生意,而这个等式已经断了:

"During SaaS time, product market fit and the doable business almost are equivalent to each other. … Now, product market fit and durable business are two separate concepts. … Customers want to pay them, and they really value their product, but they cannot scale because once they scale, they could scale into bankruptcy. Have you heard about scaling to bankruptcy? That's a real problem."
「在 SaaS 时代,产品市场适配和可持续商业几乎是等同的。……现在,产品市场适配和持久业务是两个独立的概念。……客户愿意为他们付费,并且他们非常重视他们的产品,但他们无法扩展,因为一旦他们扩展,他们可能会扩展到破产。你听说过扩展到破产吗?这是一个真正的问题。」

而且她认为在位者比初创更危险,因为他们的流量正是负债:

"It's even a bigger problem for incumbents. … They have a huge amount of traffic. … Once they roll out those AI features, they're going to reach to all their customer base and they cannot afford to do it. Because the CFO look at their cost proposal, cost forecasting is kind of, there's no way you can justify this"
「对于现有企业来说,这甚至是一个更大的问题。……他们有大量的流量。……一旦他们推广这些 AI 功能,就会覆盖到所有客户基础,他们无法承担。因为 CFO 看着他们的成本提案、成本预测,你无法证明这一点。」

注意这条与阵营 J 的关系很微妙:Accel 说 Jevons 会有一个 "value governor"(价值不回来就刹车),Lin Qiao 描述的是同一个刹车已经踩下去的样子——只不过踩下它的不是价值判断,是 CFO 的成本预测表。而她给的解药,正好落回阵营 B 和 F:控制自己的开放权重模型。

2026-08 新增:Lin Qiao 给自己提的病开了药方,并且标了价。 上一轮她只诊断(PMF ≠ durable business、扩张到破产),本轮她把解法讲成一个两段论——先是护城河,后是单位经济:

"So then post-training becomes a very appealing solution because post-training allows you to basically encode, codify your unique taste Into a model that no one can steal from. Because it's very easy to clone and copy application as is, as you all know, right? From coding agent, it's very easy. So from screenshot, boom, generate the same or even better app."
「因此,后训练成为一个非常吸引人的解决方案,因为后训练让你基本上能够将你独特的品味编码成一个无人可以窃取的模型。因为像大家所知道的那样,克隆和复制应用程序是非常简单的,对吧?从编码代理来说,这很容易。所以从截图开始,生成相同或甚至更好的应用程序。」

关键是第二段,她把降本幅度直接说成了数字:

"And second is you can post-train a model that bring down the cost five to ten times."
「第二是你可以后训练一个模型,使成本降低五到十倍。」
"And then that means you can support five to ten times much higher traffic with the same budget. And your unit of economics of scaling is so much better than you avoid scaling into bankruptcy."
「这意味着你可以用相同的预算支持五到十倍更高的流量。而且你的扩展经济单位比避免破产要好得多。」

口号是 "own your own intelligence, not rent"——把"租智能"改成"拥有智能",而拥有的起点是数据(她的原话:intelligence is derivative of data)。她给的启动时点也很具体:PMF 之后才做后训练,因为那时才有足够量的真实生产数据(转述)。

要点有三。 一是这条把阵营 K 从纯诊断变成了完整闭环——扩张到破产的病因是"用别人的通用模型解自己的窄任务",药是把窄任务烧进自己的权重。二是它与本主题另外两条降本路径互不重叠:Baseten 的推理栈优化(量化 × speculator × disagg,约 2–4x)、Vishria 记录的运营层性能差(约 5x)、以及这里的后训练(5–10x)——三者原则上可以相乘,但语料里没有任何一集把它们叠在一起算过总账,也没人说过它们是否会互相抵消(后训练出的小模型未必吃得到同样的推理栈红利)。三是信源立场必须标注:Fireworks 卖的正是后训练与推理,5–10x 是卖方给的倍数,且这一集本身是一堂产品课,不是第三方评测。

顺带把阵营 K 与阵营 B 的连接补实:她的药方恰恰要求企业控制自己的开放权重模型——这也是为什么"开源商品化"和"买方付不起"在她这里是同一条因果链的两端,而不是两个独立观察。

都没说透的

我的看法

判断(不是事实):这场争论里"推理是新瓶颈"是共识、"价值落点"是分歧——而分歧更多是赌时间窗,不是赌终局。短期(1–2 年)软件层粘性是真的(多云协调、kernel 优化、长尾客户化),Camp A 对;中期(3–5 年)开源 stack 会把这层粘性吃掉一大半,Camp F 和 Camp B 对;长期 McGrew 的"价格 = 计算成本"成立的概率是高的,但前提是模型差异化继续收敛——如果某家实验室真做出代际差距大的模型,整个论断就反转。所以这套论点的强度很大程度上取决于 performance-plateau 这个主题的走向(见姊妹主题)。

我对这个判断的把握:中等。最强的一环是"开源 stack 长期吃掉中间层"——这条已被 vLLM 的实际市占验证,本轮 Glean 的"三年内多数企业负载跑开源""开源便宜一个数量级""OpenAI 传闻砍价"又给它加了买方侧的实测;连闭源推理平台 Modal 都在开源自己的性能优势,这几乎是自我实现。最弱的一环仍是"Jevons paradox 的净效应"——证词密度这轮暴涨,但依旧全是方向性判断,缺账单弹性数据。

上一轮我调整了一处:过去我把"路由 / quality-per-dollar"当成 McGrew 终局的前置动作,方向不变,但Dan Biderman 提醒我别把路由当免费银弹——它自己是未解的研究问题,判错成本没人量过。同时,Clay Bavor + Accel 的阵营 J 是当时见到的对"价格→零 margin→中间层死"最有力的反驳:它没否认价格在跌,而是把约束换成了物理地板(能源、GPU 供给)。所以我此前倾向认为,接下来两年真正的裁决变量不是"margin 会不会归零",而是"电力/先进封装/GPU 供给"与"企业预算弹性"这两条硬约束里哪条先绑住。

本轮我把这个判断收得更紧了一点。 Lin Qiao 的阵营 K 让我意识到,我一直把"企业预算弹性"当成一条会缓慢弯曲的曲线,但"scaling into bankruptcy"描述的是一个不连续的东西:不是预算慢慢用完,是 CFO 在成本预测表上直接否掉整个 rollout。如果这条在位者身上比在初创身上更常见(她的说法),那么推理需求的增长曲线可能不是平滑的 S 型,而是被一层一层的采购否决切成台阶——而每一级台阶的高度,正好由那一刻开源模型能便宜多少来决定。这让阵营 K 和阵营 B(开源商品化)实际上是同一条因果链的两端,而不是两个独立观察。

我对这一点的把握:中等偏低——它目前只有 Lin Qiao 一个信源,而她卖的正是这个问题的解药。需要一个买方侧的独立证词才能立住。

同时我下调了一点对"软件层护城河"的估计。上轮 Modal 开源 DFlash 我读作个案;本轮 Baseten 的工程师直接说量化 checkpoint 和 speculator "总会有开源版本、NVIDIA 不发也会有人发"——两个独立信源指向同一件事,那更像是这个层的结构性质而不是巧合。剩下守得住的确实只有运营(多云容量、disagg 编排、可靠性)和计价形态,而这两样都比技术更难被外部验证。

2026-08-24 增补:本轮我做了一次方向相反的修正。 前两轮我一路下调"软件层护城河",理由是从业者自己在把优势开源掉。Vishria 的 5x 让我意识到我把两件事混成了一件: 被开源掉的是"能写进仓库的东西",守得住的是"看不见的东西"——同模型同硬件下 5 倍速度差、数倍吞吐差,靠的不是某个 kernel,而是持续把巨型模型在真实流量下跑满的运营能力,而这恰恰是外部(包括我)最难证伪的部分。 所以我把阵营 A 从"正在被自己掏空"改判为"正在被切成两半,其中一半在快速贬值,另一半不可外部观测"。这不是升档,是把不确定性放回了正确的位置。

第二处修正更实质:我不再把阵营 H 当作 Jevons 的对冲。 Jack Morris 说出"同样的数据、怎么塞进更多算力"的那一刻,Engram 的路线就从省钱变成了另一条 scaling 曲线。 这意味着本主题里几乎每一条"降本"路线——路由、后训练、端上推理、上下文内化——最终都会被重新表述成一条新的花钱曲线。这不是巧合,是这个行业的默认动作:任何腾出来的算力预算都会立刻被更贵的用法吃掉。 如果这条观察成立,那么"推理成本会不会压死中间层"就是个问错的问题;该问的是"下一条吃掉盈余的曲线是什么"。

第三,关于降本倍数我保持怀疑。三条路径(2–4x / 5x / 5–10x)分别由卖推理栈、投推理公司、卖后训练的人给出,而且每一条都在暗示另外两条不够用。 在没有一份把它们叠在同一张账单上的第三方拆解之前,我倾向把它们当作三份销售材料,而不是三个可相乘的因子。

我对本轮修正的把握:阵营 A 那条中等(单一信源、有利益相关,但变量控制干净);阵营 H 那条中等偏上(是当事人自陈的立场位移,不是外部推测)。

还想知道什么

取材