主题综述
数字台账 · Numbers That Matter
教 AI 经济学与规模感的硬数字。同一主题族内按时间排序以显趋势线;相互冲突或彼此更新的数字相邻放置并标注对照;最亮眼的 20 条附逐字引用。
更新日志
- 2026-08-04 — 增量 +90 条(来自 59 篇 07-13..08-04 新访谈:Arena、Menlo、Gavin Baker、All-In×2、Chai Discovery、Poolside、Baseten、Decagon、DoorDash×2、Cognition、Base Power、Lumentum、Travis Kalanick×2、Whatnot、DHH、Friedberg、Sierra、Glean、Fireworks 等)。主题:开源与前沿的差距被拆成 3-4 个月与 6-9 个月两种口径,而 Arena 榜上美国最强开源模型前面站着九个中国模型;B200 集群七个月涨价 50-60%、token 支出吃掉 20-50% 的人力预算,把"成本坍塌"叙事翻到了另一面;机器人 $1/小时与单家企业 35 亿美元/年的叉车工资,给劳动预算替换定出上下沿;Anthropic 的 1/50 资本效率、$15 亿版权和解与 700 亿 ARR 构成本季最密集的单公司数字簇。
- 2026-07-16 — 增量 +42 条(来自 14 篇 06-22..07-01 新访谈:Fiona Fung、Gabe Pereyra、Jack Altman、Mark Chen、Engram、设计与AI、Josh Elman、Noam Brown、Radical AI、Kevin Weil、Scott Wu、Benchmark、Luma、Founders Fund)。主题:token 计费与模型路由的性价比经济学接棒成本坍塌叙事,KV cache vs 权重内化给出推理成本的物理下界,8x 人均产出与 $3,000/月/开发者标出 agent 时代人效与定价新锚,超大轮次流动性(一轮=35 个 Snowflake)重写估值尺度。
- 2026-07-02 — 首次全量构建:从 lens 数字抽取的 574 条原始条目中,去掉重复入库的同集数字、过编辑闸门后收录 250 条,按七个主题族归档;覆盖全部 283 篇访谈(2025-04 至 2026-06 入库)。
推理成本与算力经济
成本曲线:同等能力的推理价格以每年 10x—100x 的速度崩塌,而总消耗按 Jevons 悖论指数上升;算力与收入的换算关系首次有了公开口径。
- ~10x/年 — LLM 推理与训练成本每年下降约10倍,持续改善应用层公司的毛利结构——'模型变便宜利好应用层'的量化依据 · Jacob Effron, Scott Raney, Patrick Chase, Alex Bard (Redpoint) · 2025-04 · 访谈
- 80-90% — 多家组合公司在几天内从 Anthropic 切换到 DeepSeek,推理成本立降80-90%——证明模型层规模不构成转换成本护城河 · Jacob Effron, Scott Raney, Patrick Chase, Alex Bard (Redpoint) · 2025-04 · 访谈
- 97 倍/年 — Gemini 等文本模型的成本去年降低了 97 倍,Labs 据此假设视频模型会走同样的成本曲线。(→ 对照上一条:成本下降口径从 10x/年 刷到 97x/年) · Josh Woodward (Google Labs) · 2025-05 · 访谈
- 10-20x (GPT-4 -> GPT-5 Pro) — GPT-5 Pro 单次回答用的算力约是 GPT-4 的 10-20 倍就能给出好得多的答案——而对真正重要的问题,值得花的算力'大得不可比拟' · Jakub Pachocki & Szymon Sidor · 2025-08 · 访谈
- 10,000+ H100,6家云、24个数据中心、4国 — Fal管理的推理基础设施规模——一家专注生成媒体推理的公司需要的资本密集度 · Gorkem & Batuhan (Fal) · 2025-09 · 访谈
- 1.5x-10x vs 自托管 — 自研推理引擎(自定义CUDA内核+扩散缓存+量化)比自托管快最多10倍,但开源社区会不断追上——性能优势是持续赛跑而非一次性护城河 · Gorkem & Batuhan (Fal) · 2025-09 · 访谈
- ≥100x(自ChatGPT发布以来) — 推理成本三年降了至少100倍:一半来自同参数量的更好模型(数据+MoE架构),一半来自推理优化(量化、减少数据搬运、KV缓存管理)(→ 对照 2025-04 Redpoint 的 10x/年:三年累计口径吻合) · Tri Dao · 2025-09 · 访谈
- -5%性能 ↔ +3x生产力 — Triton这类跨芯片抽象层的经济学:放弃5%性能换3倍开发生产力是明确值得的交易——评估任何抽象层的标尺 · Tri Dao · 2025-09 · 访谈
- >40% of revenue — NVIDIA收入中推理占比已超40%——推理而非训练正在成为主要负载与增长引擎 · Jensen Huang · 2025-09 · 访谈
- 30x (Blackwell vs Hopper) — 极限协同设计带来单代30倍性能提升——摩尔定律死后靠全栈优化维持双指数下的token成本下降 · Jensen Huang · 2025-09 · 访谈
- 75 vs 50-65 points — NVIDIA约75%毛利 vs 竞品50-65%——但15%的折扣抵不过30倍性能差,即使ASIC免费也输在电力机会成本上 · Jensen Huang · 2025-09 · 访谈
- 200MW→$2B, 600MW→$6B, 2GW→$20B+ ARR — Friar 披露 OpenAI 2023-2025 三年算力与收入几乎 1:1 同比例增长(每 100MW ≈ $10 亿 ARR),这是其提前为 2028-2030 下注数据中心的依据 · Sarah Friar (OpenAI CFO) · 2026-01 · 访谈
"We exited at 23 at 2 billion in ARR, so 200 megawatts, 2 billion. We exited at 24 at 6 billion, so 6 billion, 600 megawatts. And we exited last year a little over 20 billion, 20 billion, 2 gigawatts. Actually, it's been accelerating."「我们 23 年收官时 ARR 是 20 亿美元——200 兆瓦对 20 亿;24 年收官 60 亿——600 兆瓦对 60 亿;去年收官略超 200 亿——2 吉瓦对 200 亿。而且这个比例还在加速。」Sarah Friar (OpenAI CFO) · Episode 12 - State of the AI Industry
- 400K-500K GPUs 24/7 — 仅凭小样本统计估算,vLLM 常年运行在 40-50 万块 GPU 上(含 Amazon Rufus 等),一个开源推理引擎已成为事实基础设施 · Simon Mo & Woosuk Kwon · 2026-01 · 访谈
- -99% cost; 2x capability / 7 months — 获取前沿模型的成本下降99%、能力每7个月翻倍——AI进步速度与通缩的核心刻度 · David George (a16z Growth) · 2026-01 · 访谈
- 150x drop/21mo (GPT-4级); 88x/11mo (o1级) — 同等能力模型的 token 价格崩塌速度——在收入和用量疯涨的同时发生,是被市场噪音掩盖的最重要信号之一 · Elad Gil & Sarah Guo · 2026-02 · 访谈
"The cost of a million tokens on an O1 equivalent model in December of 24 was about 26 bucks. And then in November of 25, it was 30 cents. So we saw another 88X drop, not 88%, you know, 88 times cheaper in 11 months for that next generation of models."「o1 等级模型一百万 token 的价格,24 年 12 月约 26 美元,25 年 11 月只要 30 美分——又一次 88 倍的下降。不是 88%,是便宜 88 倍,只用了 11 个月。」Elad Gil · From SaaS to AI-First
- 1000 pJ vs 1 pJ — 把参数从SRAM移到乘法单元花约1000皮焦,而乘法本身只要1皮焦——batching存在的能源经济学根源 · Jeff Dean (Google) · 2026-02 · 访谈
- $200M tape-out vs 20% savings on $1B+ inference — 10亿美元级训练意味着推理支出必须超10亿才能自负盈亏,此时省20%推理成本即可覆盖2亿美元流片费——定制ASIC的约束是时间线不是钱 · Martin Casado & Sarah Wang (a16z) · 2026-02 · 访谈
- 12-20 W — 人脑功耗仅相当于一只昏暗灯泡——对比AI模型能耗,说明效率仍有数量级提升空间 · Elad Gil & Sarah Guo · 2026-02 · 访谈
- ~20瓦 — 人脑用20瓦完成认知——Rao 30年前的顿悟起点,也是模拟计算路线宣称可大幅削减AI功耗的基准参照(→ 对照上一条:同一个 20 瓦锚点,两位讲者独立引用) · Naveen Rao & Konstantine Buhler · 2026-02 · 访谈
- 99% from AI-native companies — 按推理次数算99%来自AI原生公司——说明企业市场几乎未开发,是机会的量化下限 · Tuhin Srivastava · 2026-05 · 访谈
- 95% of token volume — Baseten上95%的token量涉及特定模型修改/后训练——'vanilla开源直接用'的时代已结束 · Tuhin Srivastava · 2026-05 · 访谈
- 3-5yr term + 20-30% TCV prepay for 1,000 H100/B200 — 顶级云买千卡的门槛条款——说明算力采购已变成重资本长周期豪赌,倒逼推理公司尽早上市 · Tuhin Srivastava · 2026-05 · 访谈
- 90 clusters / 18 clouds; mid-90s% utilization; 30x growth — 供应紧缺比外界想象严重:几乎无闲置算力,需跨18云抽象出运行时织物来保SLA · Tuhin Srivastava · 2026-05 · 访谈
- 100 步 → 4-8 步 — 通过蒸馏让小模型学教师模型的简化输出分布,用 4-8 步达到原 100 步的生成质量——配合 <100ms 的实时交互延迟硬门槛,是实时视频生成的成本关键 · Ethan He · 2026-06 · 访谈
- 10x/year — 模型效率年增10倍但总消耗指数上升——杰文斯悖论的实时案例 · Brendan Foody · 2026-06 · 访谈
- 10x/年 — AI 工作负载年增速把硬件推到物理极限,是数据中心硬件从公用品变高利润品的根因 · Alex Sacerdote (Whale Rock Capital) · 2026-06 · 访谈
- 3 倍价格 ↔ 10-20% 性能(Opus 4.7 vs 5.5) — 前沿模型边际性能的边际成本急剧递增,是模型路由(routing)成为运营必需的直接论据;但多模型商互相施压+开源追赶会抑制定价 · Gabe Pereyra (Harvey 联合创始人) · 2026-06 · 访谈
- 约 7 倍(Gemini 3.5 Flash vs 前沿模型完成速度) — benchmark 应按每美元/每秒质量切分而非只看总分——性价比权衡才支撑生产级选型决策(Niko 的数据) · Niko (Harvey 研究员) · 2026-06 · 访谈
- 100x(100 tokens vs 100,000 tokens) — 把组织上下文训进权重后,模型可用约 100 token 回答前沿模型需读 10 万 token 上下文才能答的问题——两个数量级的推理成本削减,是权重内化取代 RAG 论点的核心经济学 · Dan Biderman & Jessy Lin (Engram) · 2026-06 · 访谈
- 80 GB HBM / 一篇维基文章(模型全权重才 ~100 GB) — 一篇几十 KB 的文章的 KV cache 在 70B Llama 上要占约 80GB 显存,而记住了"整个互联网"的全部权重也才约 100GB——梯度下降的信息压缩效率远超 KV cache,是把推理成本转移到训练侧的物理依据 · Dan Biderman & Jessy Lin (Engram) · 2026-06 · 访谈
"And the entire weights of the model would be about 100 gigabytes. And, you know, with some distortion, they remember the entire Internet. ... Whereas this KVCache thing, you take a few tens of kilobytes of article and it becomes those 80 gigabytes of brain state."「整个模型的权重大约是 100GB。而且,他们在一定程度的失真下,记住了整个互联网。……而这个 KVCache 的东西,你用几十 KB 的文章,它就变成那 80GB 的脑状态。」Dan Biderman (Engram) · Memory and Continual Learning: Engram's Dan Biderman and Jessy Lin
- 1000x 更小 — 若离线花计算把 80GB 的 KV"脑状态"压缩进权重/适配器,加载体积可缩小三个数量级,对速度和保真度都有巨大影响(→ 对照上一条:同一账本的解法侧) · Dan Biderman & Jessy Lin (Engram) · 2026-06 · 访谈
- $1,000–$100,000(ballpark) — 用公开模型 5.5 + 通用 scaffold 复现 Erdős 单位距离猜想反证的推理成本:已发布模型中埋着大量"低垂果实",没人系统投入六位数推理算力去推公开模型的极限 · Noam Brown (OpenAI) · 2026-06 · 访谈
- 10–100x / 模型发布周期(每 2-3 个月) — 解决同类复杂问题的成本随每代模型的下降幅度:推理成本坍塌快于探索速度,造成"等下一代模型"比"榨干当前模型"更划算的怪异经济学(→ 对照 2026-02 Elad Gil 的 88x/11mo:周期口径再刷新) · Noam Brown (OpenAI) · 2026-06 · 访谈
- ≈95%/次查询 — 把低复杂度但高频的任务后训练到开源模型上的成本节省(引用 Cognition 的工作)——模型路由/编排层的经济价值来源 · Ev Randle (Benchmark) · 2026-07 · 访谈
- 5-6% MFU — 科学模型 RL 训练栈的平均浮点利用率只有 5-6%:GPU 标称峰值算力实际只用到零头,优化训练栈是比买更多 GPU 更大的未开发杠杆 · Andy Beam & Rafa Gómez-Bombarelli · 2026-07 · 访谈
- 8:1 → 1:1(GPU:CPU) — 推理拐点之后 AI 工作负载的 GPU 对 CPU 配比从 8:1 变成 1:1,倒逼计算、存储、网络资源紧密共置——数据中心形态被推理经济改写的量化信号 · Akshat Bubna (Modal) · 2026-07 · 访谈
- 10x ↓ → 100x ↑ — 推理成本每压缩 10 倍预计触发 100 倍用量激增,当前正处 S 曲线爆发早期、瓶颈在供应链(→ 对照 2026-06 Brendan Foody 的 10x/年效率增速:杰文斯悖论的供需两侧口径) · Lin Qiao (Fireworks) · 2026-07 · 访谈
- 1000 万 tokens — 即使上下文扩到千万 token,context rot 依然存在——喂得越多模型越混乱、无法对数据整体推理,长上下文不是记忆问题的解(→ 对照 2026-06 Engram 的 80GB KV cache:同一条"预填充范式不可持续"的账) · Dan Biderman · 2026-07 · 访谈
- ~90% vs ~30% 毛利率 — 前沿 token 毛利约 90%、路由到自有数据微调的开源模型约 30%:省掉的是 margin 而不是算力,GPU 小时消耗反而上升——"换开源省一半成本"利好基础设施层而非利空 · Gavin Baker · 2026-08 · 访谈
- $2.5 → 近 $4/GPU 小时(7 个月,+50-60%) — 一家明星创业公司续租规格完全相同的数千卡 B200 集群,价格不降反升:旧 GPU 正在向上重定价,说明超大规模云厂商的存量算力严重 under-earn(→ 对照 2026-06 Roman Chernin 的 18-24 个月资本转化周期:供给仍未追上) · Gavin Baker · 2026-08 · 访谈
"They're renting the exact same size cluster, essentially identical in every way, B200, no differences. And they're hoping seven months later to pay just under $4 today. ... Instead, we're up, depending on the starting point, 50 to 60 percent in six or seven months."「他们租的是完全同样规模的集群,方方面面几乎一模一样,B200,没有差别。而他们希望七个月之后的今天付的价格是略低于 4 美元。……结果我们反而涨了,看从哪个起点算,六七个月里涨了 50% 到 60%。」Gavin Baker · Gavin Baker - AI Market Jitters
- 便宜 80-90%(Kimi、DeepSeek 等) — 企业已在 OpenRouter 上按可用性与数据留存策略动态选供应商,投资组合里 9/10 的初创都在拥抱开源,构成对前沿实验室的巨大定价逆风(→ 对照 2025-04 Redpoint 切 DeepSeek 的 80-90%:一年半后同一折价带从个案变成常态) · All-In(Chamath、Sacks、Friedberg、Calacanis) · 2026-08 · 访谈
- 便宜 ~50%(Kimi K3 vs Opus 4.8/GPT 5.6) — Moonshot 开源模型与前沿同级但价格减半,直接引爆华盛顿关于禁中国开源模型的辩论(→ 对照上一条:折价幅度随"同级"定义收窄) · All-In hosts · 2026-08 · 访谈
- 60 倍(QR 分解,Blackwell 级硬件) — 人工优化的定制内核比通用库快 60 倍,因此自动生成内核是解锁此前无法规模化运行的新架构实验的关键瓶颈(→ 对照 2025-09 Tri Dao 的"放弃 5% 性能换 3x 生产力":抽象层的代价在此被具体标价) · Jerry Tworek & Rohan Anil · 2026-08 · 访谈
- 约 2×2×2 倍;30-40 → 300-400 token/s — 量化约 2 倍、投机解码约 2 倍、prefill/decode 分离约 2 倍——推理优化追求的是 4-10 倍数量级堆叠而非从 70 分到 90 分的增量,落地口径是解码速度从每秒 30-40 token 提到 300-400 · Philip Kiely & Ali Taha (Baseten) · 2026-08 · 访谈
训练与 CapEx
两条主线:数据质量 > 数据数量(专家数据溢价成为行业定价);capex 从美元计价换成吉瓦计价,回本算术仍没有答案。
- 10-15% — 只有当任务对业务工作流至关重要、额外10-15%的性能提升有决定性价值时,才值得做强化微调,否则等下一代模型即可 · Isa Fulford (OpenAI) · 2025-04 · 访谈
- 对数线性(log-linear) — 模型智能与训练计算量呈对数线性关系——每个智能增量都要求计算量指数级增长,预训练收益递减是固有的而非意外。 · Bob McGrew (OpenAI 前研究主管) · 2025-06 · 访谈
- 全部数据中心跑数月;下一代需新建数年 — 一次预训练要占用所有数据中心几个月,而下个模型需要一座新数据中心(数年工期)——解释预训练节奏为何被基建锁死。 · Bob McGrew (OpenAI 前研究主管) · 2025-06 · 访谈
- ~100 个样本 — 强化微调(RFT)达到领域前沿能力所需的数据量级——远比 SFT 数据高效且不易出错。 · Michelle Pokrass (OpenAI) · 2025-06 · 访谈
- 10%→50% 通过率 — 如果微调能把通过率从 10% 提到 50% 但仍不够产品化——说明该能力在风口浪尖,几个月后的新模型会直接碾压它。 · Michelle Pokrass (OpenAI) · 2025-06 · 访谈
- 数十亿美元(高估一个数量级) — 有公司在 SFT/RLHF 遗留数据上花了数十亿美元,但实际所需少一个数量级——众包标注模式正在崩溃,钱正流向专家评估 · Brendan Foody (Mercor CEO) · 2025-06 · 访谈
- 3.6–3.9 bits/parameter (fp32 transformer) — 「Morris 常数」:32 位精度训练的 Transformer 每个参数只能存约 3.6-3.9 比特信息,32 位里只用了 3-4 位,说明模型存储效率有巨大改进空间 · Jack Morris · 2025-07 · 访谈
- 1,000 条人工 > 10,000,000 条合成 — 一千条高质量精选人工数据对模型训练的价值可超过一千万条合成数据 · Edwin Chen · 2025-07 · 访谈
- 99% 无用 — 客户花六个月攒了 1000-2000 万条合成数据,最后发现 99% 没有价值——合成数据被普遍高估 · Edwin Chen · 2025-07 · 访谈
- $500B Stargate (Abilene ~10%) — 星门初始承诺 5000 亿美元、钱不在银行账户里边建边融——为下一代 AI 服务融资建设史无前例算力 · Sam Altman · 2025-08 · 访谈
- 10-100x — 今天能提供的服务与 10 倍乃至 100 倍算力能提供的服务之间'差距大得不可思议'——算力需求远未饱和是 Stargate 的核心论据 · Sam Altman · 2025-08 · 访谈
- 30名研究生×2年 ≈ 随机水平 — DCLM研究:最顶尖的人类专家花两年设计过滤标准后,仍无法以高于随机的准确率预测数据质量分类器的判断——人工直觉在数据筛选上失效 · Ari Morcos · 2025-08 · 访谈
- ~$500B/年 — 全行业每年AI基础设施支出约5000亿美元——这是'更好的架构值多少钱'的分母:省10倍成本或提前1-2年到AGI都价值巨大 · Tri Dao · 2025-09 · 访谈
- 中位 $95/hr、顶级 $500/hr(vs 众包 ~$30/hr) — Mercor 专家中位时薪 95 美元、顶级专家 500 美元,是 Scale/Surge 众包范式的 3 倍——高盛银行家、医生律师给模型写评估的市场化价格,'高素质专家+善待'取代'低价众包' · Brendan Foody · 2025-09 · 访谈
- 10GW ≈ $400B — 每10吉瓦AI工厂约合4000亿美元,须靠承购收入+股权+债务三条腿融资——这是他回应'循环收入'质疑的账本 · Jensen Huang · 2025-09 · 访谈
"10 gigawatts is like $400 billion, something like that. And that $400 billion will have to be largely funded by their offtake, right, their revenues, which is growing exponentially. It has to be funded by their capital, the money they've raised through equity, and whatever debt they can raise."「10 吉瓦大约就是 4000 亿美元。这 4000 亿主要要靠他们的承购——也就是指数增长中的收入——再加上股权融资和能募到的债务来买单。」Jensen Huang · NVIDIA: OpenAI, Future of Compute, and the American Dream
- $200-500/次 — 单次微调运行本身很便宜,真正的成本不在算力 · Kyle Corbitt (OpenPipe/CoreWeave) · 2025-10 · 访谈
- ≥2周工程师时间(RL环境需数月) — 微调/RL的真实成本是前期搭建训练系统,外加此后每次改prompt都要重训带来的迭代变慢 · Kyle Corbitt (OpenPipe/CoreWeave) · 2025-10 · 访谈
- 七位数($1M+) — 大实验室在RL环境初创公司上的采购至少七位数,说明'环境'是RL scaling的核心瓶颈与生意 · Kyle Corbitt (OpenPipe/CoreWeave) · 2025-10 · 访谈
- $600B收入缺口 — $150B英伟达芯片≈$300B数据中心投资,按50%毛利需$600B终端收入回本——'客户的客户是否健康'至今没有答案 · David Cahn · 2025-10 · 访谈
"If you invest $150 billion in NVIDIA chips, that's about $300 billion of data center investments. And to pay that back, the person using the compute needs to earn a 50% gross margin. So there's about $600 billion of revenue that needs to get generated. ... The question behind the question was, is the customer's customer healthy?"「买 1500 亿美元的英伟达芯片,约等于 3000 亿美元的数据中心投资;要回本,用这些算力的人得按 50% 毛利挣出约 6000 亿美元收入。……问题背后的问题是:客户的客户健康吗?」David Cahn (Sequoia) · 20VC: Sequoia's David Cahn on The Winners and Losers in AI
- $40B/GW(Vera Rubin代$50-60B) — 行业改用吉瓦而非美元宣布交易,掩盖了每吉瓦约400亿美元、且宣布时仅10-20%资金到位的事实(→ 对照上一条与 Jensen 的 $400B/10GW:三个口径互相印证) · David Cahn · 2025-10 · 访谈
- 2x / 3个月 — AI模型规模与容量每三个月翻倍,要求系统性能每年增长10-16倍——远超摩尔定律,必须靠网络层创新补足 · Michael Kagan (Nvidia CTO) · 2025-11 · 访谈
- ~10x/年 — 'Huang-Kagan定律'斜率约每年一个数量级;产品节奏已从两年一代加速到一年一代,每代性能提升10倍 · Michael Kagan (Nvidia CTO) · 2025-11 · 访谈
- 数百-数千样本 — 强化微调只需数百到数千个样本即可定制模型,远比SFT数据高效,使应用层模型定制终于成立(→ 对照 2025-06 Pokrass 的 ~100 样本:量级一致) · Brendan Foody (Mercor) · 2025-11 · 访谈
- 100x smaller training runs — 机器人领域的训练算力比前沿 LLM 小约 100 倍,说明机器人瓶颈在硬件经济性而非软件 · David Owen & Yafah Edelman (Epoch AI) · 2025-11 · 访谈
- 数倍于最终训练 run 的开支 — 实验算力获得的资金是正式发布模型训练 run 的许多倍,成为反驳纯软件奇点的关键证据 · David Owen & Yafah Edelman (Epoch AI) · 2025-11 · 访谈
- ≈印第安纳州首府全城用电 — Anthropic/Amazon 数据中心用电接近一座州首府城市,Colossus 2 建设周期不到两年——扩张速度只受资金约束 · David Owen & Yafah Edelman (Epoch AI) · 2025-11 · 访谈
- 38亿条游戏片段 — Medal 积累的 3.8B 游戏剪辑构成人类巅峰行为数据集,是世界模型训练的独家底料 · Pim De Witte (General Intuition) · 2025-12 · 访谈
- ~$100B/年 — Stargate 每年千亿美元级算力投资,说明大厂在算力、能源、数据上的支出规模(→ 对照 2025-08 Altman 的 $500B 总承诺:这里是年化口径) · Jonathan Siddharth (Turing) · 2025-12 · 访谈
- 0.5B–10B 参数 — 企业定制模型的主流区间:小模型在保险承保等专有任务上比万亿参数大模型更快更准,且数据不外流——是永久需求而非过渡 · Jonathan Siddharth (Turing) · 2025-12 · 访谈
- 2-3人×~1年,2018-19年即可达GPT-3.5级 — 带着完整后见之明,几个有才华的人网起几台 GPU 盒子在 2018-19 年就能做出 ChatGPT 3.5 级模型——后训练技巧可换取大量有效算力 · John Schulman (Thinking Machines) · 2025-12 · 访谈
"You could have gotten something that was ChatGPT 3.5 level maybe back in 2018 or 2019 with a couple people."「你本可以在 2018 或 2019 年用几个人得到一些达到 ChatGPT 3.5 水平的东西。」John Schulman (Thinking Machines) · John Schulman on dead ends, scaling RL, and building research institutions
- 1人/1机/约半年 — NanoChat 由一人半年在单机上写成,是复现 chat 模型成本的当代上界 · John Schulman (Thinking Machines) · 2025-12 · 访谈
- $150/hr vs $22/hr — 专家给AI标注/生成数据的时薪对比教书时薪,解释了专家供给为何涌向数据业务(→ 对照 2025-09 Mercor 时薪:专家数据溢价已成行业定价) · Garrett Lord · 2025-12 · 访谈
- ≥50% — Surge目前一半以上业务已在纯文本之外(多模态数据),前沿数据需求早已越过语言模型 · Edwin Chen · 2025-12 · 访谈
- 2yr + 3-5yr lifetime — 今天设计的TPU两年后进数据中心、再服役三到五年——芯片设计必须预测2-6年后的ML计算形态 · Jeff Dean (Google) · 2026-02 · 访谈
- ~200 行 Python — MicroGPT:去掉效率优化后,训练 LLM 的核心算法只有约 200 行 Python——其余全部代码复杂度都来自效率需求 · Andrej Karpathy · 2026-03 · 访谈
"Training neural nets and LLMs specifically is a huge amount of code. But all of that code is actually complexity from efficiency. It's just because you need it to go fast. If you don't need it to go fast and you just care about the algorithm, then that algorithm actually is 200 lines of Python."「训练神经网络、尤其是 LLM,代码量巨大。但那些代码其实都是效率带来的复杂度——只是因为你需要它跑得快。如果不需要快、只关心算法本身,那这个算法其实就是 200 行 Python。」Andrej Karpathy · Andrej Karpathy on Code Agents, AutoResearch, and the Loopy Era of AI
- 落后数月 — 开源模型落后闭源数月且在收敛;对绝大多数消费级用例,当前开源模型已经够用,差距主要是资本支出 · Andrej Karpathy · 2026-03 · 访谈
- 15 years of capacity in 15 months — 微软以'15个月建成过去15年量级'的速度扩数据中心——史无前例的capex节奏,靠agentic系统而非线性加人来运营 · Satya Nadella · 2026-06 · 访谈
"We built in the last 15 months more Azure capacity than we built in the first 15 years."「过去 15 个月我们建成的 Azure 容量,超过了最初 15 年建成的总和。」Satya Nadella (Microsoft CEO) · The Rise of the Full-Stack Builder and Hyper-Leveraged Generalist
- 9 TFLOPs (original Transformer rig) vs 100s TFLOPs (single consumer GPU today) — 当年训练初代Transformer的机器性能不及今天桌下一块消费级GPU的零头——激进架构实验已平民化 · AI Research Legend(未具名Transformer元老,疑为Łukasz Kaiser) · 2026-06 · 访谈
- PB-scale storage ≈ GPU compute cost — 视频大模型训练本质是IO受限问题——存取PB级视频数据的成本与GPU算力成本相当 · Ethan He · 2026-06 · 访谈
- 18-24个月 — 资本转化为可售算力的物理周期:6个月内砸钱无用,一年半到两年才见产能——AI 基建的经济学节拍 · Roman Chernin (Nebius) · 2026-06 · 访谈
- ≈10 个数量级 — 预训练缩放规律保持有效的跨度:每次瓶颈都被更细致的研究/数据工程突破,"没有理由现在失效"——反驳"预训练已死"的核心证据,也是持续投资大规模预训练的依据 · Mark Chen (OpenAI CRO) · 2026-06 · 访谈
- 3–5 个/org — OpenAI 每个研究组织纳入主路线图的重大赌注数:少量大赌注给定向大额算力,其余留灵活算力池给经理自由分配——前沿实验室研究组合管理的实际粒度 · Mark Chen (OpenAI CRO) · 2026-06 · 访谈
- 10 万亿(实验验证的科学 token) — 不是原始数据而是实验验证过的推理轨迹(英语+工具调用+实验反馈的混合),万亿级规模开始出现涌现能力,参数劣势下仍能立即提升性能(→ 对照 2025-07 Edwin Chen 的 1,000 条人工 > 1,000 万条合成:质量口径从"人工精选"换成"实验验证") · Andy Beam & Rafa Gómez-Bombarelli · 2026-07 · 访谈
- 10 万亿参数 — 10T 参数模型目前还缺乏好的系统设计——瓶颈不是单颗芯片,而是把芯片互连成系统的"整体包" · Lin Qiao (Fireworks) · 2026-07 · 访谈
- 10-20% of GPU budget — 前沿实验室花在数据上的钱约为 GPU 支出的 10-20%:数据是算力的"规模互补品"(如汽油之于汽车),GPU 市场加速则数据需求同步放大,且比 GPU 更不商品化 · Anastasios Angelopoulos (Arena) · 2026-08 · 访谈
- 约 1/50 的资本 — Anthropic 早期用五十分之一的资本做到与 ChatGPT 同级的 benchmark——"引擎盖下有真货"的关键技术信号,也是 Menlo 敢在 pre-revenue 下注的依据 · Matt Murphy (Menlo Ventures) · 2026-08 · 访谈
"it was pre-revenue, pre-launch of the model, but all the benchmarks, you could see that they were kind of better or at the same level of performances as ChatGPT at the time. And they'd spent like, I don't know, a 50th of the capital."「当时还没有收入、模型也还没发布,但所有 benchmark 你都能看到,他们大致比当时的 ChatGPT 更好或处在同一水平。而他们花掉的资本,我说不好,大概只有五十分之一。」Matt Murphy (Menlo Ventures) · 20VC: Leading Anthropic's First Ever Round
- 基建 ~$800-900B/年 vs 基础模型 ~$100B/年 vs 应用层≈舍入误差 — AI 三层的年度经济结构:收入极度前置在基建层,"每年花一万亿的人终将需要应用来买单"(→ 对照 2025-09 Tri Dao 的 ~$500B/年:不到一年基建年支出口径近乎翻倍) · Jason Lemkin & Rory O'Driscoll · 2026-08 · 访谈
- 云 +82% YoY、营收 $119B(+24%)、首次负自由现金流 — Google Q2 顶线亮眼市场却暴跌:投资者患上"CapEx 焦虑",开始质疑万亿基建 2-3 年内的回报(→ 对照 2025-10 David Cahn 的 $600B 收入缺口:质疑从算术题变成现金流量表) · Jason Lemkin & Rory O'Driscoll · 2026-08 · 访谈
- 开源第 10 名(前 9 全是中国模型) — 美国最强开源模型在 Arena 总榜上只排开源第十,排在它前面的九个全部来自中国——美国开源生态整体落后(→ 对照 2026-03 Karpathy 的"开源落后闭源数月":差距的国别结构才是要害) · Anastasios Angelopoulos (Arena) · 2026-08 · 访谈
- 6-9 个月 — 中国开源模型与前沿的差距:Kimi 等以更低价格逼近前沿,"等效模型更便宜"的需求只会持续上升(→ 对照上一条与下一条:同一差距的三个口径) · Jason Lemkin & Rory O'Driscoll · 2026-08 · 访谈
- 3-4 个月 — 开源与真前沿的差距:中国模型是当前最好的开放权重选项,但"已追平"的观感来自拿新品对比"阉割版"美国模型(→ 对照上一条:同期两家给出 3-4 与 6-9 个月两个口径) · Ari Morcos & Rob Toews · 2026-08 · 访谈
- 118B 总参 / 8B 激活,预训练启动到发布 5 周 — "模型工厂"工业化流水线的产物:靠稀疏架构加持久性行为跑赢两倍参数量的模型;工厂唯一的核心优化指标是"研究员想法到实验结果的速度"(每月 1-2 万次实验) · Eiso Kant (Poolside) · 2026-08 · 访谈
- 120 天 — xAI 自任总承包、用第一性原理砍掉分包商层级后 120 天建成数据中心,而行业报价超过一年——AI 基建的真实工程下限(→ 对照 2026-06 Roman Chernin 的 18-24 个月资本转化周期) · Igor Babushkin (xAI) · 2026-08 · 访谈
- 最大 40B 参数(DisTrO) — 压缩 GPU 间通信带宽后,无需物理同址即可实时分布式训练 400 亿参数模型——挑战"必须集中式超算"的假设 · Karan Malhotra (Nous Research) · 2026-08 · 访谈
- 3-4 年(内存厂建设周期) — 供给周期与即时的 HBM 需求严重错配,芯片开发被内存调度能力卡住 · Tony Kim (BlackRock) · 2026-08 · 访谈
- 数年/座(磷化铟 fab) — 光学业没有台积电可外包——磷化铟是小众材料必须自建 fab,重资本加长周期造成需求暴涨下的结构性供给瓶颈(→ 对照上一条内存 3-4 年:AI 基建的两处物理卡口) · Michael Hurlston (Lumentum CEO) · 2026-08 · 访谈
定价·毛利·商业模型
定价锚正从软件预算(美国 ~$1T)切换到人力预算($20T—$80T);客服是第一个 ROI 完全可量化的用例。
- $450B vs $35B — 客服人力成本4500亿美元 vs 客服软件市场350亿美元:AI'按工作收费'打开的是十倍于软件预算的人力预算 · Jacob Effron, Scott Raney, Patrick Chase, Alex Bard (Redpoint) · 2025-04 · 访谈
- $200/月 — ChatGPT 顶级 SKU 定价——AI 公司能从第一天就向消费者收高价,商业模式质量高于上一代靠网络效应慢慢变现的消费公司。 · a16z 消费团队 panel(未具名) · 2025-06 · 访谈
- 10 小时工作/次 — Deep Research 类工具可替代十小时人工工作,使 $200/月 订阅对个人也容易合理化。 · a16z 消费团队 panel(未具名) · 2025-06 · 访谈
- $60T(全球 GDP 的 60%) — 全球 $100T GDP 中 60% 是人类劳动——AI 是能自主'干活'的劳动力而不只是生产力工具,这就是 KP 的顶层市场测算。 · Mamoon Hamid · 2025-08 · 访谈
- up to 80% — Decagon 客户把客服成本最高砍掉 80% 且同时改善解决率和满意度——AI 吃的是服务预算而非软件预算 · Martin Casado & Sarah Wang · 2025-08 · 访谈
- ~10x — 人力预算通常比软件预算大一个数量级——AI应用从'对标软件成本'切换到'对标业务问题'是收入天花板抬升的核心机制。 · Jesse Zhang · 2025-09 · 访谈
- 3-5x ROI → ~3x value capture — 给客户3-5倍投资回报最有说服力,自己约捕获所替代价值的三分之一;很多客户在AI代理上的花费已超过之前的客服CRM。 · Jesse Zhang · 2025-09 · 访谈
- 60-80% — AI客服完全跑起来后的良好解决率区间,具体取决于AI被授予多少执行动作的权限。 · Jesse Zhang · 2025-09 · 访谈
- 60-70% — Decagon 案例研究中部分大企业联络中心运营成本降低60-70%——大企业采购AI客服的第一衡量指标是效率,第二是客户满意度。 · Jesse Zhang · 2025-09 · 访谈
- 65% — Intercom 的 FIN agent 已解决约 65% 的进线客服工单——就业冲击的实证数据点。 · Nathan Labenz · 2025-10 · 访谈
- 17-20M agents — 全球联络中心历史人工座席规模;软件市场数百亿美元、AI 市场预计高数百亿——被低估的巨型市场。 · Ping Wu & Doug Leone · 2025-10 · 访谈
- ~25% — 联络中心约四分之一交互是创收型(销售/催收/挽留)——它不是纯成本中心,自动化的价值计算要重做。 · Ping Wu & Doug Leone · 2025-10 · 访谈
- $200-300/月 — ChatGPT顶级SKU $200、Google Ultra $250、Grok $300——消费者首次自发为软件付出此等价格,是'消费投资文艺复兴'的证据(→ 对照 2025-06 的 $200:顶级 SKU 价格带半年内扩到 $300) · Kevin Rose & Anish Acharya · 2025-10 · 访谈
- $20T vs $1T — 美国劳动支出约20万亿美元、软件仅1万亿——AI真正争夺的是那20万亿的劳动预算,而非软件预算(→ 对照 2025-08 Mamoon 的 $60T 全球口径) · Michael Barton (Coatue) · 2025-11 · 访谈
- $30T — 数字知识工作自动化对应 30 万亿美元的市场规模——AI 价值创造的本质是预算从人力转移到技术 · Jonathan Siddharth (Turing) · 2025-12 · 访谈
- $20k/年 收费的'功能' — 过去只算一个功能的东西现在能收 2 万美元,因为它替代的是一整个人头——定价锚从软件预算换成了工资 · 未署名嘉宾(AI 护城河圆桌) · 2025-12 · 访谈
- ~10亿用户中付费 <5000万 — 消费级 AI 最大的悬念:如何货币化剩余 95% 的用户——广告等新模式的空间所在 · David George (a16z Growth) · 2025-12 · 访谈
- 95% — OpenAI 95% 的消费者用户是免费的——这是其论证必须引入广告的经济学前提(→ 对照上一条:官方口径确认) · Sarah Friar & Vinod Khosla · 2026-01 · 访谈
- ~1B users / 30M paying; $1B+/month burn — 免费替代品未对付费造成价格压力;货币化10亿免费用户的上行空间远大于3000万付费者的降价风险,burn 主要来自研发(→ 再对照:货币化 10 亿免费用户成为消费级 AI 最大悬念) · David George (a16z Growth) · 2026-01 · 访谈
- +50%回收收入 — Salient做AI汽车贷款催收不只省成本,而是为客户多收50%的钱——'创造价值'比'节省成本'更难被替换 · a16z 合伙人(未具名) · 2026-01 · 访谈
- 5x收入 — Velex买断西班牙全部法律记录再叠加AI,收入翻五倍——围墙花园数据策略的量化案例 · a16z 合伙人(未具名) · 2026-01 · 访谈
- 5x+律师收入 — Eve自动化证据收集/医疗年表/索赔函后,原告律师可接案量与收入提升五倍以上 · a16z 合伙人(未具名) · 2026-01 · 访谈
- US software spend ~1% GDP vs white-collar payroll ~20% GDP — AI 的市场空间锚定在白领工资而非软件支出,因此影响将远超移动和云 · David George (a16z Growth) · 2026-01 · 访谈
- $20B topline; 3x capacity → 3x revenue — 每上一批推理算力都被100%订完——'不是泡沫'论的核心证据 · Anish Acharya (a16z) · 2026-02 · 访谈
- 80% / 20% — 各基础模型80%功能互为替代、20%是专家能力——多模型世界里聚合层(应用公司)价值的来源 · Anish Acharya (a16z) · 2026-02 · 访谈
- 8-12% of spend — SaaS只占企业支出8-12%;AI的真正大市场是切入人力预算,且转移已在发生 · Anish Acharya (a16z) · 2026-02 · 访谈
- 40x — 大科技的AI业务需增长40倍才能兑现,但相对其现有业务体量'其实不算多'——因为这是预算迁移而非净新支出 · Martin Casado (a16z) · 2026-02 · 访谈
- $20/月 → 数百/月 → 数千至数万/月 — tab补全约$20/月、高级本地模型数百美元/月、并行云代理预期数千到数万——'双子座悖论':工具越强,个体杠杆越大,愿付价格指数级抬升 · Cursor 团队(嘉宾未具名) · 2026-03 · 访谈
- 数万亿美元 — 即使今天暂停模型开发,现有能力仍有数万亿美元经济价值未释放——瓶颈是应用AI市场的不成熟而非模型智能 · Bret Taylor · 2026-03 · 访谈
- 70-90%(RAMP达90%) — Sierra客户全量部署后AI自动解决客服案例的比例;剩余进入人工的案例更难,平均处理时长反而上升但坐席满意度提高 · Bret Taylor · 2026-03 · 访谈
- 90%×90% → 99% — 推理模型90%正确+监督模型90%正确,链式串联后整体有效性达99%——'模型星座'架构的核心算术 · Bret Taylor · 2026-03 · 访谈
- 15-20% → 50-80% — Decagon将客服自动解决率提升的典型幅度——客服的ROI早已被内部追踪,所以极易量化论证,这是客服成为最清晰AI用例的原因之一(→ 对照 2025-09 Decagon 的 60-80%:口径一致,提升幅度补全) · Jesse Zhang · 2026-03 · 访谈
- 8x(对比文本) — 语音到语音模型的幻觉率是文本AI的8倍——语音是最大前沿但对企业场景尚未就绪,且人脑对口语'不对劲'极度敏感 · Jesse Zhang · 2026-03 · 访谈
- 六位数合同(零 ARR 时) — 客服是他们探索的所有想法中唯一让客户在其 ARR 为零时就愿签六位数合同的赛道——付费意愿即市场真实性的判据 · Jesse Zhang (Decagon) · 2026-03 · 访谈
- 20% 效率增益 — Legora 的 token 支出规则:不设预算而按机会成本算——多花 token 若能给工程师或用户带来20%效率提升几乎总是值得 · Jacob Lauritzen (Legora CTO) · 2026-06 · 访谈
- 10% / 90% — AI 让产品「表面」的10%极易复制,但边缘案例、审计日志、RBAC、规模稳定性这90%才是企业级软件的真壁垒 · Jacob Lauritzen (Legora CTO) · 2026-06 · 访谈
- $80万亿 — 应用层 AI 要切入的实体产业规模(金融、法律、医疗、物流)——五层蛋糕最顶层的市场体量(→ TAM 阶梯的最高一档:$35B 软件 → $1T 软件 → $20T 人力 → $80T 实体产业) · Jensen Huang · 2026-06 · 访谈
- $20 → $20,000 — Harvey 单次查询成本区间:简单起草 vs 十万份合同审查——agentic 工作流让同一产品内单任务成本方差达 1000 倍,是消耗计费失控焦虑的根源 · Gabe Pereyra (Harvey 联合创始人) · 2026-06 · 访谈
"We have simple like assistant type queries where you say, you know, draft me a document that a single query can cost $20. We have like a review product where you can upload 100,000 contracts and ask the models to review them. And some of those can cost $20,000."「我们有一些简单的助手类型查询,比如说,给我起草一份文件,而单个查询可以花费 20 美元。我们还有一个审查产品,你可以上传 100,000 份合同并要求模型进行审查。其中一些可能会花费 20,000 美元。」Gabe Pereyra (Harvey) · Harvey Co-Founder Gabe Pereyra on the Token Pricing Reckoning Coming for AI
- $250–300/月 — 顶级消费 AI 订阅价格(主持人 Anish Acharya 引用:ChatGPT $250、Grok $300、Gemini Ultra $300):消费者付费意愿惊人,但推理成本非零意味着没有巨额资产负债表就做不了免费大众产品(→ 对照 2025-10 Kevin Rose 期的 $200-300/月:价格带站稳) · Josh Elman (a16z) · 2026-06 · 访谈
- $15M/18个月(外包)→ $1M/3个月(内部+Devin) — Cognition 向企业卖的不是 token 而是明确定义的项目级 ROI:约 15 倍成本差、6 倍时间差 · Scott Wu (Cognition) · 2026-06 · 访谈
- 75-80% — Cognition 企业收入占比:刻意押注企业级真实代码库(5 万文件迁移、Java 7→8 之类重复任务)而非个人爱好者,认为这才是 agent 首个 PMF 场景 · Scott Wu (Cognition) · 2026-06 · 访谈
- $100K–$1M TAM — 新兴 bespoke 软件的可行市场规模(主持人/a16z 提出,Maeda 与 Bakaus 认同):开发成本坍缩使以前经济上不可行的小众市场变得可做——软件回归"数字主街"模式的经济学基础 · John Maeda (Microsoft) & Paul Bakaus (Impeccable) · 2026-06 · 访谈
- $3,000/月/开发者(≈$36,000/年) — 单个开发者在 Claude Code 上的自付支出:SaaS 时代整个客户 $50K ACV 就算不错,现在按"每开发者"收这个数还在涨——agent 把定价单位从席位许可变成白领工作量(→ 对照 2026-03 Cursor 的 $20/月→数千至数万/月:同一条价格抬升曲线) · Ev Randle (Benchmark) · 2026-07 · 访谈
"We were talking with developers and companies in our portfolio and they're like, yeah, we have Developers that are spending, you know, $3,000 per month themselves, like each on Cloud Code. So it's like, wow, okay, so that's $36,000 per developer."「我们与投资组合中的开发者和公司交流时,他们说,确实有开发者每个月自己花费 3,000 美元,像是每个人在 Cloud Code 上。所以就像,哇,好吧,那每个开发者是 36,000 美元。」Ev Randle (Benchmark) · Benchmark's AI Bets
- 九位数($100M+)合同 — 推理平台与初创公司之间的合同规模:传统 SaaS 几乎没有对任何客户的九位数合同,更别说对初创公司——P×Q×M 中的 P 可以极高,即使毛利低于 70% · Ev Randle (Benchmark) · 2026-07 · 访谈
- 10 倍(云合同续约涨价) — 早期云厂商先补贴获客、续约时提价 10 倍,企业由此留下疤痕——这是今天坚持模型无关架构、拒绝单一模型供应商锁定的根本原因 · Matan Grinberg (Factory) · 2026-07 · 访谈
- >90% 企业 AI 用例 — 开源/多模型即可覆盖九成以上企业用例,Glean 按任务动态选模型控成本,开源能以极低成本产出同质量答案时就用开源(→ 对照 2026-02 Anish Acharya 的 80%/20% 可替代性:商品化口径继续上移) · Arvind Jain (Glean) · 2026-07 · 访谈
- 70-80% 毛利约束 — 若早期就强加 70-80% 毛利率约束会扼杀创新——AI infra 层现阶段的低毛利是优先超增长与实验的战略选择(→ 对照 2026-07 Ev Randle 的九位数合同:P 可以极高,即使毛利低于 70%) · Lin Qiao (Fireworks) · 2026-07 · 访谈
- 35 亿美元/年(单家企业的叉车工资) — 一家供应链企业每年仅叉车操作工资就烧 35 亿美元——"只解决叉车这一件事"就是巨大市场(→ 对照 2025-11 Michael Barton 的 $20T 劳动预算:自上而下的 TAM 第一次有了自下而上的单点标价) · Travis Kalanick (Atoms) · 2026-08 · 访谈
- ~$1/小时(人形机器人运营成本) — 按每天 20 小时×365 天×5 年寿命摊销硬件成本;对比西方工厂工人 $20-40/小时,等于 90% 的劳动力成本压缩(→ 对照 2025-11 Epoch AI 的 $100k 机器人 vs $20k/年人力:换成摊销口径后结论反转) · 四位机器人公司 CEO(ANYbotics、1X、Boston Dynamics、Agility) · 2026-08 · 访谈
- 95%+ 自动化率(出售门槛) — 不等 100% 完美才卖:agent 吃掉绝大部分工作、留一小撮边角案例给人工监督,再用这撮反馈继续提升(→ 对照 2026-03 Bret Taylor 的 70-90%:可交付的自动化率门槛继续抬高) · Steijn Pelle & Frederik Branken (Lassie) · 2026-08 · 访谈
- 30% 成本降幅 → 客户不裁员而扩服务 — 支持成本降 30% 后客户并未裁员 30%,而是扩大服务覆盖——杰文斯悖论在企业 AI 的实证案例 · Jesse Zhang & Ashwin Sreenivas (Decagon) · 2026-08 · 访谈
- 90% 跑在微调开源模型上 — Decagon 的对话代理九成用微调后的开源模型,换取性能/延迟/成本"三重胜利",仅 10% 探索性新项目用前沿模型(→ 对照 2026-07 Arvind Jain 的 >90% 用例:应用层的开源占比与用例占比同时逼近九成) · Jesse Zhang & Ashwin Sreenivas (Decagon) · 2026-08 · 访谈
- 90%(他人主张的"现有模型即可覆盖的企业工作流") — 主持人引用"90% 企业工作流现有模型即可处理、只剩 10% 小众市场"的说法,Nitski 认为它只反映显性需求、忽略潜在需求(→ 对照上一条:同一个九成,一个当成本手段、一个当机会终点) · Osvald Nitski (Mercor CPO) · 2026-08 · 访谈
- 80%+ 毛利率 @ ARR 700 亿+区间 — Anthropic 在收入十倍增长的同时毛利率还在改善,被用作"这是自我强化的双寡头而非普通竞争市场"的核心证据(→ 对照 2025-08 Steph Palazzolo 的追问"毛利率是多少":两年后有了答案) · All-In(Chamath、Sacks、Friedberg、Calacanis) · 2026-08 · 访谈
- 20-30% → 需有到 60-70% 的可信路径 — AI 公司毛利率普遍只有 20-30%,投资人要的是能否讲清通往 60-70% 的路径——这是他给 AI 应用层定价的底层筛子 · Matt Murphy (Menlo Ventures) · 2026-08 · 访谈
- 数万亿美元(推理服务收入展望) — Altman 称即使在万亿美元级推理收入上只有适度利润率,也足以训练下一代巨型模型——所以蒸馏根本不入他的十大担忧 · Sam Altman · 2026-08 · 访谈
- 数百万美元/年(停更 16 年的软件) — 2004 版 Basecamp 于 2010 年停止开发,16 年后仍是几乎零开发成本的数百万美元业务——"成品软件"经济学的实证 · David Heinemeier Hansson (DHH) · 2026-08 · 访谈
增长与规模
收入爬坡的新基准线:$1B→$10B 从二十年压缩到一年;agent 采用曲线(任务时长每 4-7 个月翻倍)是能力侧最重要的单一指标。
- 4万→1500万 (2024.3→2025.3) — E2B 沙箱一年用量增长375倍,Claude 3.5/3.7 Sonnet 发布后显著加速,说明agent工作负载从实验转向生产 · Vasek Mlejnsky (E2B) · 2025-04 · 访谈
- 100x(近几年) — LLM 推理用量的疯狂普及等同2000年互联网、2010年移动的时刻,判定'现在是十多年来创业最佳时机' · Victor Lazarte (Benchmark) · 2025-04 · 访谈
- Mercor 11个月 / Brex 18个月 — AI 时代收入爬坡速度的新标杆,传统'$10M 收入即领先'的 SaaS 基准已失效 · Victor Lazarte (Benchmark) · 2025-04 · 访谈
- $300M — Cursor 达到3亿美元 ARR——AI 编码工具变现速度的行业标杆(从第一行代码到发布仅数月,增长为持续指数型) · Michael Truell (Anysphere/Cursor) · 2025-05 · 访谈
- 数小时 — Claude 4 解锁了连续数小时无人值守的代理任务(如大规模代码重构)——代理任务时长是能力代际的标尺。 · Ben Mann (Anthropic 联合创始人) · 2025-06 · 访谈
- ChatGPT > Twitter(25万粉) — 5 月 10 日至录制时,ChatGPT 给 Lenny's Newsletter 带来的流量已超过其 25 万粉丝的 Twitter——AI 平台作为分发渠道的拐点信号 · Robert McCloy (Scrunch AI) · 2025-07 · 访谈
- 流量6x / 转化率9x — 身份验证公司 Clerk 针对性优化 AI 想引用的内容类型后,ChatGPT 来源流量涨 6 倍、转化率提升 9 倍——AI 流量质量高于普通搜索 · Robert McCloy (Scrunch AI) · 2025-07 · 访谈
- 7亿活跃用户 — Meta AI 靠 Instagram 搜索兜底导流成为'沉默的怪物'——AI 爱好者圈几乎不讨论,但分发体量惊人 · Robert McCloy (Scrunch AI) · 2025-07 · 访谈
- 约90% — 她们估计 TikTok/Reels/YouTube Shorts 上约 90% 的内容已是 AI 生成——AI 视频从技术论坛玩具到吞噬主流信息流的规模刻度 · Olivia Moore & Justine Moore (a16z) · 2025-07 · 访谈
- $4B → $9B (Anthropic, 2025) — Anthropic 收入预测因 Claude Code 从今年 40 亿美元上调至 90 亿美元——但她反复追问:毛利率是多少?收入若是负利润率就没意义 · Steph Palazzolo · 2025-08 · 访谈
- 18% → 50%+(2月至今) — 视频模型占Fal收入份额从2月的18%涨到超过50%,由混元视频等高质量开源模型驱动——生成媒体的重心正快速从图像转向视频 · Gorkem & Batuhan (Fal) · 2025-09 · 访谈
- 全球第5大网站 — ChatGPT已是世界第五大网站,若保持轨迹将成为第一——'免费AGI'触达数十亿人的分发规模 · Sam Altman & Vinod Khosla · 2025-09 · 访谈
- $1M → $500M run rate(17 个月) — 自称史上最快收入增长,比 Cursor 从100万到5亿快一个月;Scale被收购后公司规模翻了4倍(同月另一期录制口径为 16 个月到 $400M——增速本身仍在加速) · Brendan Foody · 2025-09 · 访谈
- 6x vs Google search — Webflow 来自LLM的流量转化率是谷歌搜索流量的6倍——多轮追问把购买意图预先淬炼过,AEO线索质量远高于SEO。 · Ethan Smith · 2025-09 · 访谈
- 600M vs 3B MAU — AI答案引擎约6亿独立月活 vs Google搜索30亿——新入口渗透率已达老入口的1/5 · James Cadwallader & Martin Rehak · 2025-09 · 访谈
- ~2h, doubling every 4-7 months — METR 口径的 agent 任务时长曲线,衡量 agent 能力最重要的单一指标。 · Nathan Labenz · 2025-10 · 访谈
- multi-hour @50%, ~1hr @80% — 前沿模型在50%成功率下能做多小时软件工程任务,80%成功率下约一小时——且历代模型都落在同一条外推曲线上(→ 对照上一条 METR 曲线:历代模型落在同一条外推线上) · Sherwin Wu (OpenAI) · 2026-02 · 访谈
- 80% of AI startups (using open models) — 『80% AI 初创用中国开源模型』大概率为真,但只统计用开源模型的公司;按实际用量加权商业模型仍占多数。 · Nathan Labenz · 2025-10 · 访谈
- 30-40% of queries at peak — NanoBanana 上线后部分国家高峰时段 Gemini 查询中图像类占 30-40%——单一功能改变产品使用结构。 · Josh Woodward · 2025-10 · 访谈
- 2/3自建 vs 1/3外购 — MIT报告被误读的关键分母:企业2/3的AI项目是自建或咨询公司代建,外购专业初创方案的1/3成功率显著更高 · Garry Tan & Lightcone hosts (YC) · 2025-11 · 访谈
- ~5% — 企业AI需求汹涌但实施极难、仅约5%项目奏效——主持人认为这是初创公司的机会清单而非AI失败的证据 · Garry Tan & Lightcone hosts (YC) · 2025-11 · 访谈
- 70:30 — Sora上线初期创作者与消费者比例达70:30,远超社交产品常态,证明生成式AI能促创作而非只促消费 · Bill Peebles, Rohan Sahai & Thomas Dimson (OpenAI Sora) · 2025-11 · 访谈
- ~1/3 — 她引用OpenAI研究:约三分之一的ChatGPT使用是写作帮助——证明聊天框界面只解锁了简单用例 · Eugenia Kuyda (Replika/Wabi) · 2025-11 · 访谈
- ~10亿 — 已有近十亿人用AI聊天工具但只用于搜索/写作,说明瓶颈在界面而非需求 · Eugenia Kuyda (Replika/Wabi) · 2025-11 · 访谈
- $1→$100M revenue run rate in 11 months — Mercor 自称硅谷增长最快公司:11 个月内 ARR 从近零冲到一亿美元(→ 对照 2025-09 两期:$1M→$400-500M 用 16-17 个月——同一家公司的增速叙事逐月刷新) · Brendan Foody · 2025-11 · 访谈
- $0 → $100M(7个月) — Handshake AI靠给前沿模型供数据,7个月从零做到一亿美元业务——AI数据市场的爆发速度 · Garrett Lord · 2025-12 · 访谈
- $190M ARR — 法律AI应用层的收入标尺——垂直应用在模型商阴影下仍能快速做大 · Winston Weinberg · 2026-01 · 访谈
- 6x — 前沿企业的 AI 使用强度是中位数企业的 6 倍,企业侧能力差距巨大 · Sarah Friar & Vinod Khosla · 2026-01 · 访谈
- ≤30% — Khosla 估计大多数用户只用到了 AI 全部能力的 30% 或更少——需求瓶颈在人不在模型 · Sarah Friar & Vinod Khosla · 2026-01 · 访谈
- $0→$50M ARR — AI 公司创造了'四分钟一英里'式的新基准:见过别人从零到 5000 万后,任何不快速增长的公司都要先回答'为什么不能' · Vinod Khosla & Keith Rabois · 2026-01 · 访谈
- 365B searches: ChatGPT 2 yrs vs Google 11 yrs — ChatGPT 达到3650亿次查询只用了谷歌1/5.5的时间——AI建立在互联网+云之上可即时全球分发 · David George (a16z Growth) · 2026-01 · 访谈
- 2025 cohort +50% vs 2024; 2x companies to $10M ARR in 3 months — 2025年新公司队列增长快50%、三个月内达千万美元ARR的公司数翻倍——创业加速不是暂时异常(iOS发布+60%、GitHub push+41%) · Patrick & John Collison (Stripe 年度信) · 2026-02 · 访谈
- $1B→$10B: ~20yr (ADP/Adobe) → 8-9yr (Salesforce/MSFT) → 3-5yr (Google/Meta/AWS) → ~1yr (AI labs) — 收入从10亿到100亿美元所需时间的代际压缩——AI实验室预计一年走完 · Elad Gil & Sarah Guo · 2026-02 · 访谈
- 693% YoY; $1M revenue/FTE — 离群AI公司同比增速693%、人均收入高达100万美元——比SaaS前辈更快且销售费用更少 · David George (a16z Growth) · 2026-02 · 访谈
- ~$50B — 当前AI赋能收入约500亿美元、年增速远超100%,比早期云计算的采用曲线陡得多 · David George (a16z Growth) · 2026-02 · 访谈
- 0→$10M ARR(极短时间) — 本周期最大的不同:过去把'0到1'重定义为0到$1M ARR,如今公司以史无前例的速度冲到$10M ARR——启动资源更少、收入留存更好 · Alfred Lin · 2026-03 · 访谈
- $1B run-rate; 5T tokens/天 — 发布仅数天的 GPT-5.4(Codex)即达 10 亿美元运行率收入、日处理 5 万亿 token——模型改进周期在坍缩(5.1→5.2→5.3→5.4) · Brad Lightcap (OpenAI) · 2026-04 · 访谈
- 95%集中在前4-5个蓝链 — 人类认知带宽有限导致的旧SEO经济学——与agent的『无限带宽』形成对照 · James Cadwallader (Profound) · 2026-04 · 访谈
- 单次查询用65个网页 — 一个agent为回答『买哪个淋浴喷头』综合了65个网页——agent消费互联网的表面积远超人类(→ 对照上一条:人类认知带宽 vs agent 无限带宽,SEO 经济学的地基置换) · James Cadwallader (Profound) · 2026-04 · 访谈
- $25B annualized — 私有 AI 公司(OpenAI/Anthropic)在上市前就达到万亿美元估值和 250 亿美元年化收入,速度远超 Mag 7 历史轨迹 · Philippe Laffont (Coatue CIO) · 2026-06 · 访谈
- ~前几个百分点 — 即便技术先进的大公司也只用到潜在 AI 用例的极小部分——Chernin 用此论证基建热潮不是泡沫(→ 对照 2026-01 Khosla 的 ≤30%:供给侧与需求侧同一判断) · Roman Chernin (Nebius) · 2026-06 · 访谈
- 100-1000x — agent 普及后搜索查询量的预期放大倍数——现有搜索基础设施完全没有为这种吞吐而建 · Will Bryk (Exa) · 2026-06 · 访谈
- 10^12 → 10^15 页 — 从万亿页到千万亿页:agent 想要的世界数据远超当前索引,检索算法成本不能随规模指数化 · Will Bryk (Exa) · 2026-06 · 访谈
- ~2% — 会 C++ 编程的人口比例——40年来技术越复杂会编程的人越少,AI 用自然语言编程反转了这条技术鸿沟曲线 · Jensen Huang · 2026-06 · 访谈
- 数十万个 — NVIDIA 公司内部当前运行的 agent 数量——agent 经济在英伟达内部已先行落地 · Jensen Huang · 2026-06 · 访谈
- $2–$100/股 — Robinhood 推荐奖励股票的彩票式价值区间:拿到 $100 股票的人到处炫耀,拿到 $2 的人也觉得"拥有了一股"——变动奖励优于固定 give-10-get-10,获客成本不随竞价通胀(他亲历 Robinhood) · Josh Elman (a16z, ex-Robinhood) · 2026-06 · 访谈
- 13 万亿 tokens — Harvey 累计 token 消耗(主持人转述 Winston 的说法,Gabe 确认量级):垂直应用层公司已成为实验室最大的 token 消费者之一,用量爆炸发生在最近 6 个月 · Gabe Pereyra (Harvey 联合创始人) · 2026-06 · 访谈
- ≈3000 万人 — 全球会编程的人数(Weil 自己的估算):AI 把编程人口扩大几个数量级 → 创造力爆发——"高自主性者时代"论的分母(→ 对照 2026-06 Jensen 的 ~2% 会 C++:同一条技术鸿沟曲线) · Kevin Weil (OpenAI) · 2026-06 · 访谈
- ~$1M → $500M+(约20个月) — Cognition 收入增长(主持人引述,Scott 确认"不止于此")——AI coding agent 赛道收入曲线本身就是指数曲线的例证(→ 对照 2025-09 Mercor 的 $1M→$500M/17个月:新标杆彼此咬合) · Scott Wu (Cognition) · 2026-06 · 访谈
- $20-30M ARR — 企业 SaaS 的玻璃天花板(Trae 12 年观察):管理得当的公司都能到 2-3 千万 ARR,但穿越这条线的概率断崖式下跌——而市场正逼着 1-5 百万 ARR 的创始人讲"今年到 30"的故事 · Trae Stephens (Founders Fund) · 2026-07 · 访谈
- 900 万+开发者 — Supabase 的开发者规模:AI 代理充当后端选型"瓶颈"带来爆发增长——agent 最容易集成的基础设施赢得新时代的分发 · Accel 成长团队 · 2026-07 · 访谈
- 50%(Ask DoorDash 的新餐厅发现率) — 使用自然语言界面的订单轨迹中一半来自用户从未点过的餐厅,杂货购物篮同时增大 40%——界面换代实质性改变发现行为 · Andy Fang & Stanley Tang (DoorDash) · 2026-07 · 访谈
- <3% 渗透率 — AI 市场极早期且非零和:DeepSeek 发布也没让 Anthropic/OpenAI 崩盘,蛋糕扩张期人人都在增长,真正的份额争夺尚未开始(→ 对照 2026-01 Khosla 的 ≤30% 与 2026-06 Chernin 的"前几个百分点") · Ben Horowitz · 2026-08 · 访谈
- 约 25-50 万人(全球 agentic AI 用户) — 七八十亿人里只有几十万人在用 agentic AI,就已造成急性算力短缺——扩展到 1 亿、5 亿用户时的缺口可想而知 · Gavin Baker · 2026-08 · 访谈
- 1000 万用户(Codex) — Codex 从 0 做到官宣一千万用户(与 GPT-5.x 发布同期),这一分发底盘是把 agentic 能力泛化为 ChatGPT Work"超级应用"的直接底气 · Akshay Nathan (OpenAI) · 2026-08 · 访谈
- $100 亿 → $700 亿+ ARR(一年内) — 主持人用"史上最快规模化增长的科技公司"反证:这样的公司根本不需要政府保护,其反开源游说是监管俘获(→ 对照 2025-08 Steph Palazzolo 的 $4B→$9B 预测:两年内量级抬了近百倍) · All-In hosts · 2026-08 · 访谈
- ~$50B/年(传闻口径) — Lenny 称 Anthropic 据传年收入约 500 亿美元——相当于过去成功公司 IPO 时的整体估值,而公司成立仅约三年(→ 对照上一条 $700 亿+:同月两个流传口径相差 40%,且均为转述) · Dianne Penn 访谈(主持人 Lenny 引述传闻) · 2026-08 · 访谈
- 0 → ~$300M ARR(一年) — Lovable 一年从零冲到约 3 亿美元 ARR,Menlo 在约 $150M ARR 时以 $6.2B 轮次入场:即便增速衰减到 3x 也能从 3 亿推到 10 亿 ARR——outlier 中的 outlier · Matt Murphy (Menlo Ventures) · 2026-08 · 访谈
- 六个月内客户用量 11-12x、出货代码总量 7x — AI 编码已存在三四年,但过去六个月才是真正的爆发拐点——衡量口径是结果(合并 PR、上线代码)而非 token 量 · Scott Wu (Cognition) · 2026-08 · 访谈
- ~1000 件/季 → 数千万件 — 光模块订单从电信时代每季几千件的利基量级,跳到超大规模云厂商按百万、千万件下单——整个光学行业首次面对这种规模 · Michael Hurlston (Lumentum CEO) · 2026-08 · 访谈
- $10 亿广告收入(史上最快达成) — DoorDash 成为史上最快达到 10 亿美元广告收入的公司,靠的是拒绝在广告主回报与消费者体验之间二选一 · Tony Xu (DoorDash CEO) · 2026-08 · 访谈
- 已超过中国国内电影票房(微短剧) — 小阵容加少场景的高产量低成本模式与当前 AI 能力完美匹配,美国市场正快速跟进 · Justine Moore (a16z) · 2026-08 · 访谈
人效与组织
AI 写代码的占比、单人杠杆与组织形态:人均产出取代人头数成为核心指标,token 支出开始超过工资单。
- 50-100 天 — Google Labs 从最初想法到把 AI 产品交付到最终用户手中的目标周期。 · Josh Woodward (Google Labs) · 2025-05 · 访谈
- 95%+ — Anthropic 内部估计 Claude Code 的代码 95% 以上由 Claude Code 自己编写——瓶颈随之转移到决策、协调和合并队列。 · Mike Krieger (Anthropic CPO) · 2025-06 · 访谈
- 熟悉领域1.5x / 陌生领域5x — Anthropic 最顶尖工程师自述编码代理带来的加速:熟悉领域 1.5 倍,新语言或生疏领域 5 倍——AI 研究本身正被加速 · Sholto Douglas (Anthropic) · 2025-06 · 访谈
- $1B+ 收入 / ~100 人 / 零融资(4 年) — Surge 完全 bootstrap,不到五年做到年收入超 10 亿美元、员工不足百人,人均产出约 1000 万美元——数据公司靠技术而非人海(2025-12 另一期口径不变) · Edwin Chen · 2025-07 · 访谈
- 80% 用于理解系统 — 工程师 80% 时间花在理解复杂系统和协作而非写代码——这是做「代码理解 agent」而非代码生成的立论基础 · Misha Laskin · 2025-07 · 访谈
- 3 人 — IMO 金牌模型的核心团队只有三个人(依托 OpenAI 基础设施)——前沿突破的最小作战单元可以极小 · Alex Wei, Sheryl Hsu & Noam Brown · 2025-08 · 访谈
- 每诊所 1 名后台 — 医疗账单公司借 LLM 让 10-15 人诊所只需 1 名后台人员——AI 让以前不敢提的商业承诺变得可兑现。 · Garry Tan · 2025-08 · 访谈
- 6 engineers x 3 months -> 1 weekend — AI 辅助编码让过去需要六名工程师三个月的项目,如今他和朋友两人一个周末就能完成——瓶颈因此转移到产品管理 · Andrew Ng · 2025-08 · 访谈
- $50M+ ARR, cash-flow positive — Gamma 以刻意精简的团队做到 5000 万美元以上 ARR 且现金流为正——反例是烧钱补贴推理成本的竞争对手已死掉或转向 · Jon Noronha · 2025-08 · 访谈
- $500M ARR with 0 salespeople — Canva 在达到 5 亿美元 ARR 前没雇过一名销售——PLG 能在巨大规模下成立的极端证据,Gamma 沿此路径 · Jon Noronha · 2025-08 · 访谈
- 10-15% -> 30-50% (some 10x) — CTO 报告从 Copilot 时代的 10-15% 提升到一年后 Cursor 用户的 30-50%、个别 10 倍——AI 采购从'凭感觉试验'转向有形 ROI 的标志 · Martin Casado & Sarah Wang · 2025-08 · 访谈
- 数百个 PR/天(单个重度用户) — OpenAI 内部重度用户每天用 Codex 生成数百个 PR,验证了代理编码的实际价值并指导产品方向 · Mark Chen & Nick Turley · 2025-08 · 访谈
- 1.5x — 顶级kernel研究者自述Claude Code让他的生产力提升约1.5倍——写Triton内核'相当不错',o3级推理模型能做高水平优化头脑风暴(→ 对照 2025-06 Sholto 的 1.5x/5x:顶尖工程师自估口径趋同) · Tri Dao · 2025-09 · 访谈
- 85% — Barton自评其85%的工作可由AI完成,Coatue正据此招分析师重构内部工作流 · Michael Barton (Coatue) · 2025-11 · 访谈
- 20个团队×5-10人 — 约20个完全独立的小产品团队并行发布,用可容忍的重复换取交付速度 · Mati Staniszewski (ElevenLabs CEO) · 2025-11 · 访谈
- 25% since 2015 → projected 70% by 2030 — LinkedIn 全站数据显示 AI 正在加速职位技能构成的换血速度 · Ryan Roslansky · 2025-11 · 访谈
- 4 employees at $1M ARR — 首次跨过百万 ARR 时全公司只有 4 人,刻意小团队高人效 · Adit Abraham · 2025-11 · 访谈
- $100k robot vs $20k/yr human — 造一台机器人 10 万美元,不一定优于年薪 2 万美元的人力——机器人本质是硬件经济学问题 · David Owen & Yafah Edelman (Epoch AI) · 2025-11 · 访谈
- 10-100x — 顶级程序员的工作已变成并行指挥 10 个编码 bot,生产力将比过去高 10 到 100 倍 · Marc Andreessen · 2026-01 · 访谈
- ~几千人/条 iPhone 产线 — 一条 iPhone 组装线需要数千名制造工程师;若 AI 能替代这层职能,美国在岸制造即获得巨大成本优势——AI 降本的对象是工程师而非工人 · Vinod Khosla & Keith Rabois · 2026-01 · 访谈
- 4% of all public GitHub commits — Claude Code 已署名 GitHub 全部公开提交的4%,且指数增长——AI从辅助转向直接作者的行业级证据 · Boris Cherny (Anthropic Claude Code 负责人) · 2026-02 · 访谈
"These numbers are just totally crazy, right? Like 4% of all commits in the world is just way more than I imagined. And like you said, it still feels like the starting point. These are also just public commits. So we actually think if you look at private repositories, it's quite a bit higher than that."「这些数字简直疯狂——全世界 4% 的提交,远超我的想象。而且这仍然只像是起点。这还只是公开提交;看私有仓库的话,比例还要高不少。」Boris Cherny (Anthropic) · Head of Claude Code: What happens after coding is solved
- +200% per-engineer, team 4x — Claude Code 团队自成立以来工程师人数扩大4倍的同时,人均生产力还提升了200% · Boris Cherny (Anthropic Claude Code 负责人) · 2026-02 · 访谈
- 1 year → 3 months — AI提速让企业计划周期从一年压缩到三个月,逼CEO成为更快的决策者 · Brian Halligan (HubSpot / Sequoia CEO coach) · 2026-02 · 访谈
- 95% daily — OpenAI 95%的工程师每天使用Codex · Sherwin Wu (OpenAI) · 2026-02 · 访谈
- +70% PRs — 用Codex的工程师PR多70%,且差距随熟练度继续扩大 · Sherwin Wu (OpenAI) · 2026-02 · 访谈
- 20-30 agents/engineer — 工程师已在同时管理20-30个Codex实例;他预期经理同理将管理大得多的团队 · Sherwin Wu (OpenAI) · 2026-02 · 访谈
- 7,000 → 3,000 — Klarna靠AI自动化+自然减员把员工数近乎腰斩,同时人均薪酬上升 · Sebastian Siemiatkowski (Klarna) · 2026-02 · 访谈
"We used to be 6,000 or over 7,000 people and we're now less than 3,000. And I didn't ask for a single dime to do all this."「我们过去有 6000 或超过 7000 人,现在不到 3000 人。我做这一切没要一分钱。」Sebastian Siemiatkowski (Klarna CEO) · 20VC: SaaS is Dead: Why Systems of Record Will Die in an Agentic World
- 700 — 著名的'AI客服替代700名客服'声明;他称即便以现在所知也不会改口 · Sebastian Siemiatkowski (Klarna) · 2026-02 · 访谈
- 100-1000x — 会用代理工具的工程师与不用者的产出差距——最低标准没变,但上限被极大抬高,个人影响力取决于用工具的能力与意愿(→ 对照 2026-01 Andreessen 的 10-100x:上限口径继续抬升) · Simon Last · 2026-03 · 访谈
- 每~6个月 — Notion定期彻底重写AI harness以贴合最新模型能力,且重写周期随进展加速还在缩短——'做一套然后守着'是多数公司犯的错 · Simon Last · 2026-03 · 访谈
- 新服务2小时上线可用 — Snap内部周五『vibe-code』一个全新服务点子,两小时内投入使用——执行成本坍塌的实例 · Evan Spiegel · 2026-04 · 访谈
- 35 hours/week — 传统会议型管理的信息获取成本——Chesky过去每周35小时开会只为拿到信息,AI founder mode要用异步流取代 · Brian Chesky · 2026-05 · 访谈
- 3 weeks → 2 days (~90% reduction) — 复现旧论文到可运行状态的耗时对比——coding agent让研究者从单线程转为三件事并行 · AI Research Legend(未具名Transformer元老,疑为Łukasz Kaiser) · 2026-06 · 访谈
- tokens > headcount (already at Mercor) — Mercor内部agent的token支出已超过员工工资总额——他预言的企业范式在自家先兑现 · Brendan Foody · 2026-06 · 访谈
"Like right now, we're spending more on tokens for our internal agents than we are on employee headcount. And I think most businesses are going to look like that."「就在现在,我们花在内部 agent token 上的钱,已经超过了员工人头开支。我认为大多数企业都会变成这样。」Brendan Foody (Mercor CEO) · 20VC: Mercor CEO on Why Application Layer Companies Have No Defensibility
- $20M liquid stock offers; 8-figure/yr packages — 顶级AI研究员的真实市场价:常见2000万美元流动股票报价,年包八位数——预计随技能扩散回归正常 · Brendan Foody · 2026-06 · 访谈
- 16%→80% (one quarter) — agent 驱动代码库中 AI 提交占比在一个季度内从 16% 升至 80%,说明 2025 年 12 月前后(Opus 4.5/GPT 5.2)跨过了自主性能力阈值(→ 对照 2026-02 Claude Code 占 GitHub 全站 4%:agent 驱动代码库内的占比已到 80%) · Walden Yan (Cognition) & Cole Murray (OpenInspect) · 2026-06 · 访谈
- 1 engineer + 2 founders — 第二产品 Merge Agent Handler 由 1 名工程师加两位创始人用 AI 工具做出,说明 AI 时代'桶'型人才的杠杆 · Shensi Ding & Gil Feig (Merge) · 2026-06 · 访谈
- 2x → 1,000x — 无限 AI 杠杆时代,处于手艺极端前沿者的溢价从 2 倍升至可能 1000 倍,根本改变个人才能的定价 · David Senra (Founders Podcast) · 2026-06 · 访谈
- 1850年约50% → 今天约10% — 人一生中花在工作上的时间占比的历史变迁——论证 AI 生产力红利会兑换成闲暇(更短工作周、更长退休)而非永久失业 · Tyler Cowen & Alex Tabarrok · 2026-06 · 访谈
- $2M → $300K/年 — 被 AI 取代的专业服务精英的收入路径变化量级——失去的是高薪自动通道而非生计,故过渡可管理 · Tyler Cowen & Alex Tabarrok · 2026-06 · 访谈
- <100人 — Exa 声称用不到100人建出对 agent 而言优于 Google 的搜索引擎——范式切换(服务 agent 而非人类点击)压缩了所需团队规模 · Will Bryk (Exa) · 2026-06 · 访谈
- 8x — Anthropic 工程师人均每季度交付代码量 vs 2025(主持人 Lenny 引用 Anthropic 官方推文,Fiona 确认并展开):编码已不是瓶颈,瓶颈转移到验证与高吞吐管理,且设计师、PM 也都在提交代码(→ 对照 2026-02 Boris Cherny 的 +200% 人均:同一家公司的口径继续抬升) · Fiona Fung (Anthropic, Claude Code/Cowork 团队负责人) · 2026-06 · 访谈
"Anthropic engineers on average ship eight times as much code per quarter as they did compared to 2025. Coding is no longer the bottleneck."「Anthropic 的工程师平均每季度提交的代码量是 2025 年的八倍。编码不再是瓶颈。」Lenny Rachitsky(主持人,引 Anthropic 官方推文;Fiona 确认) · Building the most AI-pilled engineering team in the world
- ~$10M ARR(退出一线)/ $100M(仍周期性亲自卖) — Lattice 创始人亲自卖到约 1000 万美元年收入才逐步退出销售一线,到 1 亿美元收入仍周期性亲自卖单只为"感受哪里觉得难"——销售是找到并加深 PMF 的最佳途径 · Jack Altman (Alt Capital / Lattice 前CEO) · 2026-06 · 访谈
- ~20 人 — 创始人角色从做事切换到造机器的员工数阈值:约 20 名员工后,CEO 的工作从"做产品服务客户"翻转为"构建做产品服务客户的机器" · Jack Altman (Alt Capital / Lattice 前CEO) · 2026-06 · 访谈
- 6–12 个月 — 判断研究员轨迹所需时间:入职前几乎无法识别顶尖研究员,入职后半年到一年才能看清谁有最强轨迹——前沿实验室人才评估的真实时间成本 · Mark Chen (OpenAI CRO) · 2026-06 · 访谈
- 10–100x — 模型优化他博士期间扑克算法的加速倍数:模型作为研究者的"放大器"已真实存在,执行与优化被数量级加速,但"研究品味"(选方向、提出更优新算法)仍是人类专属瓶颈 · Noam Brown (OpenAI) · 2026-06 · 访谈
- 80% 自动化 / 20% 留给人类 — 常规视觉设计可自动化比例(Maeda 估计):AI 吃掉 8 成机械性视觉工作后,人类设计师的 2 成转向高阶决策与 AX(为 agent 设计)——"AI 提高底线、人类提天花板"的量化版 · John Maeda (Microsoft VP of Design) · 2026-06 · 访谈
- 3 天 — OpenClaw 从零构建耗时:一个人几天做出以前需数月或根本不可能的产品——AI 时代开发速度的具体标尺(→ 对照 2025-08 Andrew Ng 的 6人×3月→1周末:同一条坍缩曲线) · Kevin Weil (OpenAI) · 2026-06 · 访谈
- 10倍(1名博士同时跑7-10个campaign) — 自驾实验室反转科研人效:他读博时是 10 个科学家做 1 个课题,现在 1 人管 7-10 个 campaign、每 1-2 天迭代——其对美国 R&D 竞争力论证的核心数字 · Joseph Krause (Radical AI) · 2026-06 · 访谈
- $100,000+/年(顶尖工程师 token 消耗) — 真正投入 Claude Code/Codex 的顶尖工程师年化 token 支出已超 10 万美元,占工程师薪资的可观比例——按人配 token 预算的前奏(→ 对照 2026-07 Ev Randle 的 $3,000/月/开发者:同一条曲线的年化口径) · Clay Bavor (Sierra) · 2026-07 · 访谈
- $150(面试 token 预算) — Sierra 工程面试废除白板算法题:给候选人 150 美元 token 和任选 coding agent 现场构建应用,考察的是架构判断与用 agent 的生产力 · Clay Bavor (Sierra) · 2026-07 · 访谈
- $3 亿/年 ≈ 开发者薪资的 3.8% — 主持人引 Benioff:每年花 3 亿美元买 Anthropic 给开发团队,仅占开发者薪资的 3.8%——这一比例停在 3.8% 还是走向 20%,决定当前 AI 公司估值是贵还是便宜 · Clay Bavor 访谈(主持人引 Benioff) · 2026-07 · 访谈
- 约 5% 员工 — AI 原生公司内部使用呈幂律:5% 员工跑高 token 的高级用例,其余只做信息检索和摘要——因此拒绝建"token 消耗排行榜"式激励 · Arvind Jain (Glean) · 2026-07 · 访谈
- 20 倍(1 月至 6 月的 AI 支出) — 半年内 AI 支出暴涨 20 倍,倒逼公司自建 DashBench 基准并转向"前沿模型+廉价开源模型"混合路由;非技术员工(客户经理自动化 QBR)用量增长最快 · Andy Fang & Stanley Tang (DoorDash) · 2026-07 · 访谈
- 5 年 → 6 个月 — "零 FTE 创业"模式:合作伙伴带问题来,小团队用 AI 编排的高通量实验以传统成本的零头替代多年单资产 biotech 研发(→ 对照 2026-06 Joseph Krause 的 1 人管 7-10 个 campaign:自驾实验室人效的两种口径) · Andy Beam & Rafa Gómez-Bombarelli · 2026-07 · 访谈
- 20-50%(token 支出占人力预算) — 最激进的公司 token 支出占比 20-25%,Dylan Patel 公司 30%、有听闻 50%;对照 25 万亿美元的知识工作市场,20% 渗透就是 5 万亿美元,只能来自劳动替代或增长加速(→ 对照 2026-06 Mercor 的"token 支出已超工资单":从个例变成可测的分布) · Gavin Baker · 2026-08 · 访谈
- 平均 +50% vs 顶尖 ~35x — DoorDash 内部 AI 提效呈极宽分布,CEO 的工作是把顶尖工作流编码后教给全员——真正的管理问题是分布的宽度而不是均值(→ 对照 2026-03 Simon Last 的 100-1000x) · Tony Xu (DoorDash CEO) · 2026-08 · 访谈
"there's always a distribution of outcomes. You know, maybe the average is 50% more productive. But, you know, you have engineers who might be 35 times more productive."「结果总是呈某种分布的。你知道,平均下来可能是生产力提高 50%。但是,你会有一些工程师,他们的生产力可能高出 35 倍。」Tony Xu (DoorDash CEO) · Uncapped #55: Tony Xu from DoorDash
- 31,832 申请 → 录用 1 人(两年) — 两年内 31,832 人申请 Whatnot 产品经理岗位只录取一人,而全公司刚过 20 个 PM(约 21-22 人)——PM 是高杠杆专业工种而非默认配置 · Tom Verrilli (Whatnot CPO) · 2026-08 · 访谈
- 2 年 9 任产品负责人 — 他在 Twitter 的两年换了 9 位产品负责人,140 字符限制的决策拖了数年——"复杂"往往是领导力软弱的借口 · Tom Verrilli (Whatnot CPO) · 2026-08 · 访谈
- 20/60 人(约 1/3)买断离职 — 禁掉工作频道政治讨论后给最高 6 个月工资买断,60 人公司走了 20 人——DHH 称这是"花得最值的钱",彻底治愈了文化 · David Heinemeier Hansson (DHH) · 2026-08 · 访谈
- 20 分钟出首版 / 每 30 分钟自动出 V2、V3、V4 — 骑车途中用手机远程操控 MacBook,让 agent 每 30 分钟读一次 Slack 反馈重导视频,回家时发布视频已被批准——异步反馈循环的节奏标尺 · Jason Liu (OpenAI Codex) · 2026-08 · 访谈
- $100k/年 token("时间机器"基准) — 现在肯每年烧 10 万美元 token,等于提前体验 2028 年的工作方式——alpha 窗口(→ 对照 2026-07 Clay Bavor 的 $100,000+/年:同一数字,一个是观察到的现状、一个是主张的门槛) · Dianne Penn (Anthropic) · 2026-08 · 访谈
估值与融资
AI 溢价(A 轮 +30% 持续一年未消)、幂律集中与泡沫算术。
- $3M-$10M ARR — AI 公司在早期即达此区间(旧时代 A 轮基准是$1M ARR),但收入成熟度与公司成熟度脱节,是新的风险源 · Jacob Effron, Scott Raney, Patrick Chase, Alex Bard (Redpoint) · 2025-04 · 访谈
- 120x 收入(Series B) — Mercury B 轮以 120 倍收入完成——支撑他'创始人应拿最高估值但别花掉'的亲历论据(当时融 $1.2 亿不知怎么花) · Immad Akhund (Mercury) · 2025-06 · 访谈
- 独角兽仅回报 8x — 种子入场价 2000-2500 万美元、稀释后投到独角兽也可能只有 8 倍——想做 10x 基金必须猎 $100 亿+ 的十角兽,独角兽狩猎时代已结束 · Immad Akhund (Mercury) · 2025-06 · 访谈
- 83% — 互联网泡沫周期中 83% 的风投利润产生于公认是泡沫的最后三年——提前喊泡沫离场等于放弃 83% 的利润。 · Josh Kopelman · 2025-08 · 访谈
- -1x / +1000x — 风投不加杠杆最多亏 1 倍但可能赚千倍——所以顶级基金的亏损率反而高于平庸基金,漏掉赢家(omission)比投错(commission)更致命。 · Marc Andreessen · 2025-08 · 访谈
- 后续轮估值平均高4倍 — 红杉在cap table上的信号效应使初创公司后续融资估值平均高出4倍,延长跑道、降低死亡率——品牌VC的可量化溢价 · Pat Grady · 2025-08 · 访谈
- $2B minimum raise — a16z 的经验法则:要在基础模型领域竞争,即使产品没什么进展也必须能融到至少20亿美元,否则投资人不该入场。 · Ben Horowitz · 2025-09 · 访谈
- $10M offered vs $200K asked — Databricks 创始团队(6个博士+教授)最初只想融20万美元,Horowitz 反手给1000万逼他们按真公司的规模思考。 · Ben Horowitz · 2025-09 · 访谈
- $10B (~20x run rate) — A 轮、B 轮均以约 100 倍收入倍数成交;而以 $500M run rate 看 $10B 传闻估值反而只有 20 倍——按增速'便宜',公司盈利到不需要融资,融资只为宣示 RL 环境市场领导者地位 · Brendan Foody · 2025-09 · 访谈
- $150-200B/yr in, >$1T/yr exits needed — 风投行业年投入要求 7000-8000 亿美元回报,即每年超万亿美元退出总额才合理——现实极少达成,故称『无回报风险』。 · Roelof Botha · 2025-10 · 访谈
- +30.9%($55M vs $42M) — 2025上半年融资的AI软件公司估值溢价30.9%,Lin认为源于服务市场扩张的信念,但承认付的是2-4年后的价格、'有点鲁莽' · Alfred Lin · 2025-10 · 访谈
- $500B→$5T — 为二级市场$500B估值辩护的算术:$4T的NVIDIA按10%复利十年超$10T,OpenAI若能到$5T则现在入场仍划算 · Alfred Lin · 2025-10 · 访谈
- 40% of S&P 500 — 七家公司占标普四成,类比90年代日本占全球股市43%(美国41%)随后解体——集中度本身是系统脆弱性 · David Cahn · 2025-10 · 访谈
- 80%+流向算力生产者 — 人人嘴上说要投'算力消费者',pitch book数据却显示八成以上AI美元仍流向生产端——言行背离的套利空间 · David Cahn · 2025-10 · 访谈
- ~20家/年 — 过去20-30年平均每年仅约20家公司实现≥$1B的真实退出,资金涌入并未改变该数字——'VC不是资产类别'的核心论据 · Roelof Botha · 2025-10 · 访谈
- $250M valuation / 10% dilution at $1.5M revenue — Benchmark 在营收仅 150 万美元时按约 167 倍营收倍数入场,反映 AI 人才赛道的估值锚 · Brendan Foody · 2025-11 · 访谈
- $2B valuation at $20M run rate, 4 months later — 四个月后估值翻 8 倍、仍按 100 倍 ARR 定价,展示这一轮 AI infra 融资节奏(→ 对照上一条) · Brendan Foody · 2025-11 · 访谈
- $29B(ChatGPT 发布前) — Thrive 在 ChatGPT 上线前以约 290 亿美元估值投资,当时只有两家机构给了 term sheet——需要信念而非竞争优势 · Philip Clark (Thrive Capital) · 2025-11 · 访谈
- $500M(OpenAI 出价,被拒) — GI 拒绝 OpenAI 5 亿美元收购数据的报价,选择自建独立世界模型实验室——给数据资产定价的罕见锚点 · Pim De Witte (General Intuition) · 2025-12 · 访谈
- 21x 收入,组合加权增速 112% — a16z 成长基金以 21 倍收入进入、组合美元加权增速 112%——高增长可以消化高估值的实证 · David George (a16z Growth) · 2025-12 · 访谈
- $1B 融资 @ $11B 估值 / ~100 人 — Kalshi 自称美国 AI 之外增长最快的公司,百人团队完成 10 亿美元融资;受监管交易所像银行一样需要准备金 · Tarek Mansour (Kalshi) · 2025-12 · 访谈
- 50%(最佳基金 Venture 12) — 红杉史上表现最好的基金一半项目清零——好的挑选不是不亏钱,而是足够高的不对称机会命中率 · Pat Grady & Alfred Lin (Sequoia) · 2025-12 · 访谈
- $300M(2009,募6个月)→ $15B(靠声誉完成) — 声誉复利的量化:一号基金3亿磨半年,最新150亿靠品牌直接落袋 · Marc Andreessen & Ben Horowitz · 2026-01 · 访谈
- top 1/3 firms = 2/3 of market cap (highest since 1963) — '分拣机'加速运转的证据:利润与市值向头部集中达60年来最高 · Patrick & John Collison (Stripe 年度信) · 2026-02 · 访谈
- Anthropic $360B vs OpenAI $500B — 主持人给出的两家实验室假想投资报价;他认为两者方向已分化不可直接比较 · Sebastian Siemiatkowski (Klarna) · 2026-02 · 访谈
- ~80% — AI驱动的公司贡献了标普500近80%的回报 · David George (a16z Growth) · 2026-02 · 访谈
- -40% in 50 years — 标普500成分公司平均寿命50年间缩短40%——颠覆加速的底层数据 · David George (a16z Growth) · 2026-02 · 访谈
- WorldCom $40B debt — dot-com基础设施靠负债400亿美元的WorldCom,而今天数据中心投资方账上有数千亿现金流——系统性风险的核心差异 · Martin Casado (a16z) · 2026-02 · 访谈
- 30% — Carta报告:名字或定位带AI的A轮公司估值溢价30%;Deedy认为对真正深入的少数团队而言溢价合理,因为人才池极度受限(→ 对照 2025-10 Alfred Lin 的 30.9%:溢价一年未消退) · Deedy Das · 2026-02 · 访谈
- $5M 种子或 $500M 成长 → 皆可赚 $10-100B — 投对的话两种支票规模都能赚百亿——所以风投的真实成本结构是错过(omission)远贵于亏损(commission) · Marc Andreessen · 2026-04 · 访谈
- 1,000x revenue — 当前 AI 公司融资估值达收入的 1000 倍,Merge 创始人以此说明市场泡沫程度并坚持看收入/毛利/burn/runway · Shensi Ding & Gil Feig (Merge) · 2026-06 · 访谈
- +30-40% QoQ — Coatue 跟踪的公司逐季超出盈利预期 30-40%,且盈利增长快到估值倍数持平或压缩——论证'高质量增长而非泡沫' · Philippe Laffont (Coatue CIO) · 2026-06 · 访谈
- 5x-7x — 电力/内存/半导体等'短缺卖方'的盈利能力在短期内增长 5-7 倍,市场奖励持有受限产能的一方 · Philippe Laffont (Coatue CIO) · 2026-06 · 访谈
- $3M ARR — 如今 Series A 公司的产品打磨度参照:他看到 300 万 ARR 的 A 轮公司产品已远比当年 Lattice 精致——产品质量的市场底线在 2015→2026 间显著抬高,"先上线破烂 MVP"的旧建议需修正(→ 对照 2025-04 Redpoint 的 $3M-$10M 早期收入区间:收入与质量基准同步抬升) · Jack Altman (Alt Capital / Lattice 前CEO) · 2026-06 · 访谈
- $380B 估值轮融 $30B;若 $1.5T 上市 = 35 个 Snowflake pre-IPO 轮 — 历史最佳 pre-IPO 轮(Slack/DoorDash/Snowflake/Nubank)规模 $500M-$2B、4 年回 2-5x;Anthropic 一轮的毛回报顶 35 个 Snowflake——AI 时代后期轮的绝对回报量级史无前例,"growth fund 才 $1B"的旧尺度失效 · Ev Randle (Benchmark) · 2026-07 · 访谈
- ~$700M vs $80-100M — Founders Fund 最新风险基金平均进入估值 vs 此前五期基金:入场价 7-9 倍膨胀是本轮泡沫最硬的内部证据——连他们自己做的种子轮都贵到抬高全基金均价(Delian 亲述本基金数据) · Delian Asparouhov (Founders Fund) · 2026-07 · 访谈
- 1% of deal size — FF 的 1% 机制:每笔投资按金额的 1% 留给经手团队成员个人跟投——用真金白银度量内部信念、消除政治化共识的激励设计,不跟投本身就是信号 · Trae Stephens & Delian Asparouhov (Founders Fund) · 2026-07 · 访谈
- 80%(净新投资仅20%) — FF 增长基金中加倍投资现有组合的比例:当组合里有年复合 30%+ 的 SpaceX/Anduril/Stripe 时,$30B 估值上的边际 IRR 不输 $500M 新公司——机会成本思维的极端体现 · Trae Stephens & Delian Asparouhov (Founders Fund) · 2026-07 · 访谈
- $200 亿(Facebook 二级市场买入) — Accel 在担忧上行空间的情况下以 200 亿美元估值买入 Facebook 老股,事后证明严重低估——教训是见到真正主导性的技术要敢于大规模下注并长期持有 · Accel 成长团队 · 2026-07 · 访谈
- 20 年 100 倍(亿万富翁数量) — 亿万富翁二十年间数量增长百倍导致稀缺性崩塌,是"亿万富翁见顶、发布者(poster)阶层接任祭司"论的量化依据 · Jeremy Giffon · 2026-07 · 访谈
- ~$10M @ $4B+ 估值(基金仅 $600M) — Menlo 给 Anthropic 的首张支票在 pre-revenue 阶段就下注,锚点是 Dario 离开 OpenAI 的独特洞见与持平 ChatGPT 的 benchmark · Matt Murphy (Menlo Ventures) · 2026-08 · 访谈
- >$500M(Menlo 史上首个 SPV) — 从没做过 SPV 的机构一出手就超 5 亿美元;LP 大会上 Anthropic 高管路演后两周内签下领投 term sheet(→ 对照 2026-07 Ev Randle 的"一轮 = 35 个 Snowflake":后期轮的绝对量级已重写尺度) · Matt Murphy (Menlo Ventures) · 2026-08 · 访谈
- $300M @ 仅 3% 稀释(~$10.3B 估值) — Etched 的 C 轮:LLM 推理专用 ASIC 挑战 Nvidia 通用 GPU,赌的是推理会是史上最大的芯片市场(→ 对照 2026-02 a16z 的 $200M 流片费算术:ASIC 的约束是时间线不是钱) · Jason Lemkin & Rory O'Driscoll · 2026-08 · 访谈
- $3B @ $188B(Databricks Series M) — 轮次字母都排到 M 了——晚期 AI 资本市场的 momentum 游戏仍在继续 · Jason Lemkin & Rory O'Driscoll · 2026-08 · 访谈
- 17 亿美元(Atoms 单轮) — 把矿业、运输、食品三条线并成一个实体后一次性募得:投资人要的是对整个工业 AI 生态的广口敞口,而非单一垂直 · Travis Kalanick (Atoms) · 2026-08 · 访谈
- $260 亿估值 / $5 亿收入(成立 <3 年) — Cognition:自主编码 agent 成为 AI 增长最快的品类,不到三年从零做到 5 亿美元收入(→ 对照 2026-06 的 ~$1M→$500M+/20 个月:估值曲线与收入曲线同步) · Scott Wu (Cognition) · 2026-08 · 访谈
- ~$4B 收入(按 25-30x 倍数) — 估值 100 亿的 Neolab 必须在未来数年做到约 40 亿美元收入才能长成千亿公司,否则下一轮融不动、人才流失 · Anastasios Angelopoulos (Arena) · 2026-08 · 访谈
- $10T 软件/互联网 vs $22T Mag 7 vs $30T+ 芯片硬件 — 计算为中心的时代已在过去四年把市值重心系统性地从软件搬到硬件基础设施(→ 对照 2025-11 Philip Clark 的"全球前十有五家硬件":同一迁移的两个截面) · Tony Kim (BlackRock) · 2026-08 · 访谈
- 5.2%(30 年期美债,20 年新高) — 无风险端给到这个数(税前等效 8-10%),就很难为半导体股付 50-100 倍市盈率——这是逼资金撤离 AI 动量交易的宏观主因 · All-In(Chamath、Sacks、Friedberg、Calacanis) · 2026-08 · 访谈
- 5 个季度营收 3 倍、股价 10-12 倍 — Lumentum CEO 上任仅五个季度营收翻三倍、股价一度突破 $1000——市场在为数据中心全面光学化的未来定价 · Michael Hurlston (Lumentum CEO) · 2026-08 · 访谈
其他关键数字
评估工程、世界模型、能源与其他不肯归类但值得记住的数字。
- ≥90% — LLM 法官与人工标注 ground truth 的一致率至少要达到90%,eval 才算可用——评估器本身的验收标准 · Aman Khan (Arize) · 2025-05 · 访谈
- ~3 个月 — AI 评估标准的'保质期'——进展太快、基准迅速饱和,评估集必须持续重造。 · Michelle Pokrass (OpenAI) · 2025-06 · 访谈
- 350万个演示文稿 — 在 Figma Slides 发布前,用户已在并非为此设计的 Figma Design 里做了 350 万份演示文稿——'用户破解产品'的需求信号可以量化到这个规模 · Yuhki Yamashita (Figma CPO) · 2025-06 · 访谈
- pass@1 vs pass@256 显著差距 — 许多评估在允许尝试 256 次时可完全解决但单次尝试不保证——可靠性(时间范围内成功率)才是衡量 agent 能力扩展的正确指标 · Sholto Douglas (Anthropic) · 2025-06 · 访谈
- 97% text recovery — 从单个文本嵌入向量中可恢复高达 97% 的原文,证明向量数据库交换 embedding 约等于交换明文数据,隐私假设不成立 · Jack Morris · 2025-07 · 访谈
- ~1 minute — Genie 3 生成的世界元素能持续约一分钟——受实时推理权衡限制而非根本限制,且无需显式 3D 表示即实现。 · Shlomi Fruchter & Jack Parker-Holder (Google DeepMind) · 2025-08 · 访谈
- AI 88% vs 医生 73% vs 医生+AI 76% — 斯坦福多中心研究:复杂诊断中 AI 单独准确率最高,医生介入反而把 AI 拉低到 76%——人机协作可能是减分项。 · Vinod Khosla · 2025-08 · 访谈
"AI alone, 88%. ... But then they gave the AI to the doctors. The doctors improved from 73% to 76%. The AI got degraded from 88 to 76%."「仅靠 AI,准确率 88%。……但后来他们让医生使用 AI。医生从 73% 提高到 76%。AI 从 88% 降到 76%。」Vinod Khosla · Vinod Khosla: Predicting the Future
- 5-10 examples POC / 100+ production — eval 黄金数据集的经验值:内部测试从 5-10 行起步,生产级置信度需 100+ 例(视行业监管程度) · Aman Khan · 2025-08 · 访谈
- 1 point on 300-scale in 4 years — 美国高中生中位数四年只在300分制量表上提高1分——高中阶段学习近乎完全停滞 · Joe Liemandt · 2025-09 · 访谈
- 20-30 hours/subject-grade — 用学习科学引擎掌握一个年级科目组合只需20-30小时(Math Academy四年级数学28小时、六七年级22小时) · Joe Liemandt · 2025-09 · 访谈
- 3-4 days + 30 min/week — 首次错误分析需3-4天密集标注(一次性成本),之后接入CI+cron后每周约30分钟即可维持 · Hamel Husain & Shreya Shankar · 2025-09 · 访谈
- 100 traces / ~1 hour — 人工看100条trace约1小时,产出的具体失败洞察远超任何幻觉/毒性自动评分——eval中ROI最高的一小时 · Hamel Husain · 2025-10 · 访谈
- 51,000 (2018) → 1,200 (2023), -98% — 监管不确定性下中国年新创公司数量五年跌 98%——创业者承担风险的意愿对政策极其敏感。 · Roelof Botha · 2025-10 · 访谈
- 86/100 — Harvey创立前的验证实验:GPT-3回答100个房东-租客法律问题,执业律师认为86个可不加编辑直接发给客户——连OpenAI法务都惊讶 · Sarah Guo & Elad Gil(回顾多位嘉宾) · 2025-11 · 访谈
- $75-80k → 数百美元/颗(10年) — 激光雷达传感器十年内成本下降约 300 倍,是硬件创业门槛坍塌的核心证据 · Philip Clark (Thrive Capital) · 2025-11 · 访谈
- 5/10 — 全球市值前十中五家是硬件公司(Apple、Nvidia、Broadcom、Tesla、TSMC),支撑硬件复兴论 · Philip Clark (Thrive Capital) · 2025-11 · 访谈
- 4秒记忆窗口 — GI 世界模型仅凭 4 秒记忆即表现出空间记忆,并继承数据集中的超人操作行为(→ 对照 2025-08 Genie 3 的 ~1 分钟:不同路线的记忆窗口) · Pim De Witte (General Intuition) · 2025-12 · 访谈
- 6-12个月 — 评估者不执行检查代码导致模型在华丽但错误的数据上退化,团队半年到一年才发现——坏测量的代价 · Edwin Chen · 2025-12 · 访谈
- 10s low-res non-realtime → 60s real-time photoreal in ~1 yr — Genie 2 到 Genie 3 一年间的跨越;一年前'实时1分钟一致性'还是 stretch goal,现在用户已嫌1分钟太短(→ 对照前两条:世界模型时长/记忆的进度线) · Google Genie 3 / Project Genie 团队 · 2026-02 · 访谈
- ~90% of tasks < 1 expert-hour — SWE-Bench Verified 九成问题专家工程师一小时内可解且高度自包含——已无法代表行业转向的数小时/数天级任务 · Mia Glaese & Olivia Watkins (OpenAI Frontier Evals) · 2026-02 · 访谈
- >50% of deep-dived failures — 对模型无法稳定通过的任务深查,过半是基准自身缺陷(过窄测试、要求猜特定命名)而非模型能力问题 · Mia Glaese & Olivia Watkins (OpenAI Frontier Evals) · 2026-02 · 访谈
- >90%(一个月内) — Luckey估计即使免费送出,绝大多数人也会因体验不达标一个月内弃用VR——'免费也不够便宜'的量化表达 · Palmer Luckey · 2026-02 · 访谈
- ~90% — 深挖技术细节后,至少90%自称做RL/AI的公司其实只是在改LLM提示词——技术型投资人敢问'蠢问题'才能识别 · Deedy Das · 2026-02 · 访谈
- 100+工具即降智 — 一次性暴露上百个工具导致模型质量下降和token暴涨,倒逼渐进式披露架构 · Simon Last & Sarah Sachs (Notion) · 2026-04 · 访谈
- 相关系数>0.8 — 人均GDP与人均能耗高度相关——能源产量是经济繁荣的终极代理指标,这是全篇的第一性论据 · Scott Nolan (General Matter) · 2026-04 · 访谈
- 1颗燃料芯块 ≈ 1吨煤 — 核燃料能量密度的第一性推论:核电本应是最便宜的能源,贵只因几十年没建堆 · Scott Nolan (General Matter) · 2026-04 · 访谈
- 100:1 (Jensen Huang's claim) — 黄仁勋主张安全代理需百倍于生产代理;Lahav认同方向但质疑其'原生安全行不通'的假设 · Dan Lahav · 2026-05 · 访谈
- weeks (Stockholm) vs months (SF) — AI经营实体业务的瓶颈是人类监管环境而非软件——同一家AI咖啡馆在斯德哥尔摩数周开业、在旧金山要数月审批 · Lukas Petersson & Axel Backlund · 2026-06 · 访谈
- 13%(此前最好 3-4%) — Devin 发布时的 SWE-bench 得分:13% 意味着 87% 的失败率仍敢发布——早发布抢旗帜(品牌/招聘/定义行业)比产品成熟度重要(→ 对照 2026-02 SWE-Bench Verified 已死条目:同一基准从发布锚点到退役的完整弧线) · Scott Wu (Cognition) · 2026-06 · 访谈
- 1亿 tokens 以上 — AISI 网络安全评估中模型仍在持续改进的 token 规模(引用 AISI 的评估结果):性能平台期已远到无法合理测完——安全评估的"能力上限"实际是预算的函数而非固定值 · Noam Brown (OpenAI) · 2026-06 · 访谈
- 约 1 帧/秒 — Gemini 视频理解的采样率(Bakaus 引述):模型靠截图/低帧采样、不理解时间分辨率,反馈回路缺失——动效(motion)设计仍是 AI 盲区,这是他仍手写动效 CSS 的原因 · Paul Bakaus (Impeccable) · 2026-06 · 访谈
- 1200 种合金 / 5-6 个月(其中 300 种文献从未见过) — 自驾实验室通量 vs 行业基准 DARPA/GE 航空 MOC 项目的 500 种/12 个月——约一个数量级的跃升,且 ~10 种性能令人兴奋 · Joseph Krause (Radical AI) · 2026-06 · 访谈
- $60-300/次 — 单次合金实验成本(取决于元素:铂钯贵、铝钛便宜):材料实验的边际成本低到可以"不怕浪费一枪",high-throughput 经济上可行 · Joseph Krause (Radical AI) · 2026-06 · 访谈
- 10-15倍 — 铪(hafnium)价格涨幅(中国控制供应链所致):材料设计必须把供应链当设计变量——客户要求在保持性能下把铪从 C-103(含10wt%)中去除 · Joseph Krause (Radical AI) · 2026-06 · 访谈
- 10-12 个(2026年1月单月) — 被 AI 解决的公开数学难题数(主要由 GPT-5.2、近期 Gemini 也有):模型已越过人类知识边界、能做"人类尚未做到"的新颖推理——但他谨慎区分"人类尚未解决"与"人类不可能解决" · Kevin Weil (OpenAI) · 2026-06 · 访谈
- 100 亿次配送数据 — 人类配送员实际投递落点的数据构成"首尾百英尺"的专有护城河,公共地图与通用模型里不存在,直接喂给机器人 Dot · Andy Fang & Stanley Tang (DoorDash) · 2026-07 · 访谈
- 0.1% → 15%(抗体从头设计的实验室结合成功率) — 从千里挑一变成筛 1000 个回来 150 个:成功率跃迁后才第一次拿到足以评估药性的统计量,彻底改变筛选经济学 · Josh & Matt (Chai Discovery) · 2026-08 · 访谈
"When we started the company, the state of the art for antibody design was about like a 0.1% binding rate. So one in a thousand of the molecules you design would actually bind in the lab. ... We got to, with our Chai 2 model, about a 15% success rate. So now if you screen 1,000 molecules, you're getting 150 back."「我们创办公司时,抗体设计的最先进水平大约是 0.1% 的结合率。也就是说,你设计的一千个分子里,只有一个真的能在实验室里结合。……用我们的 Chai 2 模型,我们做到了大约 15% 的成功率。所以现在你筛 1000 个分子,能拿回 150 个。」Josh & Matt (Chai Discovery) · Chai Discovery's Bitter Lesson
- 原计划 3-4 年做到 20%、目标只是 1% — 创始人承认被自己的进展速度吓到:当初 1% 就被认为是"开创性"的,结果直接到了 15%(→ 对照上一条) · Josh & Matt (Chai Discovery) · 2026-08 · 访谈
- ±5%(湿实验的误差带) — 生物学里 ±5% 的结果基本没有差别,对比同期 SWE-bench 上大家在争 16%/17%/18%——解释了为什么生物 AI 极容易自欺(→ 对照 2026-02 OpenAI Frontier Evals 的"过半失败源于基准自身缺陷":两种不同的"基准不可信") · Josh & Matt (Chai Discovery) · 2026-08 · 访谈
- 80% 是 JSON 写错 — 用户说"Claude 在幻觉",深挖后八成其实是模型不会写正确的 JSON——生成 30-40 个失败例即成评估集,模糊反馈由此变成可测任务(→ 对照 2025-08 Aman Khan 的 5-10 例 POC / 100+ 生产:评估集的起手规模口径一致) · Dianne Penn (Anthropic) · 2026-08 · 访谈
- 约 100 层(主流 transformer 的有效层深上限) — 号称深度学习实则很浅,逐 token 的思维链只是在补计算深度;提高原生计算深度是高阶推理能力的首要前提 · Jerry Tworek & Rohan Anil · 2026-08 · 访谈
- $15 亿(Anthropic 版权和解) — 美国史上最大版权和解:50 万本书每本赔 $3000,律师拿走 $1.01 亿,91% 作者已认领;起因是从盗版网站下载 700 万本书 · All-In hosts · 2026-08 · 访谈
"Lawyers get $101 million. Authors get $3,000 a book. 500,000 books were covered in it. Thus far, 91% of the covered authors have claimed their share."「律师拿走 1.01 亿美元。作者每本书拿 3000 美元。这次覆盖了 50 万本书。到目前为止,91% 被覆盖的作者已经认领了自己的份额。」Jason Calacanis (All-In) · The Fight Over Open Source AI, Anthropic's $1.5B Payout
- 制造 20 倍 / 电力 8 倍(中美物理经济产能比) — 美国 1 太瓦电力 vs 中国迈向 8 太瓦;制造面积 100 亿 vs 2000 亿平方英尺——Friedberg"分子经济"论的数据底座 · All-In hosts · 2026-08 · 访谈
- $37 万亿(社保错失的财富) — 若 1982 年以来的社保盈余投入标普 500 而非国债,信托基金今天会多出 37 万亿美元——他据此主张把社保翻转为全民持股账户 · David Friedberg · 2026-08 · 访谈
- $183 万亿总净资产(底层 50% 仅 $4 万亿、billionaires $8 万亿) — 真正的危机不是顶层集中而是底层一半人没有资产;他同时主张把资本利得税从 15% 拉平到劳动收入的 40%(→ 对照上一条:同一账本的两端) · David Friedberg · 2026-08 · 访谈
- 约 50%(互联网 bot 流量占比) — 创作者的守门人和受众已有一半是非人类,内容被迫向机器口味优化——"机器捕获"论点的量化支撑 · Ruby Thelot · 2026-08 · 访谈
- 约 200 万条(美国现行法律存量) — 反对为 AI 新立法的核心论据:先检查这两百万条既有法律(欺诈、CSAM、歧视放贷、职业执照)哪些已经适用于 AI · Steven Sinofsky · 2026-08 · 访谈
- 数万亿美元(稳定币交易量,与 Visa 网络同级) — 加密已从实验性爱好变成成熟金融基础设施(BlackRock/JPMorgan/Fidelity 已入场),构成立法紧迫性的核心论据 · Marc Andreessen & Chris Dixon · 2026-08 · 访谈
- 3000+ 小时 MTBI — Boston Dynamics Spot 的平均干预间隔超 3000 小时(一年仅需人工介入几次),电池续航约 90 分钟后自动回充电站换班,实现近乎无人值守运行 · 四位机器人公司 CEO(含 Boston Dynamics) · 2026-08 · 访谈
- 90-95%(AI 全生成动画 vs 实拍质量) — Amazon 与 Netflix 已宣布全 AI 动画项目:质量达实拍的 90-95% 但便宜、快得多——这也是她判断微短剧可全 AI 化的临界线 · Justine Moore (a16z) · 2026-08 · 访谈
- 40 kWh / 20 kW(Base Core) — 比市面典型家用电池大约 3 倍,定位整屋备份加电网支持而非富人太阳能配套件;快接插拔设计把安装压到电工 1-3 小时 · Justin Lopas (Base Power) · 2026-08 · 访谈