主题综述
数字台账 · Numbers That Matter
教 AI 经济学与规模感的硬数字。同一主题族内按时间排序以显趋势线;相互冲突或彼此更新的数字相邻放置并标注对照;最亮眼的 19 条附逐字引用。
更新日志
- 2026-08-24 — lens 增量:8/22 手动精选批 17 篇,新增 49 条(含 4 段新逐字引用:Rich Sutton、Brendan Foody、Eric Vishria、Will Gaybrick)。主题:持续学习成为本批最密的数字簇——"万亿 token 问题"(每天数百万亿推理 token 被丢弃)对上 1,800 任务 × $500K 算力把 corporate law 从 4.7% 提到 26.6% 的数据效率;Stripe Minions 7,000 PR/周(占全公司 30%)给 agent 写码占比补上一线大厂的中间刻度;Oak 的 1T 参数 @ 20 瓦把人脑功耗从参照物变成工程目标;模拟人类(85% 孪生保真、TVD<0.15)与出租车牌照经济学(持照人年收 $80K vs 司机贫困)各开一族新数字。
- 2026-08-24 — 清退 -58 条(含 5 段逐字引用:Gavin Baker、Matt Murphy、Tony Xu、Chai Discovery、Jason Calacanis):执行 2026-08-23「全退」裁决,移除 36 篇已退库 auto-intake 访谈(Gavin Baker、All-In×2、20VC×3、Menlo/Matt Murphy、Tony Kim、Lumentum、Tony Xu、Scott Wu 8 月刊、Chai Discovery、Friedberg、DHH、Whatnot、机器人 CEO 圆桌、Travis Kalanick×2、Base Power 等)的全部条目;手动挑回仍在库的 6 篇(Poolside、Dianne Penn 等)条目保留。覆盖口径同步降至 313 篇。
- 2026-08-04 — 增量 +90 条(来自 59 篇 07-13..08-04 新访谈:Arena、Menlo、Gavin Baker、All-In×2、Chai Discovery、Poolside、Baseten、Decagon、DoorDash×2、Cognition、Base Power、Lumentum、Travis Kalanick×2、Whatnot、DHH、Friedberg、Sierra、Glean、Fireworks 等)。主题:开源与前沿的差距被拆成 3-4 个月与 6-9 个月两种口径,而 Arena 榜上美国最强开源模型前面站着九个中国模型;B200 集群七个月涨价 50-60%、token 支出吃掉 20-50% 的人力预算,把"成本坍塌"叙事翻到了另一面;机器人 $1/小时与单家企业 35 亿美元/年的叉车工资,给劳动预算替换定出上下沿;Anthropic 的 1/50 资本效率、$15 亿版权和解与 700 亿 ARR 构成本季最密集的单公司数字簇。
- 2026-07-16 — 增量 +42 条(来自 14 篇 06-22..07-01 新访谈:Fiona Fung、Gabe Pereyra、Jack Altman、Mark Chen、Engram、设计与AI、Josh Elman、Noam Brown、Radical AI、Kevin Weil、Scott Wu、Benchmark、Luma、Founders Fund)。主题:token 计费与模型路由的性价比经济学接棒成本坍塌叙事,KV cache vs 权重内化给出推理成本的物理下界,8x 人均产出与 $3,000/月/开发者标出 agent 时代人效与定价新锚,超大轮次流动性(一轮=35 个 Snowflake)重写估值尺度。
- 2026-07-02 — 首次全量构建:从 lens 数字抽取的 574 条原始条目中,去掉重复入库的同集数字、过编辑闸门后收录 250 条,按七个主题族归档;覆盖全部 283 篇访谈(2025-04 至 2026-06 入库)。
推理成本与算力经济
成本曲线:同等能力的推理价格以每年 10x—100x 的速度崩塌,而总消耗按 Jevons 悖论指数上升;算力与收入的换算关系首次有了公开口径。
- ~10x/年 — LLM 推理与训练成本每年下降约10倍,持续改善应用层公司的毛利结构——'模型变便宜利好应用层'的量化依据 · Jacob Effron, Scott Raney, Patrick Chase, Alex Bard (Redpoint) · 2025-04 · 访谈
- 80-90% — 多家组合公司在几天内从 Anthropic 切换到 DeepSeek,推理成本立降80-90%——证明模型层规模不构成转换成本护城河 · Jacob Effron, Scott Raney, Patrick Chase, Alex Bard (Redpoint) · 2025-04 · 访谈
- 97 倍/年 — Gemini 等文本模型的成本去年降低了 97 倍,Labs 据此假设视频模型会走同样的成本曲线。(→ 对照上一条:成本下降口径从 10x/年 刷到 97x/年) · Josh Woodward (Google Labs) · 2025-05 · 访谈
- 10-20x (GPT-4 -> GPT-5 Pro) — GPT-5 Pro 单次回答用的算力约是 GPT-4 的 10-20 倍就能给出好得多的答案——而对真正重要的问题,值得花的算力'大得不可比拟' · Jakub Pachocki & Szymon Sidor · 2025-08 · 访谈
- 10,000+ H100,6家云、24个数据中心、4国 — Fal管理的推理基础设施规模——一家专注生成媒体推理的公司需要的资本密集度 · Gorkem & Batuhan (Fal) · 2025-09 · 访谈
- 1.5x-10x vs 自托管 — 自研推理引擎(自定义CUDA内核+扩散缓存+量化)比自托管快最多10倍,但开源社区会不断追上——性能优势是持续赛跑而非一次性护城河 · Gorkem & Batuhan (Fal) · 2025-09 · 访谈
- ≥100x(自ChatGPT发布以来) — 推理成本三年降了至少100倍:一半来自同参数量的更好模型(数据+MoE架构),一半来自推理优化(量化、减少数据搬运、KV缓存管理)(→ 对照 2025-04 Redpoint 的 10x/年:三年累计口径吻合) · Tri Dao · 2025-09 · 访谈
- -5%性能 ↔ +3x生产力 — Triton这类跨芯片抽象层的经济学:放弃5%性能换3倍开发生产力是明确值得的交易——评估任何抽象层的标尺 · Tri Dao · 2025-09 · 访谈
- >40% of revenue — NVIDIA收入中推理占比已超40%——推理而非训练正在成为主要负载与增长引擎 · Jensen Huang · 2025-09 · 访谈
- 30x (Blackwell vs Hopper) — 极限协同设计带来单代30倍性能提升——摩尔定律死后靠全栈优化维持双指数下的token成本下降 · Jensen Huang · 2025-09 · 访谈
- 75 vs 50-65 points — NVIDIA约75%毛利 vs 竞品50-65%——但15%的折扣抵不过30倍性能差,即使ASIC免费也输在电力机会成本上 · Jensen Huang · 2025-09 · 访谈
- 200MW→$2B, 600MW→$6B, 2GW→$20B+ ARR — Friar 披露 OpenAI 2023-2025 三年算力与收入几乎 1:1 同比例增长(每 100MW ≈ $10 亿 ARR),这是其提前为 2028-2030 下注数据中心的依据 · Sarah Friar (OpenAI CFO) · 2026-01 · 访谈
"We exited at 23 at 2 billion in ARR, so 200 megawatts, 2 billion. We exited at 24 at 6 billion, so 6 billion, 600 megawatts. And we exited last year a little over 20 billion, 20 billion, 2 gigawatts. Actually, it's been accelerating."「我们 23 年收官时 ARR 是 20 亿美元——200 兆瓦对 20 亿;24 年收官 60 亿——600 兆瓦对 60 亿;去年收官略超 200 亿——2 吉瓦对 200 亿。而且这个比例还在加速。」Sarah Friar (OpenAI CFO) · Episode 12 - State of the AI Industry
- 400K-500K GPUs 24/7 — 仅凭小样本统计估算,vLLM 常年运行在 40-50 万块 GPU 上(含 Amazon Rufus 等),一个开源推理引擎已成为事实基础设施 · Simon Mo & Woosuk Kwon · 2026-01 · 访谈
- -99% cost; 2x capability / 7 months — 获取前沿模型的成本下降99%、能力每7个月翻倍——AI进步速度与通缩的核心刻度 · David George (a16z Growth) · 2026-01 · 访谈
- 150x drop/21mo (GPT-4级); 88x/11mo (o1级) — 同等能力模型的 token 价格崩塌速度——在收入和用量疯涨的同时发生,是被市场噪音掩盖的最重要信号之一 · Elad Gil & Sarah Guo · 2026-02 · 访谈
"The cost of a million tokens on an O1 equivalent model in December of 24 was about 26 bucks. And then in November of 25, it was 30 cents. So we saw another 88X drop, not 88%, you know, 88 times cheaper in 11 months for that next generation of models."「o1 等级模型一百万 token 的价格,24 年 12 月约 26 美元,25 年 11 月只要 30 美分——又一次 88 倍的下降。不是 88%,是便宜 88 倍,只用了 11 个月。」Elad Gil · From SaaS to AI-First
- 1000 pJ vs 1 pJ — 把参数从SRAM移到乘法单元花约1000皮焦,而乘法本身只要1皮焦——batching存在的能源经济学根源 · Jeff Dean (Google) · 2026-02 · 访谈
- $200M tape-out vs 20% savings on $1B+ inference — 10亿美元级训练意味着推理支出必须超10亿才能自负盈亏,此时省20%推理成本即可覆盖2亿美元流片费——定制ASIC的约束是时间线不是钱 · Martin Casado & Sarah Wang (a16z) · 2026-02 · 访谈
- 12-20 W — 人脑功耗仅相当于一只昏暗灯泡——对比AI模型能耗,说明效率仍有数量级提升空间 · Elad Gil & Sarah Guo · 2026-02 · 访谈
- ~20瓦 — 人脑用20瓦完成认知——Rao 30年前的顿悟起点,也是模拟计算路线宣称可大幅削减AI功耗的基准参照(→ 对照上一条:同一个 20 瓦锚点,两位讲者独立引用) · Naveen Rao & Konstantine Buhler · 2026-02 · 访谈
- 99% from AI-native companies — 按推理次数算99%来自AI原生公司——说明企业市场几乎未开发,是机会的量化下限 · Tuhin Srivastava · 2026-05 · 访谈
- 95% of token volume — Baseten上95%的token量涉及特定模型修改/后训练——'vanilla开源直接用'的时代已结束 · Tuhin Srivastava · 2026-05 · 访谈
- 3-5yr term + 20-30% TCV prepay for 1,000 H100/B200 — 顶级云买千卡的门槛条款——说明算力采购已变成重资本长周期豪赌,倒逼推理公司尽早上市 · Tuhin Srivastava · 2026-05 · 访谈
- 90 clusters / 18 clouds; mid-90s% utilization; 30x growth — 供应紧缺比外界想象严重:几乎无闲置算力,需跨18云抽象出运行时织物来保SLA · Tuhin Srivastava · 2026-05 · 访谈
- 100 步 → 4-8 步 — 通过蒸馏让小模型学教师模型的简化输出分布,用 4-8 步达到原 100 步的生成质量——配合 <100ms 的实时交互延迟硬门槛,是实时视频生成的成本关键 · Ethan He · 2026-06 · 访谈
- 10x/year — 模型效率年增10倍但总消耗指数上升——杰文斯悖论的实时案例 · Brendan Foody · 2026-06 · 访谈
- 10x/年 — AI 工作负载年增速把硬件推到物理极限,是数据中心硬件从公用品变高利润品的根因 · Alex Sacerdote (Whale Rock Capital) · 2026-06 · 访谈
- 3 倍价格 ↔ 10-20% 性能(Opus 4.7 vs 5.5) — 前沿模型边际性能的边际成本急剧递增,是模型路由(routing)成为运营必需的直接论据;但多模型商互相施压+开源追赶会抑制定价 · Gabe Pereyra (Harvey 联合创始人) · 2026-06 · 访谈
- 约 7 倍(Gemini 3.5 Flash vs 前沿模型完成速度) — benchmark 应按每美元/每秒质量切分而非只看总分——性价比权衡才支撑生产级选型决策(Niko 的数据) · Niko (Harvey 研究员) · 2026-06 · 访谈
- 100x(100 tokens vs 100,000 tokens) — 把组织上下文训进权重后,模型可用约 100 token 回答前沿模型需读 10 万 token 上下文才能答的问题——两个数量级的推理成本削减,是权重内化取代 RAG 论点的核心经济学 · Dan Biderman & Jessy Lin (Engram) · 2026-06 · 访谈
- 80 GB HBM / 一篇维基文章(模型全权重才 ~100 GB) — 一篇几十 KB 的文章的 KV cache 在 70B Llama 上要占约 80GB 显存,而记住了"整个互联网"的全部权重也才约 100GB——梯度下降的信息压缩效率远超 KV cache,是把推理成本转移到训练侧的物理依据 · Dan Biderman & Jessy Lin (Engram) · 2026-06 · 访谈
"And the entire weights of the model would be about 100 gigabytes. And, you know, with some distortion, they remember the entire Internet. ... Whereas this KVCache thing, you take a few tens of kilobytes of article and it becomes those 80 gigabytes of brain state."「整个模型的权重大约是 100GB。而且,他们在一定程度的失真下,记住了整个互联网。……而这个 KVCache 的东西,你用几十 KB 的文章,它就变成那 80GB 的脑状态。」Dan Biderman (Engram) · Memory and Continual Learning: Engram's Dan Biderman and Jessy Lin
- 1000x 更小 — 若离线花计算把 80GB 的 KV"脑状态"压缩进权重/适配器,加载体积可缩小三个数量级,对速度和保真度都有巨大影响(→ 对照上一条:同一账本的解法侧) · Dan Biderman & Jessy Lin (Engram) · 2026-06 · 访谈
- $1,000–$100,000(ballpark) — 用公开模型 5.5 + 通用 scaffold 复现 Erdős 单位距离猜想反证的推理成本:已发布模型中埋着大量"低垂果实",没人系统投入六位数推理算力去推公开模型的极限 · Noam Brown (OpenAI) · 2026-06 · 访谈
- 10–100x / 模型发布周期(每 2-3 个月) — 解决同类复杂问题的成本随每代模型的下降幅度:推理成本坍塌快于探索速度,造成"等下一代模型"比"榨干当前模型"更划算的怪异经济学(→ 对照 2026-02 Elad Gil 的 88x/11mo:周期口径再刷新) · Noam Brown (OpenAI) · 2026-06 · 访谈
- ≈95%/次查询 — 把低复杂度但高频的任务后训练到开源模型上的成本节省(引用 Cognition 的工作)——模型路由/编排层的经济价值来源 · Ev Randle (Benchmark) · 2026-07 · 访谈
- 5-6% MFU — 科学模型 RL 训练栈的平均浮点利用率只有 5-6%:GPU 标称峰值算力实际只用到零头,优化训练栈是比买更多 GPU 更大的未开发杠杆 · Andy Beam & Rafa Gómez-Bombarelli · 2026-07 · 访谈
- 8:1 → 1:1(GPU:CPU) — 推理拐点之后 AI 工作负载的 GPU 对 CPU 配比从 8:1 变成 1:1,倒逼计算、存储、网络资源紧密共置——数据中心形态被推理经济改写的量化信号 · Akshat Bubna (Modal) · 2026-07 · 访谈
- 10x ↓ → 100x ↑ — 推理成本每压缩 10 倍预计触发 100 倍用量激增,当前正处 S 曲线爆发早期、瓶颈在供应链(→ 对照 2026-06 Brendan Foody 的 10x/年效率增速:杰文斯悖论的供需两侧口径) · Lin Qiao (Fireworks) · 2026-07 · 访谈
- 1000 万 tokens — 即使上下文扩到千万 token,context rot 依然存在——喂得越多模型越混乱、无法对数据整体推理,长上下文不是记忆问题的解(→ 对照 2026-06 Engram 的 80GB KV cache:同一条"预填充范式不可持续"的账) · Dan Biderman · 2026-07 · 访谈
- 60 倍(QR 分解,Blackwell 级硬件) — 人工优化的定制内核比通用库快 60 倍,因此自动生成内核是解锁此前无法规模化运行的新架构实验的关键瓶颈(→ 对照 2025-09 Tri Dao 的"放弃 5% 性能换 3x 生产力":抽象层的代价在此被具体标价) · Jerry Tworek & Rohan Anil · 2026-08 · 访谈
- 约 2×2×2 倍;30-40 → 300-400 token/s — 量化约 2 倍、投机解码约 2 倍、prefill/decode 分离约 2 倍——推理优化追求的是 4-10 倍数量级堆叠而非从 70 分到 90 分的增量,落地口径是解码速度从每秒 30-40 token 提到 300-400 · Philip Kiely & Ali Taha (Baseten) · 2026-08 · 访谈
- 1T 参数 @ 20 瓦 — Oak 持续学习心智的能耗目标:Khurram 直言以当前内存技术不可能(仅存储 1T 参数就要超过 20 瓦),但认为配上正确算法是 5-10 年内的目标——把人脑级能效当成设计约束(→ 对照本节 2026-02 两条 ~20 瓦人脑锚点:参照物首次变成工程指标) · Rich Sutton & Khurram Javed · 2026-08 · 访谈
- 2,000 瓦(今天)→ 20 瓦(10 年后) — Sutton 的摩尔定律算术:每 18 个月翻倍,10 年 ≈ 两个数量级,所以 20 瓦目标要可信,今天就得能用 2,000 瓦做到;Khurram 认为正确算法现在就能低于这个数(→ 对照上一条:同一目标的可行性检验) · Rich Sutton & Khurram Javed · 2026-08 · 访谈
- 5-10x(后训练降推理成本) — 同一预算就能扛 5-10 倍流量——让创业公司和大厂都不至于"规模化进破产"的杠杆:大厂 CFO 真的会因为成本压着 AI 功能不让上线(→ 对照 2026-07 同氏的 10x ↓ → 100x ↑:从行业供需口径落到单公司损益表) · Lin Qiao (Fireworks) · 2026-08 · 访谈
- 5x(同一开源模型、同一 NVIDIA 硬件) — 专业推理商对 AWS/Azure/GCP 的速度差,外加只有懂单位经济才看得见的数倍吞吐差——付着云厂商的毛利跑在其上还能赚钱,证明"把模型跑好"本身是稀缺的专业能力 · Eric Vishria (Benchmark) · 2026-08 · 访谈
"And you're like, wait a minute, this is the same open source model with the same NVIDIA hardware. And there's a 5x performance difference and a multiple x throughput difference. And the way to just simply understand that is these companies are paying the margins of the cloud providers and running on top and making money."「您会想,等一下,这是相同的开源模型,使用相同的 NVIDIA 硬件。而且还有 5 倍的性能差异和多个 x 的吞吐量差异。简单理解这一点的方法是,这些公司正在支付云供应商的利润并在其上层运行,获得利润。」Eric Vishria (Benchmark) · Eric Vishria - A Decade of Lessons Investing in Software & Hardware
- 450,000 核 / ~20GB 片上 SRAM(Cerebras 初代晶圆级芯片) — 硬件仅有的三个改进维度(更多核、更强核间通信、内存贴近计算)在一张晶圆上同时推到逻辑极限 · Eric Vishria (Benchmark) · 2026-08 · 访谈
训练与 CapEx
两条主线:数据质量 > 数据数量(专家数据溢价成为行业定价);capex 从美元计价换成吉瓦计价,回本算术仍没有答案。
- 10-15% — 只有当任务对业务工作流至关重要、额外10-15%的性能提升有决定性价值时,才值得做强化微调,否则等下一代模型即可 · Isa Fulford (OpenAI) · 2025-04 · 访谈
- 对数线性(log-linear) — 模型智能与训练计算量呈对数线性关系——每个智能增量都要求计算量指数级增长,预训练收益递减是固有的而非意外。 · Bob McGrew (OpenAI 前研究主管) · 2025-06 · 访谈
- 全部数据中心跑数月;下一代需新建数年 — 一次预训练要占用所有数据中心几个月,而下个模型需要一座新数据中心(数年工期)——解释预训练节奏为何被基建锁死。 · Bob McGrew (OpenAI 前研究主管) · 2025-06 · 访谈
- ~100 个样本 — 强化微调(RFT)达到领域前沿能力所需的数据量级——远比 SFT 数据高效且不易出错。 · Michelle Pokrass (OpenAI) · 2025-06 · 访谈
- 10%→50% 通过率 — 如果微调能把通过率从 10% 提到 50% 但仍不够产品化——说明该能力在风口浪尖,几个月后的新模型会直接碾压它。 · Michelle Pokrass (OpenAI) · 2025-06 · 访谈
- 数十亿美元(高估一个数量级) — 有公司在 SFT/RLHF 遗留数据上花了数十亿美元,但实际所需少一个数量级——众包标注模式正在崩溃,钱正流向专家评估 · Brendan Foody (Mercor CEO) · 2025-06 · 访谈
- 3.6–3.9 bits/parameter (fp32 transformer) — 「Morris 常数」:32 位精度训练的 Transformer 每个参数只能存约 3.6-3.9 比特信息,32 位里只用了 3-4 位,说明模型存储效率有巨大改进空间 · Jack Morris · 2025-07 · 访谈
- 1,000 条人工 > 10,000,000 条合成 — 一千条高质量精选人工数据对模型训练的价值可超过一千万条合成数据 · Edwin Chen · 2025-07 · 访谈
- 99% 无用 — 客户花六个月攒了 1000-2000 万条合成数据,最后发现 99% 没有价值——合成数据被普遍高估 · Edwin Chen · 2025-07 · 访谈
- $500B Stargate (Abilene ~10%) — 星门初始承诺 5000 亿美元、钱不在银行账户里边建边融——为下一代 AI 服务融资建设史无前例算力 · Sam Altman · 2025-08 · 访谈
- 10-100x — 今天能提供的服务与 10 倍乃至 100 倍算力能提供的服务之间'差距大得不可思议'——算力需求远未饱和是 Stargate 的核心论据 · Sam Altman · 2025-08 · 访谈
- 30名研究生×2年 ≈ 随机水平 — DCLM研究:最顶尖的人类专家花两年设计过滤标准后,仍无法以高于随机的准确率预测数据质量分类器的判断——人工直觉在数据筛选上失效 · Ari Morcos · 2025-08 · 访谈
- ~$500B/年 — 全行业每年AI基础设施支出约5000亿美元——这是'更好的架构值多少钱'的分母:省10倍成本或提前1-2年到AGI都价值巨大 · Tri Dao · 2025-09 · 访谈
- 中位 $95/hr、顶级 $500/hr(vs 众包 ~$30/hr) — Mercor 专家中位时薪 95 美元、顶级专家 500 美元,是 Scale/Surge 众包范式的 3 倍——高盛银行家、医生律师给模型写评估的市场化价格,'高素质专家+善待'取代'低价众包' · Brendan Foody · 2025-09 · 访谈
- 10GW ≈ $400B — 每10吉瓦AI工厂约合4000亿美元,须靠承购收入+股权+债务三条腿融资——这是他回应'循环收入'质疑的账本 · Jensen Huang · 2025-09 · 访谈
"10 gigawatts is like $400 billion, something like that. And that $400 billion will have to be largely funded by their offtake, right, their revenues, which is growing exponentially. It has to be funded by their capital, the money they've raised through equity, and whatever debt they can raise."「10 吉瓦大约就是 4000 亿美元。这 4000 亿主要要靠他们的承购——也就是指数增长中的收入——再加上股权融资和能募到的债务来买单。」Jensen Huang · NVIDIA: OpenAI, Future of Compute, and the American Dream
- $200-500/次 — 单次微调运行本身很便宜,真正的成本不在算力 · Kyle Corbitt (OpenPipe/CoreWeave) · 2025-10 · 访谈
- ≥2周工程师时间(RL环境需数月) — 微调/RL的真实成本是前期搭建训练系统,外加此后每次改prompt都要重训带来的迭代变慢 · Kyle Corbitt (OpenPipe/CoreWeave) · 2025-10 · 访谈
- 七位数($1M+) — 大实验室在RL环境初创公司上的采购至少七位数,说明'环境'是RL scaling的核心瓶颈与生意 · Kyle Corbitt (OpenPipe/CoreWeave) · 2025-10 · 访谈
- $600B收入缺口 — $150B英伟达芯片≈$300B数据中心投资,按50%毛利需$600B终端收入回本——'客户的客户是否健康'至今没有答案 · David Cahn · 2025-10 · 访谈
"If you invest $150 billion in NVIDIA chips, that's about $300 billion of data center investments. And to pay that back, the person using the compute needs to earn a 50% gross margin. So there's about $600 billion of revenue that needs to get generated. ... The question behind the question was, is the customer's customer healthy?"「买 1500 亿美元的英伟达芯片,约等于 3000 亿美元的数据中心投资;要回本,用这些算力的人得按 50% 毛利挣出约 6000 亿美元收入。……问题背后的问题是:客户的客户健康吗?」David Cahn (Sequoia) · 20VC: Sequoia's David Cahn on The Winners and Losers in AI
- $40B/GW(Vera Rubin代$50-60B) — 行业改用吉瓦而非美元宣布交易,掩盖了每吉瓦约400亿美元、且宣布时仅10-20%资金到位的事实(→ 对照上一条与 Jensen 的 $400B/10GW:三个口径互相印证) · David Cahn · 2025-10 · 访谈
- 2x / 3个月 — AI模型规模与容量每三个月翻倍,要求系统性能每年增长10-16倍——远超摩尔定律,必须靠网络层创新补足 · Michael Kagan (Nvidia CTO) · 2025-11 · 访谈
- ~10x/年 — 'Huang-Kagan定律'斜率约每年一个数量级;产品节奏已从两年一代加速到一年一代,每代性能提升10倍 · Michael Kagan (Nvidia CTO) · 2025-11 · 访谈
- 数百-数千样本 — 强化微调只需数百到数千个样本即可定制模型,远比SFT数据高效,使应用层模型定制终于成立(→ 对照 2025-06 Pokrass 的 ~100 样本:量级一致) · Brendan Foody (Mercor) · 2025-11 · 访谈
- 100x smaller training runs — 机器人领域的训练算力比前沿 LLM 小约 100 倍,说明机器人瓶颈在硬件经济性而非软件 · David Owen & Yafah Edelman (Epoch AI) · 2025-11 · 访谈
- 数倍于最终训练 run 的开支 — 实验算力获得的资金是正式发布模型训练 run 的许多倍,成为反驳纯软件奇点的关键证据 · David Owen & Yafah Edelman (Epoch AI) · 2025-11 · 访谈
- ≈印第安纳州首府全城用电 — Anthropic/Amazon 数据中心用电接近一座州首府城市,Colossus 2 建设周期不到两年——扩张速度只受资金约束 · David Owen & Yafah Edelman (Epoch AI) · 2025-11 · 访谈
- 38亿条游戏片段 — Medal 积累的 3.8B 游戏剪辑构成人类巅峰行为数据集,是世界模型训练的独家底料 · Pim De Witte (General Intuition) · 2025-12 · 访谈
- ~$100B/年 — Stargate 每年千亿美元级算力投资,说明大厂在算力、能源、数据上的支出规模(→ 对照 2025-08 Altman 的 $500B 总承诺:这里是年化口径) · Jonathan Siddharth (Turing) · 2025-12 · 访谈
- 0.5B–10B 参数 — 企业定制模型的主流区间:小模型在保险承保等专有任务上比万亿参数大模型更快更准,且数据不外流——是永久需求而非过渡 · Jonathan Siddharth (Turing) · 2025-12 · 访谈
- 2-3人×~1年,2018-19年即可达GPT-3.5级 — 带着完整后见之明,几个有才华的人网起几台 GPU 盒子在 2018-19 年就能做出 ChatGPT 3.5 级模型——后训练技巧可换取大量有效算力 · John Schulman (Thinking Machines) · 2025-12 · 访谈
"You could have gotten something that was ChatGPT 3.5 level maybe back in 2018 or 2019 with a couple people."「你本可以在 2018 或 2019 年用几个人得到一些达到 ChatGPT 3.5 水平的东西。」John Schulman (Thinking Machines) · John Schulman on dead ends, scaling RL, and building research institutions
- 1人/1机/约半年 — NanoChat 由一人半年在单机上写成,是复现 chat 模型成本的当代上界 · John Schulman (Thinking Machines) · 2025-12 · 访谈
- $150/hr vs $22/hr — 专家给AI标注/生成数据的时薪对比教书时薪,解释了专家供给为何涌向数据业务(→ 对照 2025-09 Mercor 时薪:专家数据溢价已成行业定价) · Garrett Lord · 2025-12 · 访谈
- ≥50% — Surge目前一半以上业务已在纯文本之外(多模态数据),前沿数据需求早已越过语言模型 · Edwin Chen · 2025-12 · 访谈
- 2yr + 3-5yr lifetime — 今天设计的TPU两年后进数据中心、再服役三到五年——芯片设计必须预测2-6年后的ML计算形态 · Jeff Dean (Google) · 2026-02 · 访谈
- ~200 行 Python — MicroGPT:去掉效率优化后,训练 LLM 的核心算法只有约 200 行 Python——其余全部代码复杂度都来自效率需求 · Andrej Karpathy · 2026-03 · 访谈
"Training neural nets and LLMs specifically is a huge amount of code. But all of that code is actually complexity from efficiency. It's just because you need it to go fast. If you don't need it to go fast and you just care about the algorithm, then that algorithm actually is 200 lines of Python."「训练神经网络、尤其是 LLM,代码量巨大。但那些代码其实都是效率带来的复杂度——只是因为你需要它跑得快。如果不需要快、只关心算法本身,那这个算法其实就是 200 行 Python。」Andrej Karpathy · Andrej Karpathy on Code Agents, AutoResearch, and the Loopy Era of AI
- 落后数月 — 开源模型落后闭源数月且在收敛;对绝大多数消费级用例,当前开源模型已经够用,差距主要是资本支出 · Andrej Karpathy · 2026-03 · 访谈
- 15 years of capacity in 15 months — 微软以'15个月建成过去15年量级'的速度扩数据中心——史无前例的capex节奏,靠agentic系统而非线性加人来运营 · Satya Nadella · 2026-06 · 访谈
"We built in the last 15 months more Azure capacity than we built in the first 15 years."「过去 15 个月我们建成的 Azure 容量,超过了最初 15 年建成的总和。」Satya Nadella (Microsoft CEO) · The Rise of the Full-Stack Builder and Hyper-Leveraged Generalist
- 9 TFLOPs (original Transformer rig) vs 100s TFLOPs (single consumer GPU today) — 当年训练初代Transformer的机器性能不及今天桌下一块消费级GPU的零头——激进架构实验已平民化 · AI Research Legend(未具名Transformer元老,疑为Łukasz Kaiser) · 2026-06 · 访谈
- PB-scale storage ≈ GPU compute cost — 视频大模型训练本质是IO受限问题——存取PB级视频数据的成本与GPU算力成本相当 · Ethan He · 2026-06 · 访谈
- 18-24个月 — 资本转化为可售算力的物理周期:6个月内砸钱无用,一年半到两年才见产能——AI 基建的经济学节拍 · Roman Chernin (Nebius) · 2026-06 · 访谈
- ≈10 个数量级 — 预训练缩放规律保持有效的跨度:每次瓶颈都被更细致的研究/数据工程突破,"没有理由现在失效"——反驳"预训练已死"的核心证据,也是持续投资大规模预训练的依据 · Mark Chen (OpenAI CRO) · 2026-06 · 访谈
- 3–5 个/org — OpenAI 每个研究组织纳入主路线图的重大赌注数:少量大赌注给定向大额算力,其余留灵活算力池给经理自由分配——前沿实验室研究组合管理的实际粒度 · Mark Chen (OpenAI CRO) · 2026-06 · 访谈
- 10 万亿(实验验证的科学 token) — 不是原始数据而是实验验证过的推理轨迹(英语+工具调用+实验反馈的混合),万亿级规模开始出现涌现能力,参数劣势下仍能立即提升性能(→ 对照 2025-07 Edwin Chen 的 1,000 条人工 > 1,000 万条合成:质量口径从"人工精选"换成"实验验证") · Andy Beam & Rafa Gómez-Bombarelli · 2026-07 · 访谈
- 10 万亿参数 — 10T 参数模型目前还缺乏好的系统设计——瓶颈不是单颗芯片,而是把芯片互连成系统的"整体包" · Lin Qiao (Fireworks) · 2026-07 · 访谈
- 118B 总参 / 8B 激活,预训练启动到发布 5 周 — "模型工厂"工业化流水线的产物:靠稀疏架构加持久性行为跑赢两倍参数量的模型;工厂唯一的核心优化指标是"研究员想法到实验结果的速度"(每月 1-2 万次实验) · Eiso Kant (Poolside) · 2026-08 · 访谈
- 120 天 — xAI 自任总承包、用第一性原理砍掉分包商层级后 120 天建成数据中心,而行业报价超过一年——AI 基建的真实工程下限(→ 对照 2026-06 Roman Chernin 的 18-24 个月资本转化周期) · Igor Babushkin (xAI) · 2026-08 · 访谈
- 250 万专家小时(仅 Q2) — Mercor 人才网络过去 24 个月为搭建 RL 环境投入的专家时间,且增速还在加快——"专家小时"成为 agentic 数据的产能单位(→ 对照 2025-09 的中位 $95/hr、顶级 $500/hr:从单价口径补上总量口径) · Brendan Foody (Mercor) · 2026-08 · 访谈
- $50–$10,000/任务;有前沿实验室每月买 5 万个任务 @ ~$2,000 — agentic 数据的按任务定价:成本基准(10 小时 × $150/小时专家 ≈ $1,500)叠加前沿价值溢价(→ 对照 2025-10 Kyle Corbitt 的七位数环境采购:RL 环境从项目制走向按任务计价的市场) · Brendan Foody (Mercor) · 2026-08 · 访谈
- 4.7% → 26.6%(corporate law) — GLM 4.7 仅用 1,800 个任务、约 $500K 算力做后训练在 Apex Agents 企业法务上的提升,且泛化到没有这些数据室的 GDPVal 与 Apex V1(→ 对照 2025-06 Pokrass 的 ~100 样本与 2025-11 Foody 的数百-数千样本:数据高效后训练的最新实证) · Brendan Foody (Mercor) · 2026-08 · 访谈
"…you can see the jumps just on 1800 tasks with about 500K in compute. These are pretty dramatic. Corporate log going from 4.7% to 26.6%. But notice that this is just the Apex Agents dataset we gave it, and it actually generalized incredibly well to GDPVal and Apex V1, which doesn't have these data rooms…"「……你能看到在大约 500K 计算下的 1800 个任务的跳跃。这些变化相当显著。企业日志从 4.7% 上升到 26.6%。但注意,这仅仅是我们提供的 Apex Agents 数据集,实际上它在 GDPVal 和 Apex V1 上泛化得非常好,即使在没有这些数据房间的情况下……」Brendan Foody (Mercor)(转录将 corporate law 误作 Corporate log) · RL Environments Explained: How AI Agents Learn Real-World Work
- 数百万亿 tokens/天(被整体丢弃) — "万亿 token 问题":生产推理每天以这个量级生成模型成败的真实信号,却被当垃圾扔掉而不是变成训练信号——持续学习论的原料账本 · Ronak Malde (Trajectory) · 2026-08 · 访谈
- ~100T tokens — agent 做真实工作生成却被丢弃的 token 量级——关闭"经验差距"(与 IQ 正交的经验轴)的原材料(→ 对照上一条:同一账本的存量与流量两种口径) · Arjun Karanam (Trajectory) · 2026-08 · 访谈
- 120B → 500B → 1T 参数(OPSD 扩展范围) — 在线策略自蒸馏的失败模式("but/wait"对冲坍缩、工具调用报错、run 间高方差)只在 120B+、50-100 次工具调用时浮现——学术论文恰好停在这之前;加上步级散度加权与残差引导后,120B 在需要 100+ 次工具调用的 Mercury APEX 任务上超过了 RL · Ronak Malde (Trajectory) · 2026-08 · 访谈
- 2 个并发任务 → 墙钟减半;8 并发 ≈ 3 个串行的耗时;正扩到 16 并发 / 235B 模型 — Continual LoRA(与 Berkeley Sky RL 联合开源)把训练池与采样池分离,让持续学习的并发任务共享固定 GPU 而不损性能 · Ronak Malde (Trajectory) · 2026-08 · 访谈
- 3 个月 → <1 个月 → 1 周 — 客户模型训练周期的压缩:首个客户约三个月"边飞边造飞机",Harvey 随后不到一个月训完,最新客户一周内完成接入并训完模型 · Ronak Malde (Trajectory) · 2026-08 · 访谈
- ~15 分钟(实际动手时间) — 在 Trajectory beta 上后训练、评估、对比并部署一个模型的 hands-on 成本(不含训练墙钟):后训练"5000 万个旋钮"的研究员直觉被幕后 agent 接管(→ 对照 2025-10 Kyle Corbitt 的 ≥2 周工程师时间:训练系统的搭建成本被平台吞掉) · Arjun Karanam (Trajectory) · 2026-08 · 访谈
- 每几个月一代(Cursor 后训练节奏) — 从去年初就上了中训/后训的车,Composer 2.5 已与前沿实验室质量比肩——"大胆的目标是做得到的"之证明(→ 对照 2026-08 Poolside 的预训练启动到发布 5 周:模型工厂化的两个样本) · Lin Qiao (Fireworks) · 2026-08 · 访谈
定价·毛利·商业模型
定价锚正从软件预算(美国 ~$1T)切换到人力预算($20T—$80T);客服是第一个 ROI 完全可量化的用例。
- $450B vs $35B — 客服人力成本4500亿美元 vs 客服软件市场350亿美元:AI'按工作收费'打开的是十倍于软件预算的人力预算 · Jacob Effron, Scott Raney, Patrick Chase, Alex Bard (Redpoint) · 2025-04 · 访谈
- $200/月 — ChatGPT 顶级 SKU 定价——AI 公司能从第一天就向消费者收高价,商业模式质量高于上一代靠网络效应慢慢变现的消费公司。 · a16z 消费团队 panel(未具名) · 2025-06 · 访谈
- 10 小时工作/次 — Deep Research 类工具可替代十小时人工工作,使 $200/月 订阅对个人也容易合理化。 · a16z 消费团队 panel(未具名) · 2025-06 · 访谈
- $60T(全球 GDP 的 60%) — 全球 $100T GDP 中 60% 是人类劳动——AI 是能自主'干活'的劳动力而不只是生产力工具,这就是 KP 的顶层市场测算。 · Mamoon Hamid · 2025-08 · 访谈
- up to 80% — Decagon 客户把客服成本最高砍掉 80% 且同时改善解决率和满意度——AI 吃的是服务预算而非软件预算 · Martin Casado & Sarah Wang · 2025-08 · 访谈
- ~10x — 人力预算通常比软件预算大一个数量级——AI应用从'对标软件成本'切换到'对标业务问题'是收入天花板抬升的核心机制。 · Jesse Zhang · 2025-09 · 访谈
- 3-5x ROI → ~3x value capture — 给客户3-5倍投资回报最有说服力,自己约捕获所替代价值的三分之一;很多客户在AI代理上的花费已超过之前的客服CRM。 · Jesse Zhang · 2025-09 · 访谈
- 60-80% — AI客服完全跑起来后的良好解决率区间,具体取决于AI被授予多少执行动作的权限。 · Jesse Zhang · 2025-09 · 访谈
- 60-70% — Decagon 案例研究中部分大企业联络中心运营成本降低60-70%——大企业采购AI客服的第一衡量指标是效率,第二是客户满意度。 · Jesse Zhang · 2025-09 · 访谈
- 65% — Intercom 的 FIN agent 已解决约 65% 的进线客服工单——就业冲击的实证数据点。 · Nathan Labenz · 2025-10 · 访谈
- 17-20M agents — 全球联络中心历史人工座席规模;软件市场数百亿美元、AI 市场预计高数百亿——被低估的巨型市场。 · Ping Wu & Doug Leone · 2025-10 · 访谈
- ~25% — 联络中心约四分之一交互是创收型(销售/催收/挽留)——它不是纯成本中心,自动化的价值计算要重做。 · Ping Wu & Doug Leone · 2025-10 · 访谈
- $200-300/月 — ChatGPT顶级SKU $200、Google Ultra $250、Grok $300——消费者首次自发为软件付出此等价格,是'消费投资文艺复兴'的证据(→ 对照 2025-06 的 $200:顶级 SKU 价格带半年内扩到 $300) · Kevin Rose & Anish Acharya · 2025-10 · 访谈
- $20T vs $1T — 美国劳动支出约20万亿美元、软件仅1万亿——AI真正争夺的是那20万亿的劳动预算,而非软件预算(→ 对照 2025-08 Mamoon 的 $60T 全球口径) · Michael Barton (Coatue) · 2025-11 · 访谈
- $30T — 数字知识工作自动化对应 30 万亿美元的市场规模——AI 价值创造的本质是预算从人力转移到技术 · Jonathan Siddharth (Turing) · 2025-12 · 访谈
- $20k/年 收费的'功能' — 过去只算一个功能的东西现在能收 2 万美元,因为它替代的是一整个人头——定价锚从软件预算换成了工资 · 未署名嘉宾(AI 护城河圆桌) · 2025-12 · 访谈
- ~10亿用户中付费 <5000万 — 消费级 AI 最大的悬念:如何货币化剩余 95% 的用户——广告等新模式的空间所在 · David George (a16z Growth) · 2025-12 · 访谈
- 95% — OpenAI 95% 的消费者用户是免费的——这是其论证必须引入广告的经济学前提(→ 对照上一条:官方口径确认) · Sarah Friar & Vinod Khosla · 2026-01 · 访谈
- ~1B users / 30M paying; $1B+/month burn — 免费替代品未对付费造成价格压力;货币化10亿免费用户的上行空间远大于3000万付费者的降价风险,burn 主要来自研发(→ 再对照:货币化 10 亿免费用户成为消费级 AI 最大悬念) · David George (a16z Growth) · 2026-01 · 访谈
- +50%回收收入 — Salient做AI汽车贷款催收不只省成本,而是为客户多收50%的钱——'创造价值'比'节省成本'更难被替换 · a16z 合伙人(未具名) · 2026-01 · 访谈
- 5x收入 — Velex买断西班牙全部法律记录再叠加AI,收入翻五倍——围墙花园数据策略的量化案例 · a16z 合伙人(未具名) · 2026-01 · 访谈
- 5x+律师收入 — Eve自动化证据收集/医疗年表/索赔函后,原告律师可接案量与收入提升五倍以上 · a16z 合伙人(未具名) · 2026-01 · 访谈
- US software spend ~1% GDP vs white-collar payroll ~20% GDP — AI 的市场空间锚定在白领工资而非软件支出,因此影响将远超移动和云 · David George (a16z Growth) · 2026-01 · 访谈
- $20B topline; 3x capacity → 3x revenue — 每上一批推理算力都被100%订完——'不是泡沫'论的核心证据 · Anish Acharya (a16z) · 2026-02 · 访谈
- 80% / 20% — 各基础模型80%功能互为替代、20%是专家能力——多模型世界里聚合层(应用公司)价值的来源 · Anish Acharya (a16z) · 2026-02 · 访谈
- 8-12% of spend — SaaS只占企业支出8-12%;AI的真正大市场是切入人力预算,且转移已在发生 · Anish Acharya (a16z) · 2026-02 · 访谈
- 40x — 大科技的AI业务需增长40倍才能兑现,但相对其现有业务体量'其实不算多'——因为这是预算迁移而非净新支出 · Martin Casado (a16z) · 2026-02 · 访谈
- $20/月 → 数百/月 → 数千至数万/月 — tab补全约$20/月、高级本地模型数百美元/月、并行云代理预期数千到数万——'双子座悖论':工具越强,个体杠杆越大,愿付价格指数级抬升 · Cursor 团队(嘉宾未具名) · 2026-03 · 访谈
- 数万亿美元 — 即使今天暂停模型开发,现有能力仍有数万亿美元经济价值未释放——瓶颈是应用AI市场的不成熟而非模型智能 · Bret Taylor · 2026-03 · 访谈
- 70-90%(RAMP达90%) — Sierra客户全量部署后AI自动解决客服案例的比例;剩余进入人工的案例更难,平均处理时长反而上升但坐席满意度提高 · Bret Taylor · 2026-03 · 访谈
- 90%×90% → 99% — 推理模型90%正确+监督模型90%正确,链式串联后整体有效性达99%——'模型星座'架构的核心算术 · Bret Taylor · 2026-03 · 访谈
- 15-20% → 50-80% — Decagon将客服自动解决率提升的典型幅度——客服的ROI早已被内部追踪,所以极易量化论证,这是客服成为最清晰AI用例的原因之一(→ 对照 2025-09 Decagon 的 60-80%:口径一致,提升幅度补全) · Jesse Zhang · 2026-03 · 访谈
- 8x(对比文本) — 语音到语音模型的幻觉率是文本AI的8倍——语音是最大前沿但对企业场景尚未就绪,且人脑对口语'不对劲'极度敏感 · Jesse Zhang · 2026-03 · 访谈
- 六位数合同(零 ARR 时) — 客服是他们探索的所有想法中唯一让客户在其 ARR 为零时就愿签六位数合同的赛道——付费意愿即市场真实性的判据 · Jesse Zhang (Decagon) · 2026-03 · 访谈
- 20% 效率增益 — Legora 的 token 支出规则:不设预算而按机会成本算——多花 token 若能给工程师或用户带来20%效率提升几乎总是值得 · Jacob Lauritzen (Legora CTO) · 2026-06 · 访谈
- 10% / 90% — AI 让产品「表面」的10%极易复制,但边缘案例、审计日志、RBAC、规模稳定性这90%才是企业级软件的真壁垒 · Jacob Lauritzen (Legora CTO) · 2026-06 · 访谈
- $80万亿 — 应用层 AI 要切入的实体产业规模(金融、法律、医疗、物流)——五层蛋糕最顶层的市场体量(→ TAM 阶梯的最高一档:$35B 软件 → $1T 软件 → $20T 人力 → $80T 实体产业) · Jensen Huang · 2026-06 · 访谈
- $20 → $20,000 — Harvey 单次查询成本区间:简单起草 vs 十万份合同审查——agentic 工作流让同一产品内单任务成本方差达 1000 倍,是消耗计费失控焦虑的根源 · Gabe Pereyra (Harvey 联合创始人) · 2026-06 · 访谈
"We have simple like assistant type queries where you say, you know, draft me a document that a single query can cost $20. We have like a review product where you can upload 100,000 contracts and ask the models to review them. And some of those can cost $20,000."「我们有一些简单的助手类型查询,比如说,给我起草一份文件,而单个查询可以花费 20 美元。我们还有一个审查产品,你可以上传 100,000 份合同并要求模型进行审查。其中一些可能会花费 20,000 美元。」Gabe Pereyra (Harvey) · Harvey Co-Founder Gabe Pereyra on the Token Pricing Reckoning Coming for AI
- $250–300/月 — 顶级消费 AI 订阅价格(主持人 Anish Acharya 引用:ChatGPT $250、Grok $300、Gemini Ultra $300):消费者付费意愿惊人,但推理成本非零意味着没有巨额资产负债表就做不了免费大众产品(→ 对照 2025-10 Kevin Rose 期的 $200-300/月:价格带站稳) · Josh Elman (a16z) · 2026-06 · 访谈
- $15M/18个月(外包)→ $1M/3个月(内部+Devin) — Cognition 向企业卖的不是 token 而是明确定义的项目级 ROI:约 15 倍成本差、6 倍时间差 · Scott Wu (Cognition) · 2026-06 · 访谈
- 75-80% — Cognition 企业收入占比:刻意押注企业级真实代码库(5 万文件迁移、Java 7→8 之类重复任务)而非个人爱好者,认为这才是 agent 首个 PMF 场景 · Scott Wu (Cognition) · 2026-06 · 访谈
- $100K–$1M TAM — 新兴 bespoke 软件的可行市场规模(主持人/a16z 提出,Maeda 与 Bakaus 认同):开发成本坍缩使以前经济上不可行的小众市场变得可做——软件回归"数字主街"模式的经济学基础 · John Maeda (Microsoft) & Paul Bakaus (Impeccable) · 2026-06 · 访谈
- $3,000/月/开发者(≈$36,000/年) — 单个开发者在 Claude Code 上的自付支出:SaaS 时代整个客户 $50K ACV 就算不错,现在按"每开发者"收这个数还在涨——agent 把定价单位从席位许可变成白领工作量(→ 对照 2026-03 Cursor 的 $20/月→数千至数万/月:同一条价格抬升曲线) · Ev Randle (Benchmark) · 2026-07 · 访谈
"We were talking with developers and companies in our portfolio and they're like, yeah, we have Developers that are spending, you know, $3,000 per month themselves, like each on Cloud Code. So it's like, wow, okay, so that's $36,000 per developer."「我们与投资组合中的开发者和公司交流时,他们说,确实有开发者每个月自己花费 3,000 美元,像是每个人在 Cloud Code 上。所以就像,哇,好吧,那每个开发者是 36,000 美元。」Ev Randle (Benchmark) · Benchmark's AI Bets
- 九位数($100M+)合同 — 推理平台与初创公司之间的合同规模:传统 SaaS 几乎没有对任何客户的九位数合同,更别说对初创公司——P×Q×M 中的 P 可以极高,即使毛利低于 70% · Ev Randle (Benchmark) · 2026-07 · 访谈
- 10 倍(云合同续约涨价) — 早期云厂商先补贴获客、续约时提价 10 倍,企业由此留下疤痕——这是今天坚持模型无关架构、拒绝单一模型供应商锁定的根本原因 · Matan Grinberg (Factory) · 2026-07 · 访谈
- >90% 企业 AI 用例 — 开源/多模型即可覆盖九成以上企业用例,Glean 按任务动态选模型控成本,开源能以极低成本产出同质量答案时就用开源(→ 对照 2026-02 Anish Acharya 的 80%/20% 可替代性:商品化口径继续上移) · Arvind Jain (Glean) · 2026-07 · 访谈
- 70-80% 毛利约束 — 若早期就强加 70-80% 毛利率约束会扼杀创新——AI infra 层现阶段的低毛利是优先超增长与实验的战略选择(→ 对照 2026-07 Ev Randle 的九位数合同:P 可以极高,即使毛利低于 70%) · Lin Qiao (Fireworks) · 2026-07 · 访谈
- 30% 成本降幅 → 客户不裁员而扩服务 — 支持成本降 30% 后客户并未裁员 30%,而是扩大服务覆盖——杰文斯悖论在企业 AI 的实证案例 · Jesse Zhang & Ashwin Sreenivas (Decagon) · 2026-08 · 访谈
- 90% 跑在微调开源模型上 — Decagon 的对话代理九成用微调后的开源模型,换取性能/延迟/成本"三重胜利",仅 10% 探索性新项目用前沿模型(→ 对照 2026-07 Arvind Jain 的 >90% 用例:应用层的开源占比与用例占比同时逼近九成) · Jesse Zhang & Ashwin Sreenivas (Decagon) · 2026-08 · 访谈
- 90%(他人主张的"现有模型即可覆盖的企业工作流") — 主持人引用"90% 企业工作流现有模型即可处理、只剩 10% 小众市场"的说法,Nitski 认为它只反映显性需求、忽略潜在需求(→ 对照上一条:同一个九成,一个当成本手段、一个当机会终点) · Osvald Nitski (Mercor CPO) · 2026-08 · 访谈
- 数万亿美元(推理服务收入展望) — Altman 称即使在万亿美元级推理收入上只有适度利润率,也足以训练下一代巨型模型——所以蒸馏根本不入他的十大担忧 · Sam Altman · 2026-08 · 访谈
- $100B(市场研究行业) — 被点名然后被拒绝的 TAM:模拟是服务一切人类决策的工具,不只是市场研究——用现成行业规模框定模拟公司反而框小了 · Joon Sung Park (Simile) · 2026-08 · 访谈
- $3B/年(单家美国食品分销商的托盘搬运人力) — 一家大型食品供应商仅叉车搬运工资一项就 30 亿美元/年——网约车不过是实体"轮距"自动化(货运、包裹、外卖)的沧海一粟(→ 对照 2026-06 Jensen 的 $80T 实体产业:顶层市场的单点样本) · Travis Kalanick · 2026-08 · 访谈
增长与规模
收入爬坡的新基准线:$1B→$10B 从二十年压缩到一年;agent 采用曲线(任务时长每 4-7 个月翻倍)是能力侧最重要的单一指标。
- 4万→1500万 (2024.3→2025.3) — E2B 沙箱一年用量增长375倍,Claude 3.5/3.7 Sonnet 发布后显著加速,说明agent工作负载从实验转向生产 · Vasek Mlejnsky (E2B) · 2025-04 · 访谈
- 100x(近几年) — LLM 推理用量的疯狂普及等同2000年互联网、2010年移动的时刻,判定'现在是十多年来创业最佳时机' · Victor Lazarte (Benchmark) · 2025-04 · 访谈
- Mercor 11个月 / Brex 18个月 — AI 时代收入爬坡速度的新标杆,传统'$10M 收入即领先'的 SaaS 基准已失效 · Victor Lazarte (Benchmark) · 2025-04 · 访谈
- $300M — Cursor 达到3亿美元 ARR——AI 编码工具变现速度的行业标杆(从第一行代码到发布仅数月,增长为持续指数型) · Michael Truell (Anysphere/Cursor) · 2025-05 · 访谈
- 数小时 — Claude 4 解锁了连续数小时无人值守的代理任务(如大规模代码重构)——代理任务时长是能力代际的标尺。 · Ben Mann (Anthropic 联合创始人) · 2025-06 · 访谈
- ChatGPT > Twitter(25万粉) — 5 月 10 日至录制时,ChatGPT 给 Lenny's Newsletter 带来的流量已超过其 25 万粉丝的 Twitter——AI 平台作为分发渠道的拐点信号 · Robert McCloy (Scrunch AI) · 2025-07 · 访谈
- 流量6x / 转化率9x — 身份验证公司 Clerk 针对性优化 AI 想引用的内容类型后,ChatGPT 来源流量涨 6 倍、转化率提升 9 倍——AI 流量质量高于普通搜索 · Robert McCloy (Scrunch AI) · 2025-07 · 访谈
- 7亿活跃用户 — Meta AI 靠 Instagram 搜索兜底导流成为'沉默的怪物'——AI 爱好者圈几乎不讨论,但分发体量惊人 · Robert McCloy (Scrunch AI) · 2025-07 · 访谈
- 约90% — 她们估计 TikTok/Reels/YouTube Shorts 上约 90% 的内容已是 AI 生成——AI 视频从技术论坛玩具到吞噬主流信息流的规模刻度 · Olivia Moore & Justine Moore (a16z) · 2025-07 · 访谈
- $4B → $9B (Anthropic, 2025) — Anthropic 收入预测因 Claude Code 从今年 40 亿美元上调至 90 亿美元——但她反复追问:毛利率是多少?收入若是负利润率就没意义 · Steph Palazzolo · 2025-08 · 访谈
- 18% → 50%+(2月至今) — 视频模型占Fal收入份额从2月的18%涨到超过50%,由混元视频等高质量开源模型驱动——生成媒体的重心正快速从图像转向视频 · Gorkem & Batuhan (Fal) · 2025-09 · 访谈
- 全球第5大网站 — ChatGPT已是世界第五大网站,若保持轨迹将成为第一——'免费AGI'触达数十亿人的分发规模 · Sam Altman & Vinod Khosla · 2025-09 · 访谈
- $1M → $500M run rate(17 个月) — 自称史上最快收入增长,比 Cursor 从100万到5亿快一个月;Scale被收购后公司规模翻了4倍(同月另一期录制口径为 16 个月到 $400M——增速本身仍在加速) · Brendan Foody · 2025-09 · 访谈
- 6x vs Google search — Webflow 来自LLM的流量转化率是谷歌搜索流量的6倍——多轮追问把购买意图预先淬炼过,AEO线索质量远高于SEO。 · Ethan Smith · 2025-09 · 访谈
- 600M vs 3B MAU — AI答案引擎约6亿独立月活 vs Google搜索30亿——新入口渗透率已达老入口的1/5 · James Cadwallader & Martin Rehak · 2025-09 · 访谈
- ~2h, doubling every 4-7 months — METR 口径的 agent 任务时长曲线,衡量 agent 能力最重要的单一指标。 · Nathan Labenz · 2025-10 · 访谈
- multi-hour @50%, ~1hr @80% — 前沿模型在50%成功率下能做多小时软件工程任务,80%成功率下约一小时——且历代模型都落在同一条外推曲线上(→ 对照上一条 METR 曲线:历代模型落在同一条外推线上) · Sherwin Wu (OpenAI) · 2026-02 · 访谈
- 80% of AI startups (using open models) — 『80% AI 初创用中国开源模型』大概率为真,但只统计用开源模型的公司;按实际用量加权商业模型仍占多数。 · Nathan Labenz · 2025-10 · 访谈
- 30-40% of queries at peak — NanoBanana 上线后部分国家高峰时段 Gemini 查询中图像类占 30-40%——单一功能改变产品使用结构。 · Josh Woodward · 2025-10 · 访谈
- 2/3自建 vs 1/3外购 — MIT报告被误读的关键分母:企业2/3的AI项目是自建或咨询公司代建,外购专业初创方案的1/3成功率显著更高 · Garry Tan & Lightcone hosts (YC) · 2025-11 · 访谈
- ~5% — 企业AI需求汹涌但实施极难、仅约5%项目奏效——主持人认为这是初创公司的机会清单而非AI失败的证据 · Garry Tan & Lightcone hosts (YC) · 2025-11 · 访谈
- 70:30 — Sora上线初期创作者与消费者比例达70:30,远超社交产品常态,证明生成式AI能促创作而非只促消费 · Bill Peebles, Rohan Sahai & Thomas Dimson (OpenAI Sora) · 2025-11 · 访谈
- ~1/3 — 她引用OpenAI研究:约三分之一的ChatGPT使用是写作帮助——证明聊天框界面只解锁了简单用例 · Eugenia Kuyda (Replika/Wabi) · 2025-11 · 访谈
- ~10亿 — 已有近十亿人用AI聊天工具但只用于搜索/写作,说明瓶颈在界面而非需求 · Eugenia Kuyda (Replika/Wabi) · 2025-11 · 访谈
- $1→$100M revenue run rate in 11 months — Mercor 自称硅谷增长最快公司:11 个月内 ARR 从近零冲到一亿美元(→ 对照 2025-09 两期:$1M→$400-500M 用 16-17 个月——同一家公司的增速叙事逐月刷新) · Brendan Foody · 2025-11 · 访谈
- $0 → $100M(7个月) — Handshake AI靠给前沿模型供数据,7个月从零做到一亿美元业务——AI数据市场的爆发速度 · Garrett Lord · 2025-12 · 访谈
- $190M ARR — 法律AI应用层的收入标尺——垂直应用在模型商阴影下仍能快速做大 · Winston Weinberg · 2026-01 · 访谈
- 6x — 前沿企业的 AI 使用强度是中位数企业的 6 倍,企业侧能力差距巨大 · Sarah Friar & Vinod Khosla · 2026-01 · 访谈
- ≤30% — Khosla 估计大多数用户只用到了 AI 全部能力的 30% 或更少——需求瓶颈在人不在模型 · Sarah Friar & Vinod Khosla · 2026-01 · 访谈
- $0→$50M ARR — AI 公司创造了'四分钟一英里'式的新基准:见过别人从零到 5000 万后,任何不快速增长的公司都要先回答'为什么不能' · Vinod Khosla & Keith Rabois · 2026-01 · 访谈
- 365B searches: ChatGPT 2 yrs vs Google 11 yrs — ChatGPT 达到3650亿次查询只用了谷歌1/5.5的时间——AI建立在互联网+云之上可即时全球分发 · David George (a16z Growth) · 2026-01 · 访谈
- 2025 cohort +50% vs 2024; 2x companies to $10M ARR in 3 months — 2025年新公司队列增长快50%、三个月内达千万美元ARR的公司数翻倍——创业加速不是暂时异常(iOS发布+60%、GitHub push+41%) · Patrick & John Collison (Stripe 年度信) · 2026-02 · 访谈
- $1B→$10B: ~20yr (ADP/Adobe) → 8-9yr (Salesforce/MSFT) → 3-5yr (Google/Meta/AWS) → ~1yr (AI labs) — 收入从10亿到100亿美元所需时间的代际压缩——AI实验室预计一年走完 · Elad Gil & Sarah Guo · 2026-02 · 访谈
- 693% YoY; $1M revenue/FTE — 离群AI公司同比增速693%、人均收入高达100万美元——比SaaS前辈更快且销售费用更少 · David George (a16z Growth) · 2026-02 · 访谈
- ~$50B — 当前AI赋能收入约500亿美元、年增速远超100%,比早期云计算的采用曲线陡得多 · David George (a16z Growth) · 2026-02 · 访谈
- 0→$10M ARR(极短时间) — 本周期最大的不同:过去把'0到1'重定义为0到$1M ARR,如今公司以史无前例的速度冲到$10M ARR——启动资源更少、收入留存更好 · Alfred Lin · 2026-03 · 访谈
- $1B run-rate; 5T tokens/天 — 发布仅数天的 GPT-5.4(Codex)即达 10 亿美元运行率收入、日处理 5 万亿 token——模型改进周期在坍缩(5.1→5.2→5.3→5.4) · Brad Lightcap (OpenAI) · 2026-04 · 访谈
- 95%集中在前4-5个蓝链 — 人类认知带宽有限导致的旧SEO经济学——与agent的『无限带宽』形成对照 · James Cadwallader (Profound) · 2026-04 · 访谈
- 单次查询用65个网页 — 一个agent为回答『买哪个淋浴喷头』综合了65个网页——agent消费互联网的表面积远超人类(→ 对照上一条:人类认知带宽 vs agent 无限带宽,SEO 经济学的地基置换) · James Cadwallader (Profound) · 2026-04 · 访谈
- $25B annualized — 私有 AI 公司(OpenAI/Anthropic)在上市前就达到万亿美元估值和 250 亿美元年化收入,速度远超 Mag 7 历史轨迹 · Philippe Laffont (Coatue CIO) · 2026-06 · 访谈
- ~前几个百分点 — 即便技术先进的大公司也只用到潜在 AI 用例的极小部分——Chernin 用此论证基建热潮不是泡沫(→ 对照 2026-01 Khosla 的 ≤30%:供给侧与需求侧同一判断) · Roman Chernin (Nebius) · 2026-06 · 访谈
- 100-1000x — agent 普及后搜索查询量的预期放大倍数——现有搜索基础设施完全没有为这种吞吐而建 · Will Bryk (Exa) · 2026-06 · 访谈
- 10^12 → 10^15 页 — 从万亿页到千万亿页:agent 想要的世界数据远超当前索引,检索算法成本不能随规模指数化 · Will Bryk (Exa) · 2026-06 · 访谈
- ~2% — 会 C++ 编程的人口比例——40年来技术越复杂会编程的人越少,AI 用自然语言编程反转了这条技术鸿沟曲线 · Jensen Huang · 2026-06 · 访谈
- 数十万个 — NVIDIA 公司内部当前运行的 agent 数量——agent 经济在英伟达内部已先行落地 · Jensen Huang · 2026-06 · 访谈
- $2–$100/股 — Robinhood 推荐奖励股票的彩票式价值区间:拿到 $100 股票的人到处炫耀,拿到 $2 的人也觉得"拥有了一股"——变动奖励优于固定 give-10-get-10,获客成本不随竞价通胀(他亲历 Robinhood) · Josh Elman (a16z, ex-Robinhood) · 2026-06 · 访谈
- 13 万亿 tokens — Harvey 累计 token 消耗(主持人转述 Winston 的说法,Gabe 确认量级):垂直应用层公司已成为实验室最大的 token 消费者之一,用量爆炸发生在最近 6 个月 · Gabe Pereyra (Harvey 联合创始人) · 2026-06 · 访谈
- ≈3000 万人 — 全球会编程的人数(Weil 自己的估算):AI 把编程人口扩大几个数量级 → 创造力爆发——"高自主性者时代"论的分母(→ 对照 2026-06 Jensen 的 ~2% 会 C++:同一条技术鸿沟曲线) · Kevin Weil (OpenAI) · 2026-06 · 访谈
- ~$1M → $500M+(约20个月) — Cognition 收入增长(主持人引述,Scott 确认"不止于此")——AI coding agent 赛道收入曲线本身就是指数曲线的例证(→ 对照 2025-09 Mercor 的 $1M→$500M/17个月:新标杆彼此咬合) · Scott Wu (Cognition) · 2026-06 · 访谈
- $20-30M ARR — 企业 SaaS 的玻璃天花板(Trae 12 年观察):管理得当的公司都能到 2-3 千万 ARR,但穿越这条线的概率断崖式下跌——而市场正逼着 1-5 百万 ARR 的创始人讲"今年到 30"的故事 · Trae Stephens (Founders Fund) · 2026-07 · 访谈
- 900 万+开发者 — Supabase 的开发者规模:AI 代理充当后端选型"瓶颈"带来爆发增长——agent 最容易集成的基础设施赢得新时代的分发 · Accel 成长团队 · 2026-07 · 访谈
- 50%(Ask DoorDash 的新餐厅发现率) — 使用自然语言界面的订单轨迹中一半来自用户从未点过的餐厅,杂货购物篮同时增大 40%——界面换代实质性改变发现行为 · Andy Fang & Stanley Tang (DoorDash) · 2026-07 · 访谈
- ~$50B/年(传闻口径) — Lenny 称 Anthropic 据传年收入约 500 亿美元——相当于过去成功公司 IPO 时的整体估值,而公司成立仅约三年 · Dianne Penn 访谈(主持人 Lenny 引述传闻) · 2026-08 · 访谈
- ~10 亿 MAU(ChatGPT 的设计分母) — 核心设计张力:给 10 亿月活(从免费用户到月付几百美元的都有)守住"默认极简",同时把前沿工具先递到权力用户手里(→ 对照 2026-01 David George 的 ~1B users / 30M paying:同一分母的设计侧账) · Ian Silber (OpenAI 设计负责人) · 2026-08 · 访谈
- 数万至数十万 agents(当前运营规模) — 每周采集数万真人的行为数据、面板伙伴关系全球通达数千万人——对已部署的企业核心用例"这个人口已然足够" · Joon Sung Park (Simile) · 2026-08 · 访谈
- 25 agents(2023 Smallville) — 斯坦福生成式 agent 小镇(记忆+规划+反思)跑出涌现的情人节派对筹备——公司的原点(→ 对照上一条:三年三个数量级) · Joon Sung Park (Simile) · 2026-08 · 访谈
- 9,000 万客户(CVS 想模拟的体量) — 合作方(CVS 人类洞察高级副总裁)想用自有数据模拟其约 9000 万客户的反应,乃至模拟财报电话会(→ 对照上两条:25 → 数十万 → 瞄准 9000 万的规模弧线) · Joon Sung Park (Simile) · 2026-08 · 访谈
- $1B → $2B run rate(约 4 个月) — 主持人开场口径(非 Foody 本人):Mercor 作为前沿实验室最大 agentic 数据供应商的增速(→ 对照 2025-09 的 $1M→$500M/17 个月与 2025-11 的 11 个月 $100M:同一家公司的增速叙事第三次刷新) · Brendan Foody 访谈(主持人引述) · 2026-08 · 访谈
- 2026 队列 +50% vs 2025(2025 曾 +70% vs 2024);上半年注册 +50% YoY;新 SaaS 平台队列 +103% — AI 拓宽市场(Suno 类产品第一次成为可能)+ agentic 编码压低构建成本;"SaaS 已死"叙事下新 SaaS 平台队列反而翻倍(→ 对照 2026-02 Stripe 年度信的 2025 队列 +50%:下一年队列继续加速) · Will Gaybrick (Stripe) · 2026-08 · 访谈
- >$7B EBITDA run rate;SBC 后 ~75% 现金转化 — 约为三年前水平的 20 倍——万亿美元市值目标背后的现金引擎 · Adam Foroughi & Giovanni Ge (AppLovin) · 2026-08 · 访谈
- ~25%(哥伦比亚人口) — Angela Strange 在 a16z 的第一张支票 Addi,如今为四分之一哥伦比亚人提供银行/支付——"敞开市场" vs 美国"第五个金融服务"红海之争的论据 · Angela Strange & Gabriel Vasquez (a16z) · 2026-08 · 访谈
人效与组织
AI 写代码的占比、单人杠杆与组织形态:人均产出取代人头数成为核心指标,token 支出开始超过工资单。
- 50-100 天 — Google Labs 从最初想法到把 AI 产品交付到最终用户手中的目标周期。 · Josh Woodward (Google Labs) · 2025-05 · 访谈
- 95%+ — Anthropic 内部估计 Claude Code 的代码 95% 以上由 Claude Code 自己编写——瓶颈随之转移到决策、协调和合并队列。 · Mike Krieger (Anthropic CPO) · 2025-06 · 访谈
- 熟悉领域1.5x / 陌生领域5x — Anthropic 最顶尖工程师自述编码代理带来的加速:熟悉领域 1.5 倍,新语言或生疏领域 5 倍——AI 研究本身正被加速 · Sholto Douglas (Anthropic) · 2025-06 · 访谈
- $1B+ 收入 / ~100 人 / 零融资(4 年) — Surge 完全 bootstrap,不到五年做到年收入超 10 亿美元、员工不足百人,人均产出约 1000 万美元——数据公司靠技术而非人海(2025-12 另一期口径不变) · Edwin Chen · 2025-07 · 访谈
- 80% 用于理解系统 — 工程师 80% 时间花在理解复杂系统和协作而非写代码——这是做「代码理解 agent」而非代码生成的立论基础 · Misha Laskin · 2025-07 · 访谈
- 3 人 — IMO 金牌模型的核心团队只有三个人(依托 OpenAI 基础设施)——前沿突破的最小作战单元可以极小 · Alex Wei, Sheryl Hsu & Noam Brown · 2025-08 · 访谈
- 每诊所 1 名后台 — 医疗账单公司借 LLM 让 10-15 人诊所只需 1 名后台人员——AI 让以前不敢提的商业承诺变得可兑现。 · Garry Tan · 2025-08 · 访谈
- 6 engineers x 3 months -> 1 weekend — AI 辅助编码让过去需要六名工程师三个月的项目,如今他和朋友两人一个周末就能完成——瓶颈因此转移到产品管理 · Andrew Ng · 2025-08 · 访谈
- $50M+ ARR, cash-flow positive — Gamma 以刻意精简的团队做到 5000 万美元以上 ARR 且现金流为正——反例是烧钱补贴推理成本的竞争对手已死掉或转向 · Jon Noronha · 2025-08 · 访谈
- $500M ARR with 0 salespeople — Canva 在达到 5 亿美元 ARR 前没雇过一名销售——PLG 能在巨大规模下成立的极端证据,Gamma 沿此路径 · Jon Noronha · 2025-08 · 访谈
- 10-15% -> 30-50% (some 10x) — CTO 报告从 Copilot 时代的 10-15% 提升到一年后 Cursor 用户的 30-50%、个别 10 倍——AI 采购从'凭感觉试验'转向有形 ROI 的标志 · Martin Casado & Sarah Wang · 2025-08 · 访谈
- 数百个 PR/天(单个重度用户) — OpenAI 内部重度用户每天用 Codex 生成数百个 PR,验证了代理编码的实际价值并指导产品方向 · Mark Chen & Nick Turley · 2025-08 · 访谈
- 1.5x — 顶级kernel研究者自述Claude Code让他的生产力提升约1.5倍——写Triton内核'相当不错',o3级推理模型能做高水平优化头脑风暴(→ 对照 2025-06 Sholto 的 1.5x/5x:顶尖工程师自估口径趋同) · Tri Dao · 2025-09 · 访谈
- 85% — Barton自评其85%的工作可由AI完成,Coatue正据此招分析师重构内部工作流 · Michael Barton (Coatue) · 2025-11 · 访谈
- 20个团队×5-10人 — 约20个完全独立的小产品团队并行发布,用可容忍的重复换取交付速度 · Mati Staniszewski (ElevenLabs CEO) · 2025-11 · 访谈
- 25% since 2015 → projected 70% by 2030 — LinkedIn 全站数据显示 AI 正在加速职位技能构成的换血速度 · Ryan Roslansky · 2025-11 · 访谈
- 4 employees at $1M ARR — 首次跨过百万 ARR 时全公司只有 4 人,刻意小团队高人效 · Adit Abraham · 2025-11 · 访谈
- $100k robot vs $20k/yr human — 造一台机器人 10 万美元,不一定优于年薪 2 万美元的人力——机器人本质是硬件经济学问题 · David Owen & Yafah Edelman (Epoch AI) · 2025-11 · 访谈
- 10-100x — 顶级程序员的工作已变成并行指挥 10 个编码 bot,生产力将比过去高 10 到 100 倍 · Marc Andreessen · 2026-01 · 访谈
- ~几千人/条 iPhone 产线 — 一条 iPhone 组装线需要数千名制造工程师;若 AI 能替代这层职能,美国在岸制造即获得巨大成本优势——AI 降本的对象是工程师而非工人 · Vinod Khosla & Keith Rabois · 2026-01 · 访谈
- 4% of all public GitHub commits — Claude Code 已署名 GitHub 全部公开提交的4%,且指数增长——AI从辅助转向直接作者的行业级证据 · Boris Cherny (Anthropic Claude Code 负责人) · 2026-02 · 访谈
"These numbers are just totally crazy, right? Like 4% of all commits in the world is just way more than I imagined. And like you said, it still feels like the starting point. These are also just public commits. So we actually think if you look at private repositories, it's quite a bit higher than that."「这些数字简直疯狂——全世界 4% 的提交,远超我的想象。而且这仍然只像是起点。这还只是公开提交;看私有仓库的话,比例还要高不少。」Boris Cherny (Anthropic) · Head of Claude Code: What happens after coding is solved
- +200% per-engineer, team 4x — Claude Code 团队自成立以来工程师人数扩大4倍的同时,人均生产力还提升了200% · Boris Cherny (Anthropic Claude Code 负责人) · 2026-02 · 访谈
- 1 year → 3 months — AI提速让企业计划周期从一年压缩到三个月,逼CEO成为更快的决策者 · Brian Halligan (HubSpot / Sequoia CEO coach) · 2026-02 · 访谈
- 95% daily — OpenAI 95%的工程师每天使用Codex · Sherwin Wu (OpenAI) · 2026-02 · 访谈
- +70% PRs — 用Codex的工程师PR多70%,且差距随熟练度继续扩大 · Sherwin Wu (OpenAI) · 2026-02 · 访谈
- 20-30 agents/engineer — 工程师已在同时管理20-30个Codex实例;他预期经理同理将管理大得多的团队 · Sherwin Wu (OpenAI) · 2026-02 · 访谈
- 7,000 → 3,000 — Klarna靠AI自动化+自然减员把员工数近乎腰斩,同时人均薪酬上升 · Sebastian Siemiatkowski (Klarna) · 2026-02 · 访谈
"We used to be 6,000 or over 7,000 people and we're now less than 3,000. And I didn't ask for a single dime to do all this."「我们过去有 6000 或超过 7000 人,现在不到 3000 人。我做这一切没要一分钱。」Sebastian Siemiatkowski (Klarna CEO) · 20VC: SaaS is Dead: Why Systems of Record Will Die in an Agentic World
- 700 — 著名的'AI客服替代700名客服'声明;他称即便以现在所知也不会改口 · Sebastian Siemiatkowski (Klarna) · 2026-02 · 访谈
- 100-1000x — 会用代理工具的工程师与不用者的产出差距——最低标准没变,但上限被极大抬高,个人影响力取决于用工具的能力与意愿(→ 对照 2026-01 Andreessen 的 10-100x:上限口径继续抬升) · Simon Last · 2026-03 · 访谈
- 每~6个月 — Notion定期彻底重写AI harness以贴合最新模型能力,且重写周期随进展加速还在缩短——'做一套然后守着'是多数公司犯的错 · Simon Last · 2026-03 · 访谈
- 新服务2小时上线可用 — Snap内部周五『vibe-code』一个全新服务点子,两小时内投入使用——执行成本坍塌的实例 · Evan Spiegel · 2026-04 · 访谈
- 35 hours/week — 传统会议型管理的信息获取成本——Chesky过去每周35小时开会只为拿到信息,AI founder mode要用异步流取代 · Brian Chesky · 2026-05 · 访谈
- 3 weeks → 2 days (~90% reduction) — 复现旧论文到可运行状态的耗时对比——coding agent让研究者从单线程转为三件事并行 · AI Research Legend(未具名Transformer元老,疑为Łukasz Kaiser) · 2026-06 · 访谈
- tokens > headcount (already at Mercor) — Mercor内部agent的token支出已超过员工工资总额——他预言的企业范式在自家先兑现 · Brendan Foody · 2026-06 · 访谈
"Like right now, we're spending more on tokens for our internal agents than we are on employee headcount. And I think most businesses are going to look like that."「就在现在,我们花在内部 agent token 上的钱,已经超过了员工人头开支。我认为大多数企业都会变成这样。」Brendan Foody (Mercor CEO) · 20VC: Mercor CEO on Why Application Layer Companies Have No Defensibility
- $20M liquid stock offers; 8-figure/yr packages — 顶级AI研究员的真实市场价:常见2000万美元流动股票报价,年包八位数——预计随技能扩散回归正常 · Brendan Foody · 2026-06 · 访谈
- 16%→80% (one quarter) — agent 驱动代码库中 AI 提交占比在一个季度内从 16% 升至 80%,说明 2025 年 12 月前后(Opus 4.5/GPT 5.2)跨过了自主性能力阈值(→ 对照 2026-02 Claude Code 占 GitHub 全站 4%:agent 驱动代码库内的占比已到 80%) · Walden Yan (Cognition) & Cole Murray (OpenInspect) · 2026-06 · 访谈
- 1 engineer + 2 founders — 第二产品 Merge Agent Handler 由 1 名工程师加两位创始人用 AI 工具做出,说明 AI 时代'桶'型人才的杠杆 · Shensi Ding & Gil Feig (Merge) · 2026-06 · 访谈
- 2x → 1,000x — 无限 AI 杠杆时代,处于手艺极端前沿者的溢价从 2 倍升至可能 1000 倍,根本改变个人才能的定价 · David Senra (Founders Podcast) · 2026-06 · 访谈
- 1850年约50% → 今天约10% — 人一生中花在工作上的时间占比的历史变迁——论证 AI 生产力红利会兑换成闲暇(更短工作周、更长退休)而非永久失业 · Tyler Cowen & Alex Tabarrok · 2026-06 · 访谈
- $2M → $300K/年 — 被 AI 取代的专业服务精英的收入路径变化量级——失去的是高薪自动通道而非生计,故过渡可管理 · Tyler Cowen & Alex Tabarrok · 2026-06 · 访谈
- <100人 — Exa 声称用不到100人建出对 agent 而言优于 Google 的搜索引擎——范式切换(服务 agent 而非人类点击)压缩了所需团队规模 · Will Bryk (Exa) · 2026-06 · 访谈
- 8x — Anthropic 工程师人均每季度交付代码量 vs 2025(主持人 Lenny 引用 Anthropic 官方推文,Fiona 确认并展开):编码已不是瓶颈,瓶颈转移到验证与高吞吐管理,且设计师、PM 也都在提交代码(→ 对照 2026-02 Boris Cherny 的 +200% 人均:同一家公司的口径继续抬升) · Fiona Fung (Anthropic, Claude Code/Cowork 团队负责人) · 2026-06 · 访谈
"Anthropic engineers on average ship eight times as much code per quarter as they did compared to 2025. Coding is no longer the bottleneck."「Anthropic 的工程师平均每季度提交的代码量是 2025 年的八倍。编码不再是瓶颈。」Lenny Rachitsky(主持人,引 Anthropic 官方推文;Fiona 确认) · Building the most AI-pilled engineering team in the world
- ~$10M ARR(退出一线)/ $100M(仍周期性亲自卖) — Lattice 创始人亲自卖到约 1000 万美元年收入才逐步退出销售一线,到 1 亿美元收入仍周期性亲自卖单只为"感受哪里觉得难"——销售是找到并加深 PMF 的最佳途径 · Jack Altman (Alt Capital / Lattice 前CEO) · 2026-06 · 访谈
- ~20 人 — 创始人角色从做事切换到造机器的员工数阈值:约 20 名员工后,CEO 的工作从"做产品服务客户"翻转为"构建做产品服务客户的机器" · Jack Altman (Alt Capital / Lattice 前CEO) · 2026-06 · 访谈
- 6–12 个月 — 判断研究员轨迹所需时间:入职前几乎无法识别顶尖研究员,入职后半年到一年才能看清谁有最强轨迹——前沿实验室人才评估的真实时间成本 · Mark Chen (OpenAI CRO) · 2026-06 · 访谈
- 10–100x — 模型优化他博士期间扑克算法的加速倍数:模型作为研究者的"放大器"已真实存在,执行与优化被数量级加速,但"研究品味"(选方向、提出更优新算法)仍是人类专属瓶颈 · Noam Brown (OpenAI) · 2026-06 · 访谈
- 80% 自动化 / 20% 留给人类 — 常规视觉设计可自动化比例(Maeda 估计):AI 吃掉 8 成机械性视觉工作后,人类设计师的 2 成转向高阶决策与 AX(为 agent 设计)——"AI 提高底线、人类提天花板"的量化版 · John Maeda (Microsoft VP of Design) · 2026-06 · 访谈
- 3 天 — OpenClaw 从零构建耗时:一个人几天做出以前需数月或根本不可能的产品——AI 时代开发速度的具体标尺(→ 对照 2025-08 Andrew Ng 的 6人×3月→1周末:同一条坍缩曲线) · Kevin Weil (OpenAI) · 2026-06 · 访谈
- 10倍(1名博士同时跑7-10个campaign) — 自驾实验室反转科研人效:他读博时是 10 个科学家做 1 个课题,现在 1 人管 7-10 个 campaign、每 1-2 天迭代——其对美国 R&D 竞争力论证的核心数字 · Joseph Krause (Radical AI) · 2026-06 · 访谈
- $100,000+/年(顶尖工程师 token 消耗) — 真正投入 Claude Code/Codex 的顶尖工程师年化 token 支出已超 10 万美元,占工程师薪资的可观比例——按人配 token 预算的前奏(→ 对照 2026-07 Ev Randle 的 $3,000/月/开发者:同一条曲线的年化口径) · Clay Bavor (Sierra) · 2026-07 · 访谈
- $150(面试 token 预算) — Sierra 工程面试废除白板算法题:给候选人 150 美元 token 和任选 coding agent 现场构建应用,考察的是架构判断与用 agent 的生产力 · Clay Bavor (Sierra) · 2026-07 · 访谈
- $3 亿/年 ≈ 开发者薪资的 3.8% — 主持人引 Benioff:每年花 3 亿美元买 Anthropic 给开发团队,仅占开发者薪资的 3.8%——这一比例停在 3.8% 还是走向 20%,决定当前 AI 公司估值是贵还是便宜 · Clay Bavor 访谈(主持人引 Benioff) · 2026-07 · 访谈
- 约 5% 员工 — AI 原生公司内部使用呈幂律:5% 员工跑高 token 的高级用例,其余只做信息检索和摘要——因此拒绝建"token 消耗排行榜"式激励 · Arvind Jain (Glean) · 2026-07 · 访谈
- 20 倍(1 月至 6 月的 AI 支出) — 半年内 AI 支出暴涨 20 倍,倒逼公司自建 DashBench 基准并转向"前沿模型+廉价开源模型"混合路由;非技术员工(客户经理自动化 QBR)用量增长最快 · Andy Fang & Stanley Tang (DoorDash) · 2026-07 · 访谈
- 5 年 → 6 个月 — "零 FTE 创业"模式:合作伙伴带问题来,小团队用 AI 编排的高通量实验以传统成本的零头替代多年单资产 biotech 研发(→ 对照 2026-06 Joseph Krause 的 1 人管 7-10 个 campaign:自驾实验室人效的两种口径) · Andy Beam & Rafa Gómez-Bombarelli · 2026-07 · 访谈
- $100k/年 token("时间机器"基准) — 现在肯每年烧 10 万美元 token,等于提前体验 2028 年的工作方式——alpha 窗口(→ 对照 2026-07 Clay Bavor 的 $100,000+/年:同一数字,一个是观察到的现状、一个是主张的门槛) · Dianne Penn (Anthropic) · 2026-08 · 访谈
- 10-100x(工程师)vs ~1x(设计团队) — OpenAI 工程师已用 AI 把生产力提高一到两个数量级,设计团队没有:设计混乱的试-废-迭代环仍要时间——设计师焦虑的结构性根源 · Ian Silber (OpenAI 设计负责人) · 2026-08 · 访谈
- 试 100 → 扔 99 → 上线 1;另一极 idea-to-ship ~4 小时 — ChatGPT 上死磕的耐久功能与 build-in-public 的实验功能并存——同一组织内两种极端的设计速度 · Ian Silber (OpenAI 设计负责人) · 2026-08 · 访谈
- 数十位强工程师 × 多个季度 → 1 人 × 几周 — 想法到生产、一行代码不用写——现成 API 套壳应用因此可被轻易克隆、不再构成护城河(→ 对照 2025-08 Andrew Ng 的 6 人×3 月→1 周末:坍缩曲线的下一格) · Lin Qiao (Fireworks) · 2026-08 · 访谈
- 7,000 PR/周 ≈ Stripe 全部 PR 的 30% — Stripe Minions(一击式编码 agent:不迭代、不进规划模式)的上周产出,1-2 月博客时还是 ~1,200 PR/周;minions 的 PR 占比被列为 Stripe 内部最重要指标之一(→ 对照 2026-02 Claude Code 占 GitHub 公开提交 4%、2026-06 agent 代码库内 16%→80%:一线大厂补上中间刻度) · Will Gaybrick (Stripe) · 2026-08 · 访谈
"And so we blogged about minions, I think in January, February, and they were doing 1,200, you know, PRs per week. And last week, I think 7,000 PRs came from minions. … And about 30% of our PRs in that week came from minions."「所以我们在一月和二月左右写了关于 Minions 的博客,他们每周做 1200 个 PR。而上周,我想说有 7000 个 PR 来自 Minions。……在那一周,大约 30% 的 PR 来自小黄人。」Will Gaybrick (Stripe) · Stripe's AI Strategy: Build More, Not Less
- ~100 工程师 / ~400 全员,三年未变 — 工程团队与 Ge 2022 年 11 月入职时同规模(公司更早从 600 裁到 400),期间业务扩张约 20 倍;团队"被 AI 抬升"而非加人,且几乎没有产品经理(→ 对照 2026-02 Klarna 的 7,000→3,000:一个靠收缩、一个靠冻结) · Adam Foroughi & Giovanni Ge (AppLovin) · 2026-08 · 访谈
- 11 人 — Trajectory 现有团队:三位斯坦福大一同周相识的联创(DeepMind、Apple 背景)快速扩张,成员来自 OpenAI、Meta Superintelligence、Amazon AGI、Stripe、Figma · Ronak Malde (Trajectory) · 2026-08 · 访谈
- 7 人(Harvey 应用研究团队) — 从零组建的小团队胜过挪用的平台团队之证据:Harvey 靠七人团队发表大量研究(Harvey Research 于演讲前一天官宣)(→ 对照 2025-08 IMO 金牌模型的 3 人核心团队:前沿产出的最小作战单元) · Sonya Huang (Sequoia) · 2026-08 · 访谈
估值与融资
AI 溢价(A 轮 +30% 持续一年未消)、幂律集中与泡沫算术。
- $3M-$10M ARR — AI 公司在早期即达此区间(旧时代 A 轮基准是$1M ARR),但收入成熟度与公司成熟度脱节,是新的风险源 · Jacob Effron, Scott Raney, Patrick Chase, Alex Bard (Redpoint) · 2025-04 · 访谈
- 120x 收入(Series B) — Mercury B 轮以 120 倍收入完成——支撑他'创始人应拿最高估值但别花掉'的亲历论据(当时融 $1.2 亿不知怎么花) · Immad Akhund (Mercury) · 2025-06 · 访谈
- 独角兽仅回报 8x — 种子入场价 2000-2500 万美元、稀释后投到独角兽也可能只有 8 倍——想做 10x 基金必须猎 $100 亿+ 的十角兽,独角兽狩猎时代已结束 · Immad Akhund (Mercury) · 2025-06 · 访谈
- 83% — 互联网泡沫周期中 83% 的风投利润产生于公认是泡沫的最后三年——提前喊泡沫离场等于放弃 83% 的利润。 · Josh Kopelman · 2025-08 · 访谈
- -1x / +1000x — 风投不加杠杆最多亏 1 倍但可能赚千倍——所以顶级基金的亏损率反而高于平庸基金,漏掉赢家(omission)比投错(commission)更致命。 · Marc Andreessen · 2025-08 · 访谈
- 后续轮估值平均高4倍 — 红杉在cap table上的信号效应使初创公司后续融资估值平均高出4倍,延长跑道、降低死亡率——品牌VC的可量化溢价 · Pat Grady · 2025-08 · 访谈
- $2B minimum raise — a16z 的经验法则:要在基础模型领域竞争,即使产品没什么进展也必须能融到至少20亿美元,否则投资人不该入场。 · Ben Horowitz · 2025-09 · 访谈
- $10M offered vs $200K asked — Databricks 创始团队(6个博士+教授)最初只想融20万美元,Horowitz 反手给1000万逼他们按真公司的规模思考。 · Ben Horowitz · 2025-09 · 访谈
- $10B (~20x run rate) — A 轮、B 轮均以约 100 倍收入倍数成交;而以 $500M run rate 看 $10B 传闻估值反而只有 20 倍——按增速'便宜',公司盈利到不需要融资,融资只为宣示 RL 环境市场领导者地位 · Brendan Foody · 2025-09 · 访谈
- $150-200B/yr in, >$1T/yr exits needed — 风投行业年投入要求 7000-8000 亿美元回报,即每年超万亿美元退出总额才合理——现实极少达成,故称『无回报风险』。 · Roelof Botha · 2025-10 · 访谈
- +30.9%($55M vs $42M) — 2025上半年融资的AI软件公司估值溢价30.9%,Lin认为源于服务市场扩张的信念,但承认付的是2-4年后的价格、'有点鲁莽' · Alfred Lin · 2025-10 · 访谈
- $500B→$5T — 为二级市场$500B估值辩护的算术:$4T的NVIDIA按10%复利十年超$10T,OpenAI若能到$5T则现在入场仍划算 · Alfred Lin · 2025-10 · 访谈
- 40% of S&P 500 — 七家公司占标普四成,类比90年代日本占全球股市43%(美国41%)随后解体——集中度本身是系统脆弱性 · David Cahn · 2025-10 · 访谈
- 80%+流向算力生产者 — 人人嘴上说要投'算力消费者',pitch book数据却显示八成以上AI美元仍流向生产端——言行背离的套利空间 · David Cahn · 2025-10 · 访谈
- ~20家/年 — 过去20-30年平均每年仅约20家公司实现≥$1B的真实退出,资金涌入并未改变该数字——'VC不是资产类别'的核心论据 · Roelof Botha · 2025-10 · 访谈
- $250M valuation / 10% dilution at $1.5M revenue — Benchmark 在营收仅 150 万美元时按约 167 倍营收倍数入场,反映 AI 人才赛道的估值锚 · Brendan Foody · 2025-11 · 访谈
- $2B valuation at $20M run rate, 4 months later — 四个月后估值翻 8 倍、仍按 100 倍 ARR 定价,展示这一轮 AI infra 融资节奏(→ 对照上一条) · Brendan Foody · 2025-11 · 访谈
- $29B(ChatGPT 发布前) — Thrive 在 ChatGPT 上线前以约 290 亿美元估值投资,当时只有两家机构给了 term sheet——需要信念而非竞争优势 · Philip Clark (Thrive Capital) · 2025-11 · 访谈
- $500M(OpenAI 出价,被拒) — GI 拒绝 OpenAI 5 亿美元收购数据的报价,选择自建独立世界模型实验室——给数据资产定价的罕见锚点 · Pim De Witte (General Intuition) · 2025-12 · 访谈
- 21x 收入,组合加权增速 112% — a16z 成长基金以 21 倍收入进入、组合美元加权增速 112%——高增长可以消化高估值的实证 · David George (a16z Growth) · 2025-12 · 访谈
- $1B 融资 @ $11B 估值 / ~100 人 — Kalshi 自称美国 AI 之外增长最快的公司,百人团队完成 10 亿美元融资;受监管交易所像银行一样需要准备金 · Tarek Mansour (Kalshi) · 2025-12 · 访谈
- 50%(最佳基金 Venture 12) — 红杉史上表现最好的基金一半项目清零——好的挑选不是不亏钱,而是足够高的不对称机会命中率 · Pat Grady & Alfred Lin (Sequoia) · 2025-12 · 访谈
- $300M(2009,募6个月)→ $15B(靠声誉完成) — 声誉复利的量化:一号基金3亿磨半年,最新150亿靠品牌直接落袋 · Marc Andreessen & Ben Horowitz · 2026-01 · 访谈
- top 1/3 firms = 2/3 of market cap (highest since 1963) — '分拣机'加速运转的证据:利润与市值向头部集中达60年来最高 · Patrick & John Collison (Stripe 年度信) · 2026-02 · 访谈
- Anthropic $360B vs OpenAI $500B — 主持人给出的两家实验室假想投资报价;他认为两者方向已分化不可直接比较 · Sebastian Siemiatkowski (Klarna) · 2026-02 · 访谈
- ~80% — AI驱动的公司贡献了标普500近80%的回报 · David George (a16z Growth) · 2026-02 · 访谈
- -40% in 50 years — 标普500成分公司平均寿命50年间缩短40%——颠覆加速的底层数据 · David George (a16z Growth) · 2026-02 · 访谈
- WorldCom $40B debt — dot-com基础设施靠负债400亿美元的WorldCom,而今天数据中心投资方账上有数千亿现金流——系统性风险的核心差异 · Martin Casado (a16z) · 2026-02 · 访谈
- 30% — Carta报告:名字或定位带AI的A轮公司估值溢价30%;Deedy认为对真正深入的少数团队而言溢价合理,因为人才池极度受限(→ 对照 2025-10 Alfred Lin 的 30.9%:溢价一年未消退) · Deedy Das · 2026-02 · 访谈
- $5M 种子或 $500M 成长 → 皆可赚 $10-100B — 投对的话两种支票规模都能赚百亿——所以风投的真实成本结构是错过(omission)远贵于亏损(commission) · Marc Andreessen · 2026-04 · 访谈
- 1,000x revenue — 当前 AI 公司融资估值达收入的 1000 倍,Merge 创始人以此说明市场泡沫程度并坚持看收入/毛利/burn/runway · Shensi Ding & Gil Feig (Merge) · 2026-06 · 访谈
- +30-40% QoQ — Coatue 跟踪的公司逐季超出盈利预期 30-40%,且盈利增长快到估值倍数持平或压缩——论证'高质量增长而非泡沫' · Philippe Laffont (Coatue CIO) · 2026-06 · 访谈
- 5x-7x — 电力/内存/半导体等'短缺卖方'的盈利能力在短期内增长 5-7 倍,市场奖励持有受限产能的一方 · Philippe Laffont (Coatue CIO) · 2026-06 · 访谈
- $3M ARR — 如今 Series A 公司的产品打磨度参照:他看到 300 万 ARR 的 A 轮公司产品已远比当年 Lattice 精致——产品质量的市场底线在 2015→2026 间显著抬高,"先上线破烂 MVP"的旧建议需修正(→ 对照 2025-04 Redpoint 的 $3M-$10M 早期收入区间:收入与质量基准同步抬升) · Jack Altman (Alt Capital / Lattice 前CEO) · 2026-06 · 访谈
- $380B 估值轮融 $30B;若 $1.5T 上市 = 35 个 Snowflake pre-IPO 轮 — 历史最佳 pre-IPO 轮(Slack/DoorDash/Snowflake/Nubank)规模 $500M-$2B、4 年回 2-5x;Anthropic 一轮的毛回报顶 35 个 Snowflake——AI 时代后期轮的绝对回报量级史无前例,"growth fund 才 $1B"的旧尺度失效 · Ev Randle (Benchmark) · 2026-07 · 访谈
- ~$700M vs $80-100M — Founders Fund 最新风险基金平均进入估值 vs 此前五期基金:入场价 7-9 倍膨胀是本轮泡沫最硬的内部证据——连他们自己做的种子轮都贵到抬高全基金均价(Delian 亲述本基金数据) · Delian Asparouhov (Founders Fund) · 2026-07 · 访谈
- 1% of deal size — FF 的 1% 机制:每笔投资按金额的 1% 留给经手团队成员个人跟投——用真金白银度量内部信念、消除政治化共识的激励设计,不跟投本身就是信号 · Trae Stephens & Delian Asparouhov (Founders Fund) · 2026-07 · 访谈
- 80%(净新投资仅20%) — FF 增长基金中加倍投资现有组合的比例:当组合里有年复合 30%+ 的 SpaceX/Anduril/Stripe 时,$30B 估值上的边际 IRR 不输 $500M 新公司——机会成本思维的极端体现 · Trae Stephens & Delian Asparouhov (Founders Fund) · 2026-07 · 访谈
- $200 亿(Facebook 二级市场买入) — Accel 在担忧上行空间的情况下以 200 亿美元估值买入 Facebook 老股,事后证明严重低估——教训是见到真正主导性的技术要敢于大规模下注并长期持有 · Accel 成长团队 · 2026-07 · 访谈
- 20 年 100 倍(亿万富翁数量) — 亿万富翁二十年间数量增长百倍导致稀缺性崩塌,是"亿万富翁见顶、发布者(poster)阶层接任祭司"论的量化依据 · Jeremy Giffon · 2026-07 · 访谈
- $2B(Windsurf 收购价;他放弃的个人份额) — 他训练的 SWE1"最终导向了 DeepMind 的 20 亿收购",随后放弃全部收购款创办 Trajectory——对持续学习的信念下注 · Ronak Malde (Trajectory) · 2026-08 · 访谈
- $3.5B(2013-08)→ $17.5B pre-money(约一年后,两个月关轮) — Gurley 劝他接第一份 term sheet(约 $6B 量级),他坚持跑完多会议室竞价流程,两个月后以 $17.5B 关轮——"流程重于价格"的案例 · Travis Kalanick · 2026-08 · 访谈
- 数千万美元/月(Uber 对滴滴的补贴烧钱) — 中国战争随后"全球化":中国主权财富基金向 Uber 在其他地区的对手注入数十亿美元,以抽干其资源 · Travis Kalanick · 2026-08 · 访谈
- -92%(上市头 18 个月)→ $100B 市值 — AppLovin 靠 Axon 2 翻盘:停掉投资者关系一年、把现金全部投进回购("做自己最好的投资人")、压低 SBC 稀释 · Adam Foroughi (AppLovin) · 2026-08 · 访谈
- 18 家 / 12 年 — Vishria 的个人投资节奏(每合伙人每年 1-2 家):高确信、高投入模型——"把球都打到旗杆边"的运气框架 · Eric Vishria (Benchmark) · 2026-08 · 访谈
- 30x → 6x(收入倍数压缩) — 2021 年上市的 SaaS 收入涨了 4 倍市值反而缩水;另有约 500 家收入 $100-500M 的私有 SaaS,员工和投资人错过退出窗口被锁死(→ 对照 2026-02 Collison 的 top 1/3 = 2/3 市值:分拣机的另一面) · Eric Vishria (Benchmark) · 2026-08 · 访谈
- 40%(a16z 应用类投资投向国际创始人) — 其中一半人在美国、一半在其他国家——"无国界创始人"策略的实际占比 · Angela Strange & Gabriel Vasquez (a16z) · 2026-08 · 访谈
- ~30 家(首次测绘时的拉美独角兽) — 少到能装进一个 WhatsApp 群——这个群成了整个无国界创始人战略的种子 · Gabriel Vasquez (a16z) · 2026-08 · 访谈
- 90%(风投历史回报出自硅谷公司) — 他想打破、也认为误导的惯用统计:很多"硅谷公司"的工程团队其实留在创始人母国;这个份额若降到 20-30% 他乐见其成 · Gabriel Vasquez (a16z) · 2026-08 · 访谈
其他关键数字
评估工程、世界模型、能源与其他不肯归类但值得记住的数字。
- ≥90% — LLM 法官与人工标注 ground truth 的一致率至少要达到90%,eval 才算可用——评估器本身的验收标准 · Aman Khan (Arize) · 2025-05 · 访谈
- ~3 个月 — AI 评估标准的'保质期'——进展太快、基准迅速饱和,评估集必须持续重造。 · Michelle Pokrass (OpenAI) · 2025-06 · 访谈
- 350万个演示文稿 — 在 Figma Slides 发布前,用户已在并非为此设计的 Figma Design 里做了 350 万份演示文稿——'用户破解产品'的需求信号可以量化到这个规模 · Yuhki Yamashita (Figma CPO) · 2025-06 · 访谈
- pass@1 vs pass@256 显著差距 — 许多评估在允许尝试 256 次时可完全解决但单次尝试不保证——可靠性(时间范围内成功率)才是衡量 agent 能力扩展的正确指标 · Sholto Douglas (Anthropic) · 2025-06 · 访谈
- 97% text recovery — 从单个文本嵌入向量中可恢复高达 97% 的原文,证明向量数据库交换 embedding 约等于交换明文数据,隐私假设不成立 · Jack Morris · 2025-07 · 访谈
- ~1 minute — Genie 3 生成的世界元素能持续约一分钟——受实时推理权衡限制而非根本限制,且无需显式 3D 表示即实现。 · Shlomi Fruchter & Jack Parker-Holder (Google DeepMind) · 2025-08 · 访谈
- AI 88% vs 医生 73% vs 医生+AI 76% — 斯坦福多中心研究:复杂诊断中 AI 单独准确率最高,医生介入反而把 AI 拉低到 76%——人机协作可能是减分项。 · Vinod Khosla · 2025-08 · 访谈
"AI alone, 88%. ... But then they gave the AI to the doctors. The doctors improved from 73% to 76%. The AI got degraded from 88 to 76%."「仅靠 AI,准确率 88%。……但后来他们让医生使用 AI。医生从 73% 提高到 76%。AI 从 88% 降到 76%。」Vinod Khosla · Vinod Khosla: Predicting the Future
- 5-10 examples POC / 100+ production — eval 黄金数据集的经验值:内部测试从 5-10 行起步,生产级置信度需 100+ 例(视行业监管程度) · Aman Khan · 2025-08 · 访谈
- 1 point on 300-scale in 4 years — 美国高中生中位数四年只在300分制量表上提高1分——高中阶段学习近乎完全停滞 · Joe Liemandt · 2025-09 · 访谈
- 20-30 hours/subject-grade — 用学习科学引擎掌握一个年级科目组合只需20-30小时(Math Academy四年级数学28小时、六七年级22小时) · Joe Liemandt · 2025-09 · 访谈
- 3-4 days + 30 min/week — 首次错误分析需3-4天密集标注(一次性成本),之后接入CI+cron后每周约30分钟即可维持 · Hamel Husain & Shreya Shankar · 2025-09 · 访谈
- 100 traces / ~1 hour — 人工看100条trace约1小时,产出的具体失败洞察远超任何幻觉/毒性自动评分——eval中ROI最高的一小时 · Hamel Husain · 2025-10 · 访谈
- 51,000 (2018) → 1,200 (2023), -98% — 监管不确定性下中国年新创公司数量五年跌 98%——创业者承担风险的意愿对政策极其敏感。 · Roelof Botha · 2025-10 · 访谈
- 86/100 — Harvey创立前的验证实验:GPT-3回答100个房东-租客法律问题,执业律师认为86个可不加编辑直接发给客户——连OpenAI法务都惊讶 · Sarah Guo & Elad Gil(回顾多位嘉宾) · 2025-11 · 访谈
- $75-80k → 数百美元/颗(10年) — 激光雷达传感器十年内成本下降约 300 倍,是硬件创业门槛坍塌的核心证据 · Philip Clark (Thrive Capital) · 2025-11 · 访谈
- 5/10 — 全球市值前十中五家是硬件公司(Apple、Nvidia、Broadcom、Tesla、TSMC),支撑硬件复兴论 · Philip Clark (Thrive Capital) · 2025-11 · 访谈
- 4秒记忆窗口 — GI 世界模型仅凭 4 秒记忆即表现出空间记忆,并继承数据集中的超人操作行为(→ 对照 2025-08 Genie 3 的 ~1 分钟:不同路线的记忆窗口) · Pim De Witte (General Intuition) · 2025-12 · 访谈
- 6-12个月 — 评估者不执行检查代码导致模型在华丽但错误的数据上退化,团队半年到一年才发现——坏测量的代价 · Edwin Chen · 2025-12 · 访谈
- 10s low-res non-realtime → 60s real-time photoreal in ~1 yr — Genie 2 到 Genie 3 一年间的跨越;一年前'实时1分钟一致性'还是 stretch goal,现在用户已嫌1分钟太短(→ 对照前两条:世界模型时长/记忆的进度线) · Google Genie 3 / Project Genie 团队 · 2026-02 · 访谈
- ~90% of tasks < 1 expert-hour — SWE-Bench Verified 九成问题专家工程师一小时内可解且高度自包含——已无法代表行业转向的数小时/数天级任务 · Mia Glaese & Olivia Watkins (OpenAI Frontier Evals) · 2026-02 · 访谈
- >50% of deep-dived failures — 对模型无法稳定通过的任务深查,过半是基准自身缺陷(过窄测试、要求猜特定命名)而非模型能力问题 · Mia Glaese & Olivia Watkins (OpenAI Frontier Evals) · 2026-02 · 访谈
- >90%(一个月内) — Luckey估计即使免费送出,绝大多数人也会因体验不达标一个月内弃用VR——'免费也不够便宜'的量化表达 · Palmer Luckey · 2026-02 · 访谈
- ~90% — 深挖技术细节后,至少90%自称做RL/AI的公司其实只是在改LLM提示词——技术型投资人敢问'蠢问题'才能识别 · Deedy Das · 2026-02 · 访谈
- 100+工具即降智 — 一次性暴露上百个工具导致模型质量下降和token暴涨,倒逼渐进式披露架构 · Simon Last & Sarah Sachs (Notion) · 2026-04 · 访谈
- 相关系数>0.8 — 人均GDP与人均能耗高度相关——能源产量是经济繁荣的终极代理指标,这是全篇的第一性论据 · Scott Nolan (General Matter) · 2026-04 · 访谈
- 1颗燃料芯块 ≈ 1吨煤 — 核燃料能量密度的第一性推论:核电本应是最便宜的能源,贵只因几十年没建堆 · Scott Nolan (General Matter) · 2026-04 · 访谈
- 100:1 (Jensen Huang's claim) — 黄仁勋主张安全代理需百倍于生产代理;Lahav认同方向但质疑其'原生安全行不通'的假设 · Dan Lahav · 2026-05 · 访谈
- weeks (Stockholm) vs months (SF) — AI经营实体业务的瓶颈是人类监管环境而非软件——同一家AI咖啡馆在斯德哥尔摩数周开业、在旧金山要数月审批 · Lukas Petersson & Axel Backlund · 2026-06 · 访谈
- 13%(此前最好 3-4%) — Devin 发布时的 SWE-bench 得分:13% 意味着 87% 的失败率仍敢发布——早发布抢旗帜(品牌/招聘/定义行业)比产品成熟度重要(→ 对照 2026-02 SWE-Bench Verified 已死条目:同一基准从发布锚点到退役的完整弧线) · Scott Wu (Cognition) · 2026-06 · 访谈
- 1亿 tokens 以上 — AISI 网络安全评估中模型仍在持续改进的 token 规模(引用 AISI 的评估结果):性能平台期已远到无法合理测完——安全评估的"能力上限"实际是预算的函数而非固定值 · Noam Brown (OpenAI) · 2026-06 · 访谈
- 约 1 帧/秒 — Gemini 视频理解的采样率(Bakaus 引述):模型靠截图/低帧采样、不理解时间分辨率,反馈回路缺失——动效(motion)设计仍是 AI 盲区,这是他仍手写动效 CSS 的原因 · Paul Bakaus (Impeccable) · 2026-06 · 访谈
- 1200 种合金 / 5-6 个月(其中 300 种文献从未见过) — 自驾实验室通量 vs 行业基准 DARPA/GE 航空 MOC 项目的 500 种/12 个月——约一个数量级的跃升,且 ~10 种性能令人兴奋 · Joseph Krause (Radical AI) · 2026-06 · 访谈
- $60-300/次 — 单次合金实验成本(取决于元素:铂钯贵、铝钛便宜):材料实验的边际成本低到可以"不怕浪费一枪",high-throughput 经济上可行 · Joseph Krause (Radical AI) · 2026-06 · 访谈
- 10-15倍 — 铪(hafnium)价格涨幅(中国控制供应链所致):材料设计必须把供应链当设计变量——客户要求在保持性能下把铪从 C-103(含10wt%)中去除 · Joseph Krause (Radical AI) · 2026-06 · 访谈
- 10-12 个(2026年1月单月) — 被 AI 解决的公开数学难题数(主要由 GPT-5.2、近期 Gemini 也有):模型已越过人类知识边界、能做"人类尚未做到"的新颖推理——但他谨慎区分"人类尚未解决"与"人类不可能解决" · Kevin Weil (OpenAI) · 2026-06 · 访谈
- 100 亿次配送数据 — 人类配送员实际投递落点的数据构成"首尾百英尺"的专有护城河,公共地图与通用模型里不存在,直接喂给机器人 Dot · Andy Fang & Stanley Tang (DoorDash) · 2026-07 · 访谈
- 80% 是 JSON 写错 — 用户说"Claude 在幻觉",深挖后八成其实是模型不会写正确的 JSON——生成 30-40 个失败例即成评估集,模糊反馈由此变成可测任务(→ 对照 2025-08 Aman Khan 的 5-10 例 POC / 100+ 生产:评估集的起手规模口径一致) · Dianne Penn (Anthropic) · 2026-08 · 访谈
- 约 100 层(主流 transformer 的有效层深上限) — 号称深度学习实则很浅,逐 token 的思维链只是在补计算深度;提高原生计算深度是高阶推理能力的首要前提 · Jerry Tworek & Rohan Anil · 2026-08 · 访谈
- ~20-25%(流利语言占智能的份额) — Sutton:LLM 是惊人且未被预见的突破,但"大概是智能的 20% 或四分之一"——领域却假装它就是 AI 的全部 · Rich Sutton · 2026-08 · 访谈
"All of intelligence is not fluid, capable use of language. There's so much more. This is an important part. It's like 20% or a quarter of intelligence. There's more. We're not done."「所有智能并不是流畅、有效使用语言的能力。还有更多内容。这是一个重要的部分。它大约占智能的 20% 或四分之一。还有更多。我们还没有完成。」
- 85%(数字孪生保真度,1,000 人研究) — 基于 2 小时访谈构建的数字孪生,复现个体问卷、人格测试与行为经济学博弈的准确度,达到本人两周后自我复现水平的 85% · Joon Sung Park (Simile) · 2026-08 · 访谈
- 20-30%(小众人群)/ 50-60%(一般人群) — 提示词驱动的前沿模型做同一行为预测任务的表现:在客户真正在乎的小众人群上塌到 20-30%——Simile 后训练行为基础模型补到 85% 的那道缺口(→ 对照上一条) · Joon Sung Park (Simile) · 2026-08 · 访谈
- TVD < 0.15 — Simile 判定"够格用于决策"的定量北极星(覆盖 RCT 预测类用例),并明确类比为该领域待标准化的"p < 0.05"(→ 对照 2025-05 Aman Khan 的 ≥90% 一致率:又一个给模拟/评估立统计判据的尝试) · Joon Sung Park (Simile) · 2026-08 · 访谈
- $40,000/年 × 两班 12 小时 = $80,000/年 — NYC 出租车牌照经济学:司机租半辆车年付 4 万仍陷贫困,祖父免费拿到牌照的持有人年收 8 万——他的"政府背书、把竞争定为非法的卡特尔"展品 · Travis Kalanick · 2026-08 · 访谈
- ~150 国(稳定币)vs ~60 国(法币) — Stripe 用户可经营的国家数之差——稳定币作为全球经济中立"谢林点"轨道,已原生进入 Stripe Treasury · Will Gaybrick (Stripe) · 2026-08 · 访谈
- ~86%(印度 <$5 支付走 UPI;美国卡为个位数%) — 国有化方案(UPI、PIX)能在本地解决支付,但全球经济仍需加密轨道来互操作——他给稳定币的证据 · Will Gaybrick (Stripe) · 2026-08 · 访谈
- ~60 秒/广告 × ~10 广告/日 ≈ 10 分钟交互数据/用户/天 — 游戏内互动小游戏广告拿到的用户时长与交互数据——喂给 Axon 转化漏斗预测的数据密度底料 · Adam Foroughi & Giovanni Ge (AppLovin) · 2026-08 · 访谈