2026-09-01AI 观察Tao

AI 需求跑在算力供给前面:重度用户、数据中心与多模型系统

Gavin Baker 与 David George 从重度用户、数据中心回报、Agent 工作流、多模型架构和 NVIDIA 生态出发,解释 AI 需求为何可能比算力供给扩张得更快,以及这套短缺判断成立所需的条件。

目录共 9 节
  1. 泡沫会出现,短期约束仍是供给
  2. 需求只扩散到很小一群人
  3. 训练与推理把收入和资本开支绑在一起
  4. Agent 把 token 消耗推向持续工作
  5. 供给不足会先制造算力分层
  6. 多模型系统争夺智能抽象层
  7. NVIDIA 的优势已经延伸到融资与供应链
  8. 轨道算力是一项长期压力测试
  9. 短缺论成立需要哪些条件

原始视频Why AI Demand Is Outrunning Compute Supply

a16z · 2026-08-31 · 1 小时 14 分 26 秒

对谈:David George,Andreessen Horowitz 普通合伙人 · Gavin Baker,Atreides Management 管理合伙人兼首席投资官

字幕说明:视频仅提供 YouTube 英文自动字幕。文中的人名、产品名与公司名按视频元数据、上下文和一手资料校正;回报周期、用户规模、供给份额与未来时间表均保留说话者归属。

补充一手资料a16z:两位对谈者此前关于 AI 泡沫与基础设施的讨论 · xAI:Introducing Grok Bot

讨论 AI 基础设施时,市场常把问题压成一道二选一:泡沫,还是短缺。

David George 与 Gavin Baker 给出的判断更复杂。每次重大技术周期都可能积累估值泡沫和过度建设,眼前的物理供给仍可能跟不上需求。两件事可以同时发生,只是时间顺序不同。

他们把关键变量放在两条曲线的速度差上。一条是 AI 从少数重度用户扩散到更广泛人群的速度,另一条是电力、芯片、数据中心、融资和许可转化为可用算力的速度。

如果需求曲线持续跑得更快,AI 近期更容易遇到短缺,传统意义上的过剩可能被推到更后面。

这是一套投资人提出的条件判断。访谈提供了估算、案例和分析框架,没有给出能够独立证明结论的完整市场数据。

泡沫会出现,短期约束仍是供给

Baker 先承认了泡沫的历史规律。汽车、铁路、广播、个人电脑和互联网都曾吸引资本提前押注。估值上升带来扩建,扩建又可能走过头。

AI 周期眼下有一个特殊之处:部分基础设施项目的回收速度,据两位对谈者估算,快到足以继续吸引资本。

Baker 用 Nebius 做了一个示意账本。他按每吉瓦约 $50 billion 的建设成本估算,客户预付款可以覆盖 50% 至 60%,剩余容量还能进入现货市场。在这组假设下,他算出的回收期约为 9 至 10 个月。

这不是 Nebius 经审计后公布的统一回报率。成本口径、客户预付、利用率、价格和融资结构只要变化,结果就会跟着变。它真正解释的是资本为何仍愿意追逐算力:当单个项目看起来能在一年左右回收,供给方缺少主动踩刹车的理由。

资金来源也影响周期。若扩建主要依靠债务,项目必须很快产生现金流,时间稍有偏差就会暴露风险。若大型科技公司先用经营现金流建设,再把成熟资产交给 Blackstone、KKR、Apollo 等机构融资,短期承压能力会更强。

泡沫风险因此没有消失。物理瓶颈和快速回收只是让过度建设更晚显现,也让前沿模型公司、云厂商、开放模型、应用公司与 NVIDIA 在一段时间内有机会一起增长。

需求只扩散到很小一群人

George 在访谈中估算,当前产生真实付费价值的 AI 重度用户大约不超过 30,000,000 名。Baker 认为这个数字可能明显偏高,实际甚至少于 10,000,000 名。

他们随后把潜在人群放大到约 1,500,000,000 名知识工作者。这里没有一份用户数据库支撑精确比例,数量级仍能帮助理解问题:今天的收入和算力消耗,可能来自总潜在人群里很小的一部分。

a16z 投资组合里的使用分布也呈现出明显长尾。George 说,最重度的工程师消耗的 token 可以达到中位数工程师的 10 至 100 倍。较传统的公司若使用得不错,每月 token 支出可能相当于人力成本的约 1%;更偏 AI 原生的公司会来到较高个位数,部分超过 10%。

这些数字是访谈中的组合观察,不能当成全行业基准。它们揭示了需求侧最重要的不确定性:使用深度的差距很大,扩散还有很长的路。

若更多员工接近今天重度用户的工作方式,模型效率提升节省下来的算力,很可能被更多任务和更长运行时间重新吃掉。若扩散缓慢,供给紧张就会缓解,数据中心回报也会回归普通基础设施水平。

训练与推理把收入和资本开支绑在一起

前沿模型公司的收入还受到算力分配方式影响。

Baker 用一个 10 吉瓦的假设说明这种关系。若公司把 8 吉瓦用于推理,每吉瓦按年产生 $60 billion 收入,年化收入可以达到 $480 billion;若研究突破后把分配翻转,只留下 2 吉瓦做推理,收入可能降到 $120 billion。

这组数字只是为了展示机制,没有对应某一家公司的真实财务预测。机制本身很重要:模型实验室可以把原本用于付费推理的算力转回训练,用当前收入换取下一代能力。

传统互联网公司通常把服务收入与长期研发分开核算。前沿实验室的同一批芯片会在训练、后训练、内部研究和客户推理之间移动。收入、能力进展与资本开支因此共用一项稀缺资源。

Baker 预计这些公司能够产生大量经营现金流,却会继续购买 GPU 和其他加速器,短期内很难追求自由现金流。公开市场若要给这类公司定价,就得同时理解它发布哪个检查点、如何定价,以及把多少算力留给未来。

Agent 把 token 消耗推向持续工作

访谈里最具体的需求样本来自 Atreides 自己。Baker 说,公司内部 token 消耗从三月至八月增长了 100 倍。

增长来源已经超出问答。他用 Claude Code 和 Codex 搭建播客、Substack 与 X 内容摘要,再让 Grok Bot 汇总其他智能体当天学到的内容,给出下一步行动建议。过去需要手动触发的工具,逐渐变成可以持续观察、整理和推进工作的系统。

xAI 的官方介绍把 Grok Bot 定义为拥有独立云端电脑、可以跨应用完成多步工作的常驻智能体。产品说明能确认这类运行方式已经存在,Atreides 的 100 倍增长仍只是单一公司的自述,无法推导出整个市场的增速。

需求逻辑由此发生变化。聊天按用户提问次数消耗 token,常驻 Agent 还会读取新信息、维护状态、检查结果、提出动作并等待批准。一个员工可以让多个流程同时运行,token 消耗不再受限于人在输入框前打字的速度。

Agent 的价值若从“回答得更好”进入“持续完成工作”,算力需求会与任务数量、运行时长和验证次数一起增长。

供给不足会先制造算力分层

George 判断,即使把已规划项目算进去,可用容量到 2028 年仍可能偏紧,政治与许可阻力还会拖慢建设。Baker 因此更担心严重短缺。

这是一项预测,公开材料里没有逐项目容量表。它指出的后果很具体:当高性能模型创造的用户价值仍高于价格,供应不足可能让前沿 token 涨价,或者让高配额优先流向能够承担更高价格的大公司和富裕用户。

低价消费产品通常可以通过广告补贴,但广告系统需要时间建立。中间阶段可能出现一条算力鸿沟:先进智能已经有用,普通用户和小公司却拿不到足够稳定、便宜的供给。

开放权重模型能够压低软件利润、增加选择并让企业控制数据,物理成本仍然存在。尺寸接近的模型生成 token 需要芯片和电力,单项任务的效率还会因模型、量化、缓存和推理方法大幅变化。

开放模型因此可以改善竞争结构,却无法自动消除供给约束。利润率下降还可能刺激使用量,最终需要更多总算力。

多模型系统争夺智能抽象层

两位对谈者预计,大型企业会采用多模型架构。

企业可以选择一个开放权重基础模型,用自己的数据做强化学习或监督微调,再接入一到两个前沿模型。高能力模型负责规划、检查或困难任务,成本更低的模型负责大量执行,路由器根据任务在它们之间切换。

企业真正想控制的是三件事:能力、成本和数据。把核心上下文交给单一外部模型会带来价格、隐私和供应风险;完全自建又要持续更新基础模型、评估质量、处理路由和维护基础设施。

Fireworks Nexus、Cursor、Harvey、Microsoft、Databricks、Snowflake 等公司被访谈当作不同入口。名单会变化,竞争目标比较稳定:谁能成为组织与模型之间的“智能抽象层”。

这层系统要读取企业数据,挑选模型,控制价格,保留权限,持续升级,还要让使用者感觉流程连贯。描述它很容易,稳定运行远比普通中间件困难。

NVIDIA 的优势已经延伸到融资与供应链

Baker 把 NVIDIA 的策略概括为纵向整合、横向开放。它提供加速器、CPU、网络芯片、交换设备和整套系统,也让大客户在部分环节使用自研芯片。

这套位置改变了竞争单位。一家创业公司做出更好的加速器,只解决了系统里的一块。土地、电力、机架、显存、网络、软件、交付能力和融资成本仍要一起到位。

Baker 给出两个很激进的估算:加速器市场每 1% 份额可能对应 $100 billion 价值;NVIDIA 已锁定相关供给的 70% 至 80%。访谈没有提供独立数据验证这两个数字,适合看成他对生态杠杆的判断。

融资结构让杠杆进一步放大。芯片公司可以投资客户,可以为设备提供残值保证,也可以用与 token 价格挂钩的认股权证换取订单。成熟金融机构愿意为某套系统提供更低成本的资金时,客户购买的已经不只是一批芯片,还包括更容易融资的资产。

供给极紧时,所有产品都可能售罄,出货量很难显示真实偏好。Baker 建议观察交易条件:谁必须补贴客户,谁能获得残值保证,谁能把认股权证与使用价格绑定。合同会把供应商议价权和客户信心暴露出来。

NVIDIA 的护城河已经从单颗芯片延伸到系统完整度、供给协调与资本成本。

轨道算力是一项长期压力测试

访谈花了较长篇幅讨论轨道数据中心。两位对谈者设想的形态更接近带太阳能翼和散热器的飞机大小计算单元,运行在太阳同步轨道,不是漂浮在太空里的巨型建筑。

Baker 的示意账本仍从每吉瓦 $50 billion 出发,其中约 $35 billion 属于计算设备,约 $15 billion 属于地面电力、冷却、土地和施工。他认为完全复用后的 Starship 若能把发射成本压到 $1 billion 以下,轨道推理的成本关系会翻转。

他同时承认训练集群仍会留在地面。GPU 之间的距离和光速延迟会直接影响大规模训练,轨道容量更可能承担一部分推理或弹性需求。

访谈还转述了 2027 年第四季度发射 Rubin 代际机架的设想。这项时间表、成本拆分和工程状态都没有在本次资料中得到独立确认,应当视作高度不确定的长期方案。

轨道算力的价值目前主要在于压力测试。如果地面电力、铜、冷却、工人和许可持续涨价,发射成本持续下降,部分计算迁往轨道才会获得经济空间。任何一条曲线没有兑现,地面数据中心仍会占据绝大多数供给。

短缺论成立需要哪些条件

整场访谈可以收束成一条条件链。

第一,AI 必须从少于 10,000,000 至 30,000,000 名重度用户,继续扩散到更大的人群。

第二,模型和芯片效率的提升不能完全抵消新增任务、常驻 Agent 和更长推理带来的需求。

第三,电力、晶圆、显存、网络、土地、施工、融资和许可必须继续限制建设速度。

第四,用户从前沿模型获得的价值要持续高于价格,供应商才能维持快速回收与追加投资。

这些条件若同时成立,前沿实验室、开放模型、云厂商、应用公司与芯片公司可以在增长期共同受益,算力也可能先变贵再变便宜。需求扩散若放慢,单位任务算力大幅下降,或融资成本突然上升,传统的过度建设仍会回来。

这套框架比简单争论“AI 有没有泡沫”更有操作性。后续应同时跟踪三条曲线:重度用户扩散速度、每项任务的算力效率、可用供给的新增速度。 三者之间的差,才决定市场下一阶段面对短缺、涨价,还是过剩。

发布自
atlasnote-editorial
发布日期
2026-09-01
标签
AIcomputeinfrastructureAgentnvidiainterview