内存稀缺、开源模型与AI产业重构
2026 年 7 月,一篇独立研究报告深入分析了存储稀缺与开源模型平价对 AI 产业格局的双重冲击。报告的核心判断是:AI 产业已从增长叙事转入”走廊”区间——崩溃风险(25%)与寡头稳态(25%)呈共模态分布,商品化冲击并非尾部风险,而是与基准情形等概率的结构性威胁。
这份报告认为,2026至2030年间,AI行业将同时受到DRAM/HBM价格飙升、开源前沿模型(如GLM‑5.2)出现、推理效率大幅提升(如接近香农极限的KV缓存压缩和轻量级本地运行环境),以及Meta和xAI等“前AI实验室”凭借价格重估前囤积的算力进入算力转售市场这四股力量的冲击。量化分析显示,现有玩家因拥有已摊销的旧机群,在内存带宽成本上对新入局者拥有结构性优势,且该优势不会随时间消失——按每PB内存带宽的美元成本计,差距从2026年的3.2倍缩至2027年的1.9倍,之后若HBM价格在2028年正常化则重新扩至约3倍,若短缺持续至2030年则超过4倍。训练成本则分化为奢侈级与大众级,前沿模型单次训练成本到2030年将达180亿至380亿美元,而通过强化学习和蒸馏复现上一代能力的成本却降至约500万美元,两者差距从当前的约40倍扩大至三到四个数量级。新基础设施的偿付能力被限制在极窄的通道内——在既定建设规模和每年30%的字节效率提升下,总token需求必须连续四年维持约2倍的年增长,且封闭模型的溢价定价须保持绝对价格的刚性,一旦偏离任一维度,2028‑2029年交付的产能将成为最脆弱的“高危年份”。
报告最有力的反面论据是效率提升可能放缓,若KV压缩已接近信息论极限,年增速从30%降至15%,则所需token年增长门槛将从1.9倍降至约1.6倍,安全区间明显扩大。而对于从头自研芯片的新建数据中心,虽然省去了中间商利润,但仍无法规避内存溢价,其最终结果分布为25%成功、34%平庸、41%亏损,若采用与报告实时跟踪指标挂钩的分阶段决策关卡,亏损概率可降至约24%。主权和机构资本被单独视为第三类资产负债表主体,不受上述偿付通道约束,而面向科学和工业创新的AI需求(AI4SIS)由于使命驱动且预算刚性,构成了该通道的最底层的无弹性需求。
报告将未来结果归纳为五种情景,更新后的概率为:轮流坐庄寡头25%、杰文斯吸收20%、系统层再差异化18%、商品化崩盘25%、地缘分裂12%。崩盘已不再是尾部风险,而是与寡头情景同为主流结果,这考虑了需求质量测量误差、token最小化和本地部署、资本年份问题以及循环融资脆弱性等因素。但报告也强调,2026年第二季度之后的体制断裂尚未得到足够时间序列的确认,因此在获得两季度新数据之前,旧有预测只能作为乐观上限,而带宽需求在2028年见顶的可能性已从尾部风险升级为同等重要的压力情形。最终结论是,AI基础设施繁荣不再仅由总token增长支撑,偿付能力取决于货币化的带宽需求、溢价定价的粘性,以及拥有哪些年代的内存密集型产能。最关键的实时观测指标,是用服务价格、平台收入和交易量共同折算出的、以美元而非纯token计量的实际需求增长。
博客作者对该研究报告做了解读与总结,并未按原文全译,需要精确原文的读者请自行寻找。
TL;DR
此次双重冲击的根源在于存储稀缺的持续性与开源模型的结构性平价。在硬件端,DRAM 合约价格在 2026 年一季度环比暴涨约 90%,内存已占据加速器物料成本的 40-50% 并持续攀升;三大供应商将绝大部分晶圆产能转向 HBM 与服务器产品,而新增晶圆厂产能要到 2027-2028 年才能实质性释放。在软件端,GLM-5.2(744B 总参数,40B 激活,MIT 许可证)在长周期编程与智能体基准测试上已匹敌甚至超过闭源旗舰,服务价格仅为其约 1/6,而通过激进的量化压缩,此类模型已能运行于工作站级统一内存硬件上。
在位者凭借折旧硬件构建了几乎不可逾越的护城河。一份 2026 年购入 GB300 级容量的新进入者,其全成本约为每 PB 0.174 美元,而已折旧完毕的 H100 机群边际成本仅约 0.054 美元/PB——3.2 倍的结构性劣势,无法由任何运营效率弥补。这种优势并非一次性的库存红利,而是折旧传送带的滚动产出:上一轮周期的买家自动成为下一轮的在位者,而新进入者必须在一个完整的折旧周期内承受负价差才能”入籍”——而这恰恰是在位者限制定价可以阻止的。
训练成本的严重分化正在塑造一个”豪华车”市场结构。前沿训练的计算规模以每年约 2.5 倍的速度持续扩大,而硬件单位算力成本在 HBM 涨价环境下仅以每年 10-25% 的速度下降。前沿训练的单次成本从 2026 年的约 15 亿美元,到 2030 年可能飙升至 180 亿乃至 380 亿美元。与此同时,通过强化学习后训练与在开源基础上蒸馏来达到”够用”能力的成本,从数千万美元持续下降至个位数百万美元区间。两者之间的比值从当前的约 40 倍,拉大到 2030 年的三到四个数量级。
报告将未来四年浓缩为五种场景,并以概率赋权。”旋转地主寡头”(25%):Meta/xAI 级在位者以沉没机群为底价设定大众市场价格,封闭实验室倾向于租赁而非自建;”杰文斯吸收”(20%):智能体与科学计算需求持续超 2.5 倍年增长,所有年份硬件均偿付;”系统层再差异化”(18%):权重商品化后,价值迁移至编排、专有强化学习环境与交互数据;”商品化崩溃”(25%):Token 年增长降至 1.7 倍以下,路由与本地推理双重挤压集中式需求,2027-2028 年新增晶圆产能落地时遭遇需求下滑——经典 DRAM 崩盘剧本的 AI 加速版;”地缘分叉”(12%):出口管制双向扩展至模型权重,西半球封闭实验室恢复定价权,其余地区标准化于中国开源权重。
对产业参与者而言,未来 12 个月的决策窗口高度紧迫。封闭实验室应转向轻资产服务(租赁在位者容量而非拥有峰值年份硬件),并以粘性绝对定价将高端能力解耦于大众市场漂移。基础设施投资者需明白,”年份择时”主导了营运技能——2027 年交付在任何定价制度下均具稳健性,而 2026 年与 2028-2029 年交付则各在一个定价制度下致命暴露。对中国全栈而言,曙光系统(LineShine)以国产 HBM 和 Armv9 CPU 占据 TOP500 榜首,证明 GPU 之外的路线在国家级规模上是现实的;而循环融资网络(>8000 亿美元)中的任何一环断裂,都可能触发连锁反应。
一、存储稀缺的新纪元:史上最剧烈的重新定价
内存市场正在经历行业历史上最严重的重新定价。传统 DRAM 合约价格在 2026 年一季度环比上涨约 90%,且二季度延续涨势。三大供应商将绝大部分晶圆产能重新分配至 HBM 与服务器产品。SK 海力士领导层已发出警告:短缺可能持续至 2030 年。内存如今占据加速器物料成本的约 40-50%,且在数据中心总资本成本中占比持续攀升。
2026 年中,存储市场的紧张程度已超越历史记录。第一季度基础 DRAM 合约价格在一个季度内上涨约 90%,这在 DRAM 行业数十年历史上都极为罕见。供应链追踪机构 TrendForce 与 Counterpoint 的数据显示,HBM 已占 DRAM 晶圆总产出的约 23%,而这一比例仍在快速上升。
供给侧的制约是结构性的:新增晶圆厂产能要到 2027-2028 年才能实质性释放。SK 集团会长崔泰源在英伟达 GTC(2026 年 3 月)与 Computex(2026 年 6 月 2 日)两次公开场合均表态:短缺将持续至 2030 年,五年内产能需翻倍。
这场稀缺并非简单的周期性波动,而是多重约束叠加的结果:
| 约束维度 | 具体表现 |
|---|---|
| 技术约束 | DRAM 微缩已深度放缓,HBM 制造位元转换率仅为通用 DRAM 的 1/3–1/4 |
| 产能约束 | 三大厂商无尘室空间在 2026 年几乎零增长,新增产能集中在三座工厂 |
| 需求约束 | AI 带宽需求非线性爆发,智能体工作负载使单次请求 token 量膨胀约 15× |
值得注意的是,OpenAI 的 Stargate 项目据报告占用了全球 DRAM 产能的 40%,这意味着单一项目承载了最大份额的峰值定价内存——也是整个系统中最大的单点风险敞口之一。
二、在位者的护城河:折旧传送带与结构性壁垒
折旧完毕的 H100 机群以约每 PB 0.054 美元的边际成本运行,而购入 GB300 级新硬件的进入者面临约 0.174 美元/PB 的全成本——3.2 倍的劣势。这并非一次性的库存红利,而是折旧传送带的滚动产出:上一轮周期的买家自动成为下一轮的在位者。
理解当前 AI 产业竞争格局,一个核心概念是 “折旧传送带”(depreciation conveyor)。任何硬件在四年直线折旧完毕后,其资本成本归零,仅剩电力、运营等边际成本:
| 硬件代际 | 购入年 | 成本类型 | 美元/PB | 备注 |
|---|---|---|---|---|
| H100 | 2023 | 边际成本(2027 折旧完毕) | $0.054 | 在位者地板 |
| GB300 | 2026 | 全成本(含摊销) | $0.174 | 3.2× 劣势 |
| Rubin | 2027 | 全成本(基础分支) | $0.082 | 1.9× 劣势 |
| Rubin | 2027 | 全成本(短缺分支) | $0.110 | 2.0× 劣势 |
报告的第一个结构性结论尖锐而清晰:”低价买内存”的优势并非一次性库存红利,不会随 H100 淘汰而消失;它是折旧传送带的滚动属性,永久性地归属于上一轮周期的买家——即在位者阶级。
下面这张图是最直白的呈现:
解读这张图,几个信号极为清晰:第一,两条线几乎永不相交——沉没机群的边际成本(红线)稳定在 0.02-0.06 美元/PB 区间,而新建设施全成本(蓝线)从未低于 0.07 美元/PB。第二,2027 年 Rubin 代际(基础分支)是新进入者的最佳窗口——差距缩至 1.9 倍——之后随着新一代旧机群折旧完成,差距重新走阔。第三,短缺分支(虚线)是全方位的打击:新硬件不仅更贵,而且将旧机群挤出的时间也推迟了,意味着地板价更低、更持久。
2.1 功率槽位的博弈:在位者何时退场?
但这并非意味着在位者可以无限期占据旧硬件。在功率受限的站点(几乎所有站点都受限),功率槽位的机会成本最终会主导决策。
Rubin 代部件每瓦带宽约为 H100 的 2.2 倍。当市场 token 价格超过约 0.11 美元/PB 时,用正常定价的 Rubin 替换 H100 在每瓦利润意义上就是划算的。
这张图揭示了在位者硬件更新的物理驱动力。在功率受限站点,比的是”每瓦能搬运多少数据”而不仅仅是”每美元能搬运多少数据”。Rubin 代际的 16 TB/s 带宽相对于其 1,800W 功耗,创造了相对 H100(3.35 TB/s,700W)约 2.2 倍的每瓦带宽优势。但在短缺分支中,新硬件的高价格也延迟了在位者的替换节奏——旧机群服役更久,大众市场的价格天花板压得更低。
短缺分支因此对进入者构成双重打击:他们的硬件更贵,而市场上方的价格伞更矮。
2.2 容量与带宽的权衡:压缩栈的推拉力
未经优化的 MoE 推理需将所有专家权重与 KV 缓存驻留在 HBM 中。一个 GLM-5.2 级模型在 FP8 下需要约 750GB 的驻留量,相当于约 10 块 H100 但仅 3 块 GB300。因此,旧机群带宽便宜但容量不足,服务大型 MoE 会倍增互联流量并降低有效 MBU。
这种割裂是一把双刃剑:
- 它为新硬件在高端市场保留了可防御的利基;
- 但也创造了强烈的激励,即将大型模型通过压缩栈(低位宽权重、近最优 KV 量化、专家卸载)拉回便宜的旧硬件。
压缩栈每一次成功,都意味着将一批工作负载从高端利基转移到在位者地板。这是开源模型压缩技术与在位者硬件优势之间的正向反馈回路。
2.3 年份盈亏平衡:定价制度选择了牺牲者
上述分析引出一个更精细的问题:每一年份购入的硬件,要在市场中存活,需要多大比例的 token 以溢价定价出售? 报告以两种定价制度计算了各年份的盈亏平衡溢价份额。
这张图是报告最具操作性的图表之一。它揭示了”年份择时的宿命”:
- 在耦合定价(溢价随大众价格崩塌)下,晚期年份(2028-2029)需要 21-38% 的溢价份额——远超 10-20% 的可实现区间——这就是路由成功后 Stargate 级承诺的死亡地带。
- 在粘性定价下,2026 年买家成为最脆弱的一环(31%),因为他们支付了峰值硬件价格却没有享受到可以独立于大众市场定价的定价伞。
- 2027 年在所有单元格中均为 8-11%,是唯一的通用安全年份。
报告的定性结论比任何单一数字更强:总有人在每个定价制度下结构性地水下,定价制度选择了谁被淹。路由成功,打破的是 Stargate 级 2028-2029 承诺;路由失败,打击的是今天买入峰值价格的买家。这张图也是后续理解”Stargate 风险敞口”和”Meta Compute 租赁逻辑”的关键前置。
紧接着,训练成本的分化将进一步解释为什么”豪华-大众”二元结构不只是硬件故事,更是模型经济学的必然归宿。
三、开源模型的崛起:从平价到颠覆的”豪华车”格局
前沿训练成本与”够用”复现成本之间的比值,从当前的约 40 倍拉大到 2030 年的 3,600-7,400 倍。闭源旗舰模型在技术上依然领先且可以持续盈利,但只能作为仅少数客户真正需要的”豪华车”产品存在。
3.1 GLM-5.2 与开源权重的分水岭
2026 年 6 月 13-16 日,Z.ai 发布了 GLM-5.2:744B 总参数、40B 激活参数,MIT 许可证权重直接上传至 Hugging Face。第三方评测显示,GLM-5.2 在长周期编程和智能体基准测试上匹敌甚至超过 GPT-5.5,而服务价格约为其 1/6。
这不是孤立事件,而是一个明确的时代信号。此前 DeepSeek V4 已证明中国开源模型可以在中立路由器的 token 份额上占据主导。到 2026 年初,中国开源权重模型已占据 OpenRouter 等中立平台超过 50% 的 token 份额(从 2024 年底的不足 2% 起步)。
3.2 训练成本的分化:三到四个数量级的鸿沟
前沿训练的计算量以每年约 2.5 倍持续扩大,而硬件单位算力成本在 HBM 涨价环境下仅以 10-25% 年降幅改善:
| 指标 | 2026 | 2030(基础分支) | 2030(短缺分支) |
|---|---|---|---|
| 前沿训练单次成本 | ~$1.5B | ~$18B | ~$38B |
| “够用”复现成本 | ~$40M | ~$5M | ~$5M |
| 两者比值 | ~40× | ~3,600× | ~7,400× |
这张对数坐标图一目了然地揭示了模型经济学的结构性撕裂。上方两条线(基础分支和短缺分支)代表前沿训练,以近乎垂直的斜率向上发散;下方那条平稳下降的线代表”够用”复现——通过 RL 后训练与在开源基础上蒸馏,成本正被食谱效率和每次新开源基座发布的免费搭车效应双重压缩。最惊人的不是绝对高度,而是两者之间的剪刀差:在 2026 年尚能看到两条线的尾部,到 2030 年它们几乎不在同一张图上——这正是”豪华车”市场结构的数学根基。
这种经济逻辑不可避免地导致”豪华车”市场结构:大众 token 市场(日常编程、检索、草拟、常规智能体)由开源模型以在位者硬件边际成本提供服务;而前沿闭源模型仅在深度智能体可靠性、新型科学与工程研发、受监管的高风险部署等少数场景下,凭能力溢价维持盈利。
3.3 Token 跟踪器:需求的真实面貌
公开数据提供了异常丰富的需求证据:
| 来源 | 起始量 | 终值(2026 年中) | 增速 |
|---|---|---|---|
| 谷歌 | 9.7T/月(2024.5) | 3.2 千万亿/月(2026.5) | 7× YoY |
| 微软 Foundry | — | 季度环比 +30% | ~2.9× 年化 |
| OpenRouter | 5T/周(2025 春) | 31T+/周(2026.5) | 4–6× YoY |
| 中国(第三方) | ~30T/日(2025 中) | ~180T/日(2026.2) | 8 个月 6× |
这张图汇集了当前最完整的公开 token 需求数据。用对数坐标看,几乎所有系列都在以陡峭斜率攀升——谷歌从 9.7T/月跃至 3.2 千万亿/月,中国从约 30T/日跃至 180T/日。但报告也提醒:这些跟踪器之间存在不可比的”层次差异”——谷歌的统计包含了其主动推送的 AI 搜索摘要(供给注入),OpenRouter 的统计包含了从直接 API 迁移而来的流量(替代效应),中国数据中有相当比例以低于成本价成交(补贴效应)。因此这些线的斜率虽夸张,但不等于可货币化的付费需求。
报告对这些跟踪器进行了严格的计量批判,指出五个系统性高估因素:
| # | 偏差来源 | 核心问题 |
|---|---|---|
| 1 | 供给注入 | 平台推送的 AI 搜索摘要/多模态处理衡量的是产品策略,而非付费意愿 |
| 2 | 替代效应 | 路由平台增长包含从直接 API 迁移的流量,平台增速 > 市场真实增速 |
| 3 | 补贴 | 相当比例 token 以低于成本价成交(尤其中国市场),不可持续 |
| 4 | 质量构成 | 智能体 15× token 膨胀多为冗余上下文重读——经济价值最低的 token |
| 5 | 基期与披露 | 智能体时代 2026.2 才起步,半年度增长率恰在 S 曲线最陡峭点 |
经质量调整后,底层需求增长约为 2-3 倍/年而非 4-7 倍,恰好位于或略高于偿付能力阈值区间,且二阶导明显减速。
四、五大场景:2026-2030 AI 产业演化路径
报告经过五轮修订,将商品化崩溃的初始概率从 15% 上调,最高达 30%,最终经外部评审调降至 25%。当前评估:崩溃风险与寡头稳态呈共模态分布,杰文斯吸收仍是活跃的上行路径。产业已从增长默认模式转入了”走廊区间”。
这张表是整个报告的场景结构总纲。值得特别注意的有三点:(1) 崩溃情形(S4)的权重从最初 15% 历经上调至 30% 再经外部评审调降至 25%——即便如此,25% 仍远高于典型分析中尾部风险会被赋予的个位数百分比,说明报告作者认为这一风险的证据强度已不容忽视。(2) S1 的定义从早期的”固定在位者”被重新定义为”旋转地主寡头”——“旋转”一词是关键,它意味着地主身份不是永恒的,而是按折旧传送带逐年轮换。(3) S5(地缘分叉)在 12% 的权重下被标注为”跨领域叠加”而非互斥独立世界——出口管制可以发生在 S1、S3 或 S4 之内,而不是取代它们。
4.1 S1:旋转地主寡头(25%,基准情形)
需求在阈值附近运行;短缺分支延长旧机群寿命。Meta/xAI 级在位者以沉没机群地板价设定大众市场价格;地板优势按年份滚动,永远不到达进入者手中。新云商被压缩或退出。封闭实验室倾向于租而非建——Anthropic-Colossus 模式将成为常态。
这一情形实际上已在 2026 年 6 月开始显现雏形:xAI-SpaceX 将完整 Colossus 1(约 300MW,超 20 万颗加速器)以约 12.5 亿美元/月的价格出租给 Anthropic,新云商板块随之大幅重新定价。Meta 推出”Meta Compute”计算转售业务,与其 2026 年 1,250-1,450 亿美元的资本支出指引形成互补。
4.2 S2:杰文斯吸收(20%,最优情形)
Token 年增长持续 ≥2.5 倍。智能体工作负载吸收全部新增产能;所有年份硬件均偿付;进入者差距存在但不如”获取电力速度”重要。封闭实验室在长周期可靠性上保持持久溢价。历史上,这是计算市场的默认结果。
这一情形的结构性支撑来自 AI4SIS(科学和产业创新 AI)需求:自主科学智能体执行”假设生成→大规模模拟→机器人实验编排”的科学闭环,由使命预算资助,对 CFO 级别的 token 预算配给完全免疫。一个国家级实验室不会因为 token 预算耗尽而限制聚变设计任务。
4.3 S3:系统层再差异化(18%)
粘性溢价定价主导。权重商品化后,价值迁移至编排、专有强化学习环境、交互数据与信任。路由加升级是利润池,封闭实验室是升级层。基础设施获得公用事业利润。
这一情形最引人注目的经验证据来自单一数据:2026 年 5 月下旬的 OpenRouter 上,Anthropic 以约 11% 的 token 份额捕获了平台约 42% 的收入,Opus 级输出定价约 25-30 美元/百万 token,而 DeepSeek V4 Flash 仅 0.09-0.18 美元——两个数量级的价差尚未向下耦合。
4.4 S4:商品化崩溃(25%)
Token 年增长 <1.7 倍,且/或定价耦合。路由加本地推理将集中式需求空心化,恰逢 2027-2028 年新增晶圆产能落地。减值集中在峰值年份硬件持有者——2026 年买家在粘性定价下暴露,2028-2029 年(Stargate 级)承诺在耦合定价下暴露。重大实验室可能资本重组或合并。随后出现经典 DRAM 崩盘式的存储过剩。
崩溃的触发信号是可观测的,且具有提前量:
- Token 增长但美元停滞(崩溃签名)
- 旗舰闭源模型价格降幅超过 30%(耦合开始)
- HBM 合同价格季度环比再加速超过 20% 且未持有长期协议
报告特别指出,崩溃情形在所有情形中权重最高且与基准情形并列,这一判断不同寻常——通常分析师会将此类尾部风险设定在个位数百分比。
4.5 S5:地缘分叉(12%)
出口管制双向扩展至模型权重(Fable-5 临时限制已是先例)。西方飞地恢复封闭实验室定价权;其余地区标准化于中国开源权重。主权开源推理能力——包括日本的——在战略价值上急剧升值。
2026 年 6 月 12 日至 30 日,美国政府对新发布的闭源前沿模型实施了临时出口管制,虽仅持续 18 天,却已证明此类政策工具的可行性。同时,中国开源模型已占据中立平台过半 token 份额——一个西方的出口管制反向操作将迫使这部分流量回流至西方模型和基础设施,以牺牲全球效率为代价重塑封闭实验室定价权。
在五种场景之上,报告用一张图将概率叙事转化为具体的物理量对比——交付带宽需求与已公布产能之间的关系:
这是全书最令人警醒的一张图。它将已公布的全部新增产能固定在一个水平上,然后问:在不同需求增长率假设下,这个产能何时被穿透或被遗弃?
| 情形 | 需求增速 | 效率 | 产能命运 | 触发路径 |
|---|---|---|---|---|
| 最优(绿) | 6×→2× | 30%/年 | 2031 年需求超产能 20× | 智能体/视频超高速增长,短缺永不到头 |
| 基准(蓝) | Goldman 24× 路径 | 30%/年 | 骑走廊边缘,利用率 ~100% | 需求紧贴产能,不崩则不死 |
| 下行(橙) | 3×→1.1× | 35%/年 | 2028 见顶,2029 利用率 <80% | 配给+路由咬合,新云商先崩 |
| 最差(红) | 2.5×→<1.2× | 40%/年 | 2027 见顶,2028 崩 | Token 优化 KPI,产能落地即过剩 |
关键洞见:报告将下行路径从”尾部风险”提升为”与基准情形等概率的压力情形”,原因在于所有乐观预测都是在”Token 最大化制度”下产生的——而这一制度在 2026 年 Q2 可能已经终结(第五章将详细展开)。
五、偿付能力走廊:需求侧的数学约束与制度断裂
已公布的产能建设计划到 2029 年使装机容量增长约 2.6 倍。在 token 年增长 1.5 倍的情况下,机群利用率到 2029 年崩塌至约 45%,大范围减值随之而来;在 2.0 倍增长下,系统大致平衡;在 2.5 倍以上,产能全程不足——杰文斯吸收。偿付能力阈值约为 2 倍年增长,且需连续四年维持。
先看最基础的需求-产能平衡关系:
这张图用最朴素的方式展示了核心困境。装机容量线(上方虚线)按照已公布计划大致增长了 2.6 倍。在 1.5 倍年增长下,需求线从 2027 年开始严重偏离产能线,到 2029 年利用率崩塌至约 45%——这就是大规模减值的物理机制。在 2.0 倍增长下,两条线大致持平,系统刚好平衡。在 2.5 倍以上,需求从 2028 年起就持续超过冻结产能——短缺变成长期的。这张图也揭示了一个残酷的不对称:效率改善是累积且不可逆的(压缩算法不会”忘记”如何压缩),而需求超高速增长既不可累积也不可逆。
5.1 效率与需求的赛跑
推理效率每年改善约 30%(通过 KV 缓存压缩、稀疏化、量化、路由至更小模型)。这意味着交付带宽需求 = Token 需求 ÷ 效率改善:
| 效率改善率 | 偿付能力阈值 | 解读 |
|---|---|---|
| 15%/年(减速) | ~1.6× | KV 压缩触及信息论极限,门槛更宽松 |
| 30%/年(基准) | ~1.9× | 骑线——系统刚好平衡 |
| 45%/年(激进) | 2.4× | Token 优化成为企业 KPI,门槛极苛刻 |
这些参数不是孤立的假设,而是可以在同一张二维图上可视化地交叉检验的:
这是报告的分析核心——偿付能力走廊(Solvency Corridor)。整张图回答一个问题:在(需求增长,效率改善)的二维空间中,已公布的产能能否赚回资本成本?
- 90% 等高线右侧和下方是”偿付区”——需求增长够快,或效率改善够慢(让每 token 仍需搬运大量带宽),则机群能装满。
- 等高线左侧和上方是”减值区”——需求增长不够,或效率改善太快,则机群空置。
- 效率改善率越高,阈值越苛刻——这是因为效率意味着”每 token 消耗的带宽在变少”,同样的 token 总量需要搬运的数据量反而降低,导致算力机群利用率下降。
- 基准点(2.0×,30%)恰好骑在线上——系统刚好平衡。如果实际需求在此位置以左,则跨越等高线进入减值区。
效率减速是报告最关键的参数,也是最有力的反崩溃论据。KV 缓存量化已接近信息论边界(TurboQuant 的误差接近香农极限),MoE 稀疏化面临质量地板——最大单一杠杆接近耗尽。如果效率停滞,服务成本停止下降,奢侈层的运营开支负担反而随模型规模增长而非收缩。但效率减速也是一把双刃剑——它让老硬件更值钱(在位者优势扩大),同时让新硬件的偿付压力更高。
5.2 制度断裂:从 Token 最大化到 Token 最小化
报告最具前瞻性的判断是 “制度断裂”(regime break) 概念。
2026 年上半年,产业的操作信条在数个月内发生了可见的逆转:
| 最大化制度(2025–2026 初) | 最小化制度(2026 Q2 起) | |
|---|---|---|
| 范式 | “一切在上下文中”,每次请求膨胀 15× | Token 优化为纪律,上下文剪枝 |
| 企业行为 | 无节制调用最贵模型 | 预算计量、路由下放、模型降级 |
| 数据支撑 | Goldman 24× 预测、跟踪器高增速 | UBS 60% 企业限支、许可证取消、计量铺开 |
UBS 2026 年 6 月 23 日的研究报告指出,约 60% 的受调查企业正在限制 AI 支出,并路由至开源/中国模型。企业 AI 预算在数个月内耗尽(Uber、微软内部许可证取消),计量计划全面铺开。
方法论后果极为尖锐:所有乐观预测都是最大化制度的产物。Goldman Sachs 的 24 倍预测发布于 2026 年 5 月初,跟踪器增长率截止至 5 月——均为制度断裂之前的测量。如果制度断裂确实在 2026 年 Q2 发生,则所有外推都是对已不存在的制度的测量。断裂后的数据仅累积了数周,远不足以建立新的基准斜率。
因此,报告将崩溃情形权重上调至与基准情形并列,并将下行路径(带宽需求在 2028 年左右见顶)从尾部风险提升为等概率压力情形。
5.3 需求再分配的三条暗渠
计量批判揭示了一个更深层的结构性问题:云端计量 Token 需求(即服务于超大规模云商和新云商收入的量)可以减速甚至衰减,而总推理量继续增长。
三条渠道使需求从云商资产负债表上”消失”:
- 本地化迁移:有能力的开源模型运行在私有数据上,从单台 DGX Spark 到机架级私有推理——这部分推理对基础设施提供商不可见、不可货币化
- 主权渠道:日本企业 AI 采用率远低于美国,归因于担忧专有数据被美国模型提供商利用——当非美国企业最终采用 AI 时,直接从本地开源阶段切入,完全跳过云端计量阶段
- 路由下放:超大规模云商正将路由制度化(Bedrock 的智能提示路由跨 110+ 模型变体),将模型提供商利润转移至基础设施层
六、崩溃的传导机制:循环融资与中国全栈冲击
超过 8,000 亿美元的循环安排集中在一小撮参与者之间。中国已展示了完整的国产 AI 计算全栈——从国产 HBM 到 Armv9 CPU 到操作系统——且在 TOP500 中排名第一。这两个因素将崩溃风险从周期性升级为结构性。
6.1 循环融资网络
2026 年的分析揭示了如下闭环:
- 英伟达投资并供应 OpenAI
- OpenAI 背负据报告约 1.15 万亿美元的承诺(不同法律强度的项目累加)
- 其中约 3,000 亿美元与甲骨文,900 亿美元与 AMD,380 亿美元与 AWS,加上 5,000 亿美元的 Stargate 合资项目
- OpenAI 2026 年亏损据报告接近 140 亿美元
- 甲骨文未履约义务积压约 5,230 亿美元,高度集中于 OpenAI
- 供应商又以该积压为依托购买英伟达芯片
英伟达-OpenAI 1,000 亿美元股权意向书在 2026 年初因审查而停滞——既是警告信号,也是部分去杠杆。
传导路径是:如果高端需求出现缺口,OpenAI 的支付能力→甲骨文的积压质量和偿债能力→英伟达订单簿和供应商股权头寸的市值→DRAM 市场上新增 2027-2028 晶圆产能落地时遭遇供过于求的全面崩塌。
这张图是理解”为何崩溃不是孤立的”的关键。网络的每一个节点(英伟达→OpenAI→甲骨文→Stargate→AMD→AWS)都由箭头连接,而箭头的含义各不相同:有些是股权投资,有些是供应合同,有些是合资承诺,有些是债务融资。报告特别指出,这个网络的”混合合同强度”是脆弱的根源——当一份 1,000 亿美元意向书在法律上与一份 3,000 亿美元合同处于同一网络中时,任何一个节点的压力都会因为合同的异质性而被放大而非分散。传导方向标在图中:需求缺口→OpenAI→甲骨文→英伟达→DRAM 市场——这是一条单向的、不可逆的雪崩路径。
不过,这些数字的法律地位参差不齐——并非每个”亿”都意味着同等的支付义务。下表严格区分了各类承诺的合同强度:
表 2 是理解”1.15 万亿美元”这个数字时必须持有的放大镜。它分解为:Stargate 项目(5,000 亿美元)是”已公布计划/合资企业”——没有合同约束力;OpenAI-甲骨文(3,000 亿美元)是”已报告合同但条款未披露”——有法律基础但具体条款不明;NVIDIA-OpenAI(1,000 亿美元)是”意向书,2026 年 2 月已停滞”——连约束力都没有;甲骨文 RPO(5,230 亿美元)是”审计备案数字”——法律上最坚实,但这是甲骨文全部客户的积压,非仅 OpenAI。所以真正的数学是:不是 1.15 万亿美元都会炸,而是其中每一个类别以不同的速度、在不同的触发条件下、以不同的传染路径依次炸开。
6.2 曙光系统:中国全栈的标杆意义
2026 年 4 月至 6 月间,深圳的曙光(LineShine)系统横空出世:
- 40,960 颗华为设计的 Armv9 LX2 处理器
- 每颗处理器封装国产 HBM(约 32GB,4TB/s)与 256GB DDR5
- 自研灵奇(LingQi)互联、国产存储和操作系统
- 持续性能 2.198 EFLOPS,TOP500 第一——2019 年以来首次经验证的中国提交
就 AI 相关指标而言,曙光系统比美国 GPU 加速系统落后几年:其混合精度加速比为 3.6×(GPU 加速系统为 9-11×),52 GFLOPS/W 低于 El Capitan,HBM 代次落后 HBM4 数代。
但战略上具有决定性意义的是”脱钩”而非”位置”:国产 HBM 将中国计算成本曲线置于全球存储价格危机之外。当西方建设正承受本报告核心分析的 HBM 溢价时,中国栈的存储输入由国内定价和国家主导,免疫于正在推高所有人资本支出的短缺。
6.3 结构性不对称
报告的最后一个重要判断涉及融资体制的不对称性:
| 西方 | 中国 | |
|---|---|---|
| 资金来源 | 股权估值、债务市场、循环承诺 | 国家产业政策 |
| 周期特性 | 正周期(需求失望→收紧循环→压缩产能) | 反周期(对信心不敏感,可维持十年) |
| 定价逻辑 | 必须追求资本回报,存在定价下限 | 优化市场主导,可在对手无法维持的水平下定价 |
| 历史先例 | — | 华为以国资助+开放标准(3GPP)占据全球 4G/5G 市场 |
电信业的先例是华为:耐心国家资本+激进成本结构+全面遵守开放国际标准(3GPP),在全球 4G/5G 基础设施领域扎根,直到西方做出反应时——代价高昂、局部且迟到。AI 时代的”标准层”已经就位:LX2 是标准 Armv9,开源模型软件栈(PyTorch 级框架、开源权重、开源推理运行时)就是这一周期的 3GPP——大众层不存在 CUDA 护城河。
七、战略启示:各类参与者的抉择
未来四个季度最关键的决策变量是”效率修正后的 Token 需求增长”是否落在 1.6-2.4 倍阈值区间内。次要指标包括:HBM 合同价格的正常化时点、高端 API 定价的绝对-耦合行为、以及已公布的 2028-2029 年 FID 是推进、缩减还是转为租赁。
7.1 封闭前沿实验室:轻资产化,粘性定价
报告的核心建议:
- 以租赁在位者容量替代拥有峰值年份硬件(资产轻服务)
- 以粘性绝对定价将高端能力与大众市场漂移解耦
- 将大众层视为路由目的地而非利润来源
最大的单点风险属于谁?资产负债表上嵌入以峰值存储价格融资的大众级基础设施承诺的实验室。而租用旋转地主资产的实验室(目前 Anthropic 为典型),以低于自主拥有替代成本的租金价格使用正折旧的机群,在结构上处于优越位置。
7.2 基础设施投资者:年份择时统治一切
| 交付年份 | 粘性定价下 | 耦合定价下 | 综合判断 |
|---|---|---|---|
| 2026 | 致命暴露(峰值硬件价 + 无定价伞) | 安全 | 凶 |
| 2027 | 安全 | 安全 | 唯一的通用安全年份 |
| 2028–2029 | 安全 | 致命暴露(路由成功后地板价定价) | 凶 |
两者之间的选择,本质上是”路由是否成功”这一命题的多空赌注。
报告进一步用”绿地入场”思想实验验证了上述判断:假设一家企业要从零起步,建造自有定制芯片并搭建全新数据中心——没有沉没机群,没有折旧年份,芯片和机房都以当前市价采购。
表 3 用一个”反事实测试”验证了前文的所有逻辑。假设你是一个零基础的入场者,执行 Meta 的剧本但没有 Meta 的资产负债表——自研芯片(省去英伟达的利润)+自建数据中心。结果分布令人警醒:全场景加权下,成功(经风险调整后回报高于资本成本)仅 25%,平庸(存活但勉强度日)34%,亏损(减值或退出)41%。如果在最可能的下行压力情形下,亏损概率升至 60%。但三个逃生路线可以逆转分布:绑定锚定需求 + 锁定远期 HBM 协议价(或采用非 HBM 架构)+ 抢在 2027 年窗口交付——三者齐备时成功概率翻倍至 45-50%。而如果入场时不解决内存策略,亏损概率超过 60%,无论芯片设计多好——因为你是以行业最弱的采购地位,在现货市场上买入行业最稀缺的物资。
那么,在一个风险如此分布的市场中,新进入者应该如何决策?报告提供了一个分阶段的门控程序:
表 4 将决策分解为四道闸门 + 一条常备止损线。
- G0(入场前,现在):锚定需求意向书至少覆盖机群生命周期 60% 的带宽、HBM 远期协议价不超过基础分支价格(或采用非 HBM 架构)、量产芯片不晚于 2027 年 Q4 上架——否则不要入场,改为租赁在位容量。
- G1(流片承诺,2026 Q4):制度断裂后的计量需求斜率 ≥1.8 倍年化、平台美元需求仍在增长、溢价/大众价格比压缩幅度 <20% QoQ——否则冻结流片,转向租赁模式。
- G2(数据中心最终投资决定,2027 Q2):首颗芯片 MBU ≥0.45、锚定意向转合同、商业 2026 年份机群利用率 ≥85%、无重大 FID 取消事件——否则只建壳不装机(出租型数据中心),芯片仅服务于锚定客户。
- G3(量产爬坡,2027 Q4-2028 Q1):交付 $/PB ≤1.15× 同期商业价格、走廊变量连续两个季度在阈值以上——否则将机群规模控制在仅覆盖锚定客户的水平。
- 常备止损准则:崩溃签名连续两个季度出现、旗舰闭源模型降价超 30%(耦合开始)、HBM 合同价 QoQ 再加速超 20% 且未持有远期协议——任一触发,冻结所有在当前闸门处的扩张。
程序的巧妙在于不对称性设计:崩溃签名(token 增长而美元停滞、溢价定价耦合、制度断裂后的需求斜率低于阈值)均以月频率可观测,比资本密集型承诺(数据中心 FID、量产芯片、机群扩张)领先数月到数季度。按闸顺序投入资本的入场者,实际上将大部分资本放在了 S4 场景已可被侦测的闸门之后——因此虽然全场景 41% 的亏损概率看起来很吓人,经过这门控程序过滤后,实际部署资本的亏损概率骤降至约 24%。剩余的 24% 是不可约的执行与择时风险。
7.3 在位者:限制定价,刷新功率槽位
拥有沉没机群的在位者,理性策略是:以高于边际成本但低于新进入者全成本的价格限制定价,同时基于功率槽位条件进行刷新——这正是 Meta Compute 与 Colossus 租赁所预示的行为模式。
7.4 政策制定者:豪华-大众分割的战略含义
对日本及类似处境的国家而言,报告的判断非常明确:主权能力不需要前沿级训练支出。
- 基于开源权重的高效推理 + 带宽优先架构 + 选择性高端能力接入
- 以远低于前沿训练成本的投资,捕获大部分经济价值
- 前提:基础设施由国内拥有和运营——因为美国 CLOUD 法案使美控基础设施上的数据无论物理位置均在美方法律触及范围内
- AI4SIS 工作负载应作为锚定需求培育,使主权容量独立于企业预算周期
而地缘分叉场景(12%),恰恰是此类主权开源权重推理能力升值最多的分支。
这场由存储稀缺、开源平价与地缘不对称共同驱动的产业重构,正在从根本上重新定义 AI 产业的价值分配规则。折旧传送带将硬件年份转化为阶级壁垒,压缩栈将旧机群从淘汰品升级为护城河,开源权重将训练能力从私有资本品转化为公共基础设施——而循环融资网络中的任一断裂,都可能将这些趋势从慢变量瞬间加速为危机。对于每一个产业参与者而言,未来四季度内的抉择,将决定未来十年的位置。
站在中国的视角,这份报告的隐含判断同样值得深思。 中国当前处于一个独特的结构性交叉点:一方面,开源模型已占据中立平台过半 token 份额,曙光系统证明了国产 HBM+Armv9 CPU 的全栈路线在国家规模上可行——这意味着中国的 AI 成本曲线已被部分地从全球存储危机中解耦;另一方面,西方八万亿美元量级的循环融资若在 2028-2029 年触发崩溃,全球 DRAM 产能过剩将以中国制造业难以规避的价格压力传导回国内硬件供应链。”豪华-大众”二元结构对中国同样适用:在 HBM 代次和混合精度加速比上尚未追平,但在大众推理层——开源权重 + 在位者折旧硬件 + 路由下放——具备结构性成本优势。电信业华为以开放标准(3GPP)+ 国资助成本突入全球基础设施的先例,在 AI 时代的”标准层”(标准 Armv9 ISA + PyTorch 生态 + 开源推理运行时)中正在重演——且这一轮剧本中没有 CUDA 护城河。地缘分叉(12%)虽是报告权重最低的场景,却是中国主权开源权重推理能力升值最多的分支;而崩溃场景(25%)中,反周期的国家产业资本恰恰是在对手收缩时扩大份额的最强武器。<|end▁of▁thinking|>这场由存储稀缺、开源平价与地缘不对称共同驱动的产业重构,正在从根本上重新定义 AI 产业的价值分配规则。折旧传送带将硬件年份转化为阶级壁垒,压缩栈将旧机群从淘汰品升级为护城河,开源权重将训练能力从私有资本品转化为公共基础设施——而循环融资网络中的任一断裂,都可能将这些趋势从慢变量瞬间加速为危机。对于每一个产业参与者而言,未来四季度内的抉择,将决定未来十年的位置。
八、中国视角:结构性交叉点上的机遇与风险
中国当前处于一个独特的交叉点:开源权重已占据中立平台过半 token 份额,曙光系统证明了国产 HBM+Armv9 全栈路线在国家规模上可行——中国的 AI 成本曲线已被部分地从全球存储危机中解耦。而西方循环融资若触发崩溃,两股力量——正周期的西方收缩与反周期的中国扩张——将在 2028-2029 年正面相遇。
8.1 开源权重的主导:从 2% 到 50% 的两年跃迁
中国开源模型在 AI 产业中的崛起速度,是这份报告中最被低估的结构性变量。
到 2026 年初,中国开源权重模型——以 DeepSeek V4、GLM-5.2 为代表——已占据 OpenRouter 等中立路由平台超过 50% 的 token 流量,而这一数字在 2024 年底尚不足 2%。这不是增量渗透,而是一次景观置换。GLM-5.2 以 MIT 许可证发布、744B 总参(40B 激活),在长周期编程和智能体基准上实质匹配甚至超过 GPT-5.5,服务价格仅为其约 1/6。
从报告的偿付能力走廊框架来看,这意味着中国的路径天然偏向大众推理层——价值主张恰好与”豪华-大众”结构中的大众端重合。在全球 AI 产业日益分化为”奢侈模型 + 高端推理”与”够用模型 + 地板价推理”的格局下,中国开源模型处于后者最具成本优势的位置。
但报告也暗示了一个经常被忽视的局限:开源权重的领先不等于商业化变现的领先。OpenRouter 上 Anthropic 以 11% 的 token 份额捕获 42% 的收入——溢价来自于企业级可靠性、合规锁定和深度智能体保障,这些恰恰是开源模型通过社区部署难以复制的。中国模型在大众层的优势转化为产业利润,需要向下游编排层、基础设施层和主权需求层渗透,而非仅靠 token 份额。
8.2 曙光系统:全栈脱钩的标杆意义
2026 年 4 月至 6 月间,深圳的曙光(LineShine)系统以 40,960 颗华为设计的 Armv9 LX2 处理器和国产 HBM 登顶 TOP500,是这份报告中被引用为”战略脱钩”的核心案例。
曙光系统的 AI 相关指标确实落后于美国 GPU 加速系统——混合精度加速比 3.6× vs 9-11×,52 GFLOPS/W 低于 El Capitan,HBM 代次落后 HBM4 数代。但 “脱钩的意义不在于当下性能的对齐,而在于成本曲线的独立性”:国产 HBM 将中国计算硬件的存储输入从全球定价体系中剥离,使其免疫于报告整个前半部分所描述的 HBM 溢价——这在报告框架中意味着中国的成本参数不在图 1(新建设施 vs 在位者地板)的两条 HBM 分支中的任何一条上,而是在第三个、独立于全球供需的曲线上。
更重要的是,曙光系统在架构上并非孤立案例。它采用的矩阵增强通用 CPU(SME/SVE 向量引擎 + 片上 HBM+DDR 内存层级),直接延续了 Fugaku(A64FX)的架构路线——这一路线已在 Dongarra、Hoefler 和 Matsuoka 的”我们还需要 GPU 吗?”系列论文中被论证为 GPU 之外的可行路径。曙光的意义不在于回答”中国能否造出更好的 GPU”,而在于论证了问题本身可以是错的——在 AI 推理的大众层,GPU 可能并非不可或缺。
8.3 崩溃与分叉:对中国最有利的两个场景
回到报告的五个场景框架,对中国而言,两个权重最高的场景分别在不同维度上构成机遇:
商品化崩溃(S4,25%) 是报告概率最高的风险场景,但它为中国提供了一条清晰的反周期扩张路径。情景推演如下:
- 西方需求端:Token 优化成为企业纪律 → 云端计量需求减速 → OpenAI 支付能力承压
- 循环融资断裂:Oracle RPO 崩解 → NVIDIA 订单簿收缩 → 西方资本支出冻结
- DRAM 产能过剩:2027-2028 新增晶圆厂产能落地 → 供应飙升遭遇需求萎缩 → 全球存储价格暴跌
- 中国承接产能:以国家产业资本在价格底部吸纳被西方释放的 DRAM/NAND 供应,进一步降低国产硬件成本
- 扩张窗口:西方实验室被迫收缩、新云商退出 → 中国开源模型 + 自研芯片方案在非美市场填补空白
这场崩溃对西方是”经典 DRAM 崩盘的 AI 加速版”,对中国却是”电信业华为剧本的 AI 翻版”——两者的共同结构是:一方因金融压力被迫收缩,另一方以非市场化资本成本抓住窗口扩大份额。
地缘分叉(S5,12%) 虽概率最低,却是中国估值升幅最大的场景。2026 年 6 月的 Fable-5 临时出口管制(18 天)已证明模型权重可以成为出口管制的直接目标。若管制双向扩展至开源权重,后果将是:
- 西方封闭实验室恢复到壁垒保护下的定价权——内部市场利润上升,全球竞争力下降
- 中国开源模型在除西方以外的市场成为默认选择——日本、东南亚、中东、非洲、拉美的企业 AI 采用将从西方云 API 直接转为本地化中国开源模型部署
- 中国在 CLOUD 法案无法触及的管辖权内,以”数据主权”为价值主张,成为全球非西方市场的大众 AI 基础设施默认供应商
在报告所有场景中,地缘分叉是唯一让中国开源权重从”成本优势”升级为”地缘必需”的路径——它把价格优势转化为不可替代性。
8.4 这一轮没有 CUDA 护城河
报告反复强调但往往被忽视的一个判断:在大众推理层,不存在 CUDA 护城河。
曙光系统的 LX2 是标准 Armv9 ISA。开源模型软件栈——PyTorch 级框架、ONNX、vLLM、llama.cpp 等开源推理运行时——构成了 AI 时代的”3GPP”:一套所有参与者共享的、开放的国际技术标准层。这与 2000 年代华为以完全合规的 3GPP 标准设备打入全球电信基础设施的结构如出一辙。
当年的差异是华为在成本上有结构性优势,但在技术性能上落后于爱立信和诺基亚。但电信市场是长期合同的基建市场——一旦部署,替换成本极高。AI 推理市场比电信更快:一个路由表可以在几天内切换供应商,没有经销商网络、没有充电标准、没有转售价值来保卫在位者。如果中国开源模型以 1/6 的成本提供对等能力,且通过标准运行时部署于标准 Armv9 硬件上,那么商业决策的转换速度将比电信时代快一到两个数量级。
这也解释了为什么报告的旋转地主寡头场景(S1)和系统层再差异化场景(S3)中,中国大众推理层的市场份额被假定为持续性扩张而非暂时性蚕食——因为一旦切换完成,切换回来的理由是薄弱的。
8.5 风险与盲点:HBM 代际差距与循环融资传染
但报告也暗示了中国路径的几处关键风险,这些风险不应被成本优势的光环所掩盖。
HBM 代际差距是最硬的技术约束。曙光系统的国产 HBM(32GB,4TB/s)落后 HBM4 数个代际,而推理效率对带宽的依赖是线性的。在”豪华-大众”二元结构中,中国在大众层可以容忍性能差距——开源模型已能在量化后运行于工作站级统一内存硬件上——但在需要前沿带宽的场景(超大规模 MoE 模型服务、实时智能体编排)中,代际差距意味着单位推理成本的比较优势会被硬件劣势部分侵蚀。
DRAM 崩溃的传导可能比预期更快、更痛。如果西方需求在 2027-2028 年崩溃,新增晶圆产能落地即过剩,全球 DRAM 价格将经历经典崩盘——而中国的存储制造商(如长鑫存储 CXMT)将不得不以低于运营成本的价格卖出库存,与全球过剩产能正面竞争。国家补贴可以缓冲这一冲击,但在 DRAM 这样一个资本密集、学习曲线陡峭的行业中,价格崩盘对追赶者的伤害通常比对领先者更深——因为追赶者尚未走完良率学习曲线,而领先者可以在崩盘期间以边际成本维持运营。
“去依附”的风险——美国市场准入的丧失。地缘分叉从中国视角看是利好,但从全球视角看意味着效率损失:两个 AI 栈、两套标准、两个市场——全球的 AI 基础设施投资被重复建设,而非在比较优势下最优配置。如果分叉是永久性的,中国的 AI 产业将在缺乏与全球最先进前沿实验室直接竞争的生态中演化——这可能在短期内加速自主创新,但长期可能导致技术路径的锁定效应。
8.6 战略含义:三个优先事项
综合报告的框架与中国当前的位置,三个优先事项值得关注:
大众推理层的规模化优先于 HBM 代际追平。在”豪华-大众”二元结构中,大众层的市场份额、基础设施占有率和部署粘性是长期护城河。HBM 代际差距应在研发管道中追赶,但不应急于在尚未成熟的节点上量产。在可预见的未来,中国 AI 产业的核心竞争力来自成本结构,而非技术领先性。
建立 DRAM 价格崩溃情景下的反周期库存战略。如果西方 AI 需求在 2028-2029 年触发经典 DRAM 崩盘,建立国家级的存储芯片战略库存、以低位价格锁定未来数年的 HBM 和 DDR 供应,是比扩大国内 DRAM 产能更稳健的策略——因为产能扩张需要时间,而库存可以在周期底部立即吸纳。
将主权 AI 基础设施出口作为非对称竞争力。以曙光系统为模板,向主权敏感市场(日本、东南亚、中东)提供”开源模型 + 标准硬件 + 数据主权保证”的完整方案——这既是对旋转地主寡头场景中西方在位者限制定价的破局,也是地缘分叉场景中提前抢占不可逆部署窗口的战略布局。
最为关键的是,这份报告提醒中国产业参与者:AI 产业重构的速度取决于单一最脆弱节点的断裂速度——在这个框架中,那个节点是 OpenAI 的资产负债表。中国不需要在所有层面追平,只需要在关键节点断裂时,处于承接需求的最优位置。
附录:模型参数
表 5 公开了报告全部分析背后的参数假设,以下为关键参数速览(完整数值见表):
| 类别 | 参数 | 取值 |
|---|---|---|
| 基础设施成本 | 电力 | $0.08/kWh |
| PUE | 1.3 | |
| 运营 | $0.25/GPU-hr | |
| 系统倍数 | 1.5× GPU 单价 | |
| 折旧 | 4 年直线折旧 | |
| 内存带宽利用率 (MBU) | H100 | 0.50 |
| Blackwell | 0.55 | |
| Rubin | 0.60–0.62 | |
| 各代平台 | H100 | 3.35 TB/s,700W |
| H200 | 4.8 TB/s,700W | |
| B200 | 8 TB/s,1,000W | |
| GB300 | 8 TB/s,1,400W | |
| Rubin | 16 TB/s,1,800W | |
| 2029 更新版 | 20 TB/s,2,200W | |
| 加速器价格 | 基础分支:GB300 $55k → Rubin $72k → 2028 $58k | |
| 短缺分支:2027–2029 持续 $76–86k | ||
| 训练成本 | 前沿计算量增速 | 2.5×/年 |
| 硬件效率改善(基础/短缺) | −25%/年 / −10%/年 | |
| 2026 年单次训练成本 | ~$1.5B | |
| 效率与需求 | 推理效率改善(基准) | 30%/年 |
| 压力范围 | 15–45%/年 | |
| 定价分支 | 耦合定价 | 溢价 = 7× 大众价 |
| 粘性定价 | 溢价 = $0.40/PB 绝对价 | |
| 大众价底线 | 30% 利润率加成 |
这些参数在 ±20% 扰动下结论保持稳健。
Reference
- Memory Scarcity, Open Models, and the Restructuring of the AI, July 2026, independent research paper.
内存稀缺、开源模型与AI产业重构
http://vincentgaohj.github.io/Blog/2026/07/14/内存稀缺-开源模型与AI产业重构/





