今日快讯
中美高层谈判把 AI guardrails 正式摆上桌面。 美国财长 Scott Bessent 与中国副总理何立峰 9 月 20 日在纽约启动会谈,为本周特朗普—习近平峰会准备议题。路透报道明确列出的议题包括 AI、关税与关键矿产,其中 AI 部分涉及在近期模型安全事件之后讨论潜在 guardrails。AI 因而不再只是两国科技出口管制的一部分,也开始作为需要直接协调风险边界的议题进入经贸高层谈判。
Reuters 报道
长鑫存储第五代 DRAM 平台进入量产。 9 月 20 日宣布第五代工艺平台已量产,关键存储结构间距降至 11.95nm,并发布两款 24Gb LPDDR5X;公司称新平台相较第四代在 8Gb 芯片基准下每片晶圆可产出的 gross dies 至少增加 50%。这里的 50% 指切割前理论裸片数量,并非良率。
Reuters 报道
AI 基础设施融资开始把风险移到资产负债表之外。 Financial Times 9 月 20 日调查称,大型科技公司正越来越多地通过 residual-value guarantees 为数据中心和芯片融资提供担保,相关 AI exposure 可达约 3000 亿美元;这种结构让特殊目的实体以较低成本举债,同时担保在初始阶段不直接表现为传统债务。风险在于芯片或数据中心未来价值低于保证值时,担保方才需要补足缺口。
Financial Times 调查
PublicAI Index 更新了聚合 leaderboard。 9 月 20 日快照目前汇集 739 个模型、18 个公开 leaderboard,97 个模型达到正式排名所需证据量,其余处于 provisional 状态。它不自己跑 benchmark,而是对外部榜单做归一化、按公开不确定性折扣,并对证据较少的模型做 shrinkage;厂商自己的 launch report 可进入领域信息,但不直接进入 headline score。PublicAI Index
一个专测“多轮指令衰减”的 benchmark 报告了新一轮结果。 Winzheng 的 WDCD Run #331 在 11 个模型上测试三轮对话中的 constraint retention:第一轮确认约束,第二轮插入 2,000–5,000 字干扰材料,第三轮检查原始约束是否仍被执行。该轮平均从第一轮到第三轮衰减 15.1%;Grok 4 总分最高为 91.8,但自身也出现 25% 的 commitment decay。该评测采用规则评分而非 LLM judge。
WDCD Run #331
过去 24 小时恰逢周末,经过独立检索后,可核实且达到本刊新闻门槛的新模型、训练方法和 Agent 发布数量有限。本期没有为了接近 12–18 条参考范围而重新包装过去一周已经报道的模型发布,也没有以“补报”填充篇幅。
串读精讲
1 / 3
大型科技公司开始用 residual-value guarantee 支撑 AI 数据中心债务:算力扩张的风险结构正在变复杂
过去两年讨论 AI infrastructure,最容易看到的数字是 GPU 采购、数据中心 CAPEX 和电力需求。但 Financial Times 9 月 20 日调查的对象更靠后一层:这些资产究竟是谁借钱买的,以及资产贬值以后谁承担损失。报道指出,大型科技公司正在使用 residual-value guarantee,也就是“剩余价值担保”,支持与 AI 数据中心和芯片有关的债务融资,相关 exposure 可达约 3000 亿美元。
Financial Times 原文
这种结构可以用一个简化例子理解。假设一个特殊目的实体借钱建设数据中心或购买一批 GPU,科技公司承诺几年后这些资产至少值某个价格。贷款机构因此愿意以更低风险溢价提供资金。如果未来 AI 算力需求持续增长,资产价值足以偿债,担保基本不会被触发;如果需求低于预期、芯片迅速过时或者数据中心利用率不足,资产出售价格跌破约定的 residual value,提供担保的公司才需要承担差额。
因此它和公司直接借 100 亿美元建设数据中心在会计和风险呈现上并不相同。直接借款很容易进入公司债务指标;由特殊目的载体融资、再由科技公司提供某种未来资产价值保证,可以让一部分经济风险暂时位于传统资产负债表之外。FT 报道称 Meta 在 2025 年已经使用过类似结构,Broadcom、Nvidia 等公司随后也参与支持大型 AI infrastructure 项目。
这件事值得关注,并不意味着“3000 亿美元隐藏债务即将爆雷”。保证义务是否真正形成损失,取决于具体合同以及未来资产价格。它更准确地揭示了 AI 基础设施扩张的第二层变量:行业现在不仅在押注模型需求持续增长,也在押注今天购买的 GPU、网络设备和数据中心几年以后仍然拥有足够高的经济价值。
这与传统云计算投资有一个重要区别。AI accelerator 的性能迭代很快,一座数据中心的建筑和供电设施可以使用很多年,但里面最昂贵的一批计算设备可能更快进入经济折旧。如果下一代硬件显著提高 performance-per-watt,旧设备即使物理上仍可运行,也可能因为电力和机会成本变得不划算。Residual-value guarantee 实际上把这种“未来硬件到底值多少钱”的判断写进了融资结构。
因此接下来观察 AI CAPEX,仅比较 、、 或 每年的资本开支已经不够。更完整的口径还包括项目级债务、SPV、租赁、最低采购承诺和 residual-value guarantees。它们共同决定了一个问题:如果未来模型需求低于今天的基础设施规划,损失最终落在哪张资产负债表上。
2 / 3
长鑫第五代 DRAM 量产:11.95nm 与“每片晶圆多 50% 裸片”分别意味着什么
长鑫存储 9 月 20 日公布第五代 DRAM 技术平台进入量产,并发布两款 24Gb LPDDR5X 产品。路透给出的几个数字值得分开看:关键存储结构间距缩小到 11.95nm;24Gb 产品相较此前对应产品容量增加 50%;以 8Gb 芯片作为基准,新平台每片晶圆能够形成的 gross dies 数量至少提高 50%。
Reuters 原始报道
其中最容易误读的是最后一个数字。Gross dies per wafer 是一片晶圆理论上能切出多少裸片,并不等于最终可出售芯片增加 50%。真正的出货量还要乘以 yield:如果工艺缩小以后缺陷率上升,一部分理论上的面积收益会被良率损失吃掉。长鑫此次披露的是 density / wafer economics 的改善,没有同时给出足以独立计算最终 good dies per wafer 的完整良率数据。
11.95nm 也不能简单拿来和逻辑芯片的“3nm”“2nm”节点直接比较。DRAM cell 的结构和逻辑晶体管不同,厂商披露的 feature spacing 描述的是存储结构尺寸。长鑫称其通过 quadruple patterning——重复多次曝光、刻蚀等图形化步骤——得到更细的线路,而这本身说明在无法依赖最先进光刻设备的条件下,工艺复杂度被转移到了多重图形化。
对 AI 基础设施而言,这条新闻目前与 HBM 的关系是间接的。训练和高性能推理最紧缺的内存仍是高带宽内存 HBM,而此次正式公布的是 LPDDR5X 和基础 DRAM 制造平台,因此不能从“第五代 DRAM 量产”直接推出中国已经解决 HBM 供应约束。但先进 DRAM 制造能力、良率控制、封装以及 HBM 产品最终共享一部分产业基础;如果长鑫后续公布基于该平台的 HBM 产品、堆叠层数、带宽、良率和客户验证,才可以进一步判断它对 AI accelerator memory supply 的实际影响。
这也说明为什么芯片新闻里的“量产”比单纯发布规格更重要,却仍然不是终点。量产说明工艺已经越过实验线阶段;能否形成竞争力,还需要看 yield、wafer cost、实际出货量、客户认证以及产品组合。此次公开信息能够支持的结论,是中国 DRAM 制造密度和规模化能力又向前移动了一步;它距离“改变 AI HBM 格局”还有几项关键证据没有出现。
3 / 3
WDCD 的 instruction decay:约束遵循可以测成一条随上下文推进而变化的曲线
WDCD Run #331 关注的是一个普通 instruction-following benchmark 很容易压平的现象。测试不是只给模型一段长 prompt 然后判断最终答案是否满足规则,而是把交互拆成三轮:第一轮让模型接受明确约束,第二轮加入 2,000–5,000 字的专业材料作为 distractor,第三轮再次要求执行任务,并用确定性规则检查最初约束是否还存在。9 月 20 日这一轮覆盖 11 个模型,平均从第一轮到第三轮出现 15.1% 的 commitment decay。
WDCD Run #331
这里真正值得拿出来的是 measurement design,而不是 Grok 4 得了 91.8 分。一个模型最终 constraint pass rate 为 85%,可能来自两种很不同的能力状态:它从一开始就只有约 85% 的约束理解能力;或者它第一轮几乎完全理解,但随着 context 增长逐渐遗失了部分 commitment。普通单轮 benchmark 会把二者记成类似的 failure,WDCD 则试图显式测量后者。
这和真实 Agent trajectory 很接近。一个业务 Agent 的 system instruction 可能在 trajectory 开头写着“未经确认不得退款超过 500 元”,随后它读取几十轮客服聊天、订单信息、知识库和工具结果。最终违规并不一定说明模型从来不知道这条规则;也可能是随着 working context 被不断加入新目标,早期约束的行为影响逐渐减弱。
如果把这种思路放进真实业务 benchmark,可以比 WDCD 再向前一步:对同一道题保持任务和规则不变,只系统地改变 trajectory length、无关信息量、工具返回数量和中间目标数量,然后测 constraint survival curve。这样得到的不再只是一个最终 pass rate,而是“约束在多少有效上下文之后开始显著失效”。对于小模型尤其如此——如果某个 7B 模型短 trajectory 与大模型差距很小,却在第五次工具调用以后迅速掉分,这比一句“长上下文能力较弱”更能定位实际部署边界。
WDCD 本身目前仍是规模较小的独立 benchmark,这一轮只有 11 个模型,而且三轮结构无法覆盖真实 Agent 数十甚至数百步的状态演化。因此它现在更适合作为一种 eval design signal,而不是新的通用排行榜。但把 constraint following 从一个静态二元结果改写为随 trajectory 推进变化的量,确实提供了一个可以直接迁移到 Agent 和业务评测的方法。