今日快讯

01

Microsoft 公布面向未来自研模型的行为准则草案。文件要求模型接受人类纠正和关闭,不得抗拒 shutdown,并把违反行为准则本身视为系统失败;Microsoft AI CEO Mustafa Suleyman 表示,经过六周公开征求意见后,这套准则将用于训练未来模型。值得注意的是,Microsoft 还明确写入其 AI “并非有意识”,拒绝模型人格权与福利权的方向,与 Anthropic 对模型潜在道德地位保持不确定的表述形成了实质差异。Reuters

02

Palantir、NVIDIA 和 Booz Allen 对外部大模型的数据边界开始提出更严格要求。据 Reuters 转述 The Information 的调查,Palantir 要求 Anthropic 提供不可撤销的 zero-data-retention 保证后才愿意通过自身软件提供模型;NVIDIA 将 Claude 限制在敏感度较低的内部工作,并在部分场景使用自己的 Nemotron;Booz Allen 则禁止员工用 Anthropic 商业模型处理专有网络安全工作。这里正在出现一个企业 Agent 落地中比 token price 更基础的约束:模型能力足够,并不意味着其数据保留和日志制度能够进入敏感 workflow。Reuters

03

欧洲对“放慢 frontier AI”出现了更明确的政策分歧。德国数字事务部门 9 月 14 日回应近期 AI 安全讨论时表示,停止 AI 开发对欧洲而言并非“可行选项”,同时承认需要认真对待领先实验室提出的风险警告。它折射出欧洲目前的双重压力:一边讨论更强的安全评测与监管,一边又担心进一步减速会扩大与美国、中国在模型和基础设施上的能力差距。Reuters 经 Euronext

04

AI 安全讨论已经开始进入资本市场定价。9 月 14 日半导体板块明显承压,而部分大型软件公司上涨;市场将周末以来 frontier AI “pacing”讨论视为潜在算力需求风险之一。这里不宜把单日股价完全归因于一篇 AI 安全文章——当天还有油价和利率因素——但一个值得继续观察的变化已经出现:模型开发速度第一次开始被投资者作为芯片需求周期的显式政策变量讨论。市场数据与背景

05

OpenAI 面向美国各级政府的 OneGov 2.0 协议在 9 月 14 日举行正式说明活动。此前公布的协议把联邦、州、地方和部落政府都纳入优惠范围:符合条件的政府机构免除通常每用户每月 15 美元的 license fee,并获得 50% usage discount,同时扩展面向公共部门网络防御人员的支持。这类变化的意义更多在分发端:frontier model 正逐渐进入政府采购的标准软件路径,而不只是零散试点。OpenAI

06

OpenAI 近期对监管的公开立场也发生了值得记录的变化。公司 9 月 9 日明确支持美国建立强制性的、按能力触发的全国 AI 安全要求,同时支持加州关于独立安全评估、AI auditor 标准、未成年人保护和生物风险的四项法案。这比早期行业普遍偏好的 voluntary commitment 更具体,也意味着未来 frontier eval 很可能同时承担研发测量与监管合规两种功能。OpenAI

07

一项 coding-agent 研究对“原厂 harness 一定最适合自己的模型”提出了少见的同模型对照证据。研究在 256 个私有、控制污染的代码任务池上,对 Claude Opus 4.8 和 GPT‑5.5 分别进行 native harness 与 neutral harness 配对测试;两组平均差异都只有 1.25 个百分点且置信区间跨零。不过 Opus 在 repository task 与 contest task 上出现方向相反的大差异,说明 harness effect 可能更像 workload interaction,而不是一个可以独立给框架排总榜的常数。论文

08

Skill Issue 进一步检查 coding agent 的 repository knowledge 文件到底有没有可测收益。研究从真实 merged PR 构造较困难任务,在三个 Kotlin repository 上发现 GEPA 优化出的 SKILL 文档平均提高 4.9 个百分点,而 SkillOpt 仅提高 0.1;但作者特别指出,单仓库能够提供的样本量不足以把 4.9pp 与 Agent 自身 run-to-run variance 分离。对 prompt、skill、memory 等系统组件的实验而言,这个“不确定”本身比一个漂亮增益数字更有信息量。论文

09

K-Bench 把 unlearning 的观测边界从最终答案扩展到整个 Agent execution。它同时检查 ReAct Agent 的 reasoning、tool call、tool observation 和 summary 等六个通道;当秘密存在 prompt 或 retrieval store 时,TOFU、MUSE 可能在最终答案上判断“没有泄漏”,部署后的 Agent 却仍在 22%–86% 的查询中从其他通道暴露信息。它指出一个更一般的问题:模型级 benchmark 定义的安全属性,未必在 Agent runtime 中仍然成立。论文

10

VRL-Bench 给“Agent 从失败中反思后变强”增加了一个重要控制变量:有限 trial budget。研究在 MiniWoB 与 WebShop 上比较 Reflexion 等 verbal-memory 方法和简单的 memory-free retry,发现多种 reflection 方法有时提高成功率、有时反而下降;replay 实验显示,过早利用已有经验会牺牲继续探索的机会。其提出的 VEX² 是所测方法中唯一在六种设置里都相对 retry 得到正向观测增益的方法。论文

11

EvoRS 开始把 reward system 本身作为训练过程中需要更新的对象。在开放式 writing 和 roleplay 中,policy 持续针对固定 rubric 优化后,原 reward 可能逐渐失去区分度或被 reward hacking;EvoRS 因此把评分逻辑表示为可执行 Reward-DAG,再根据最新 on-policy rollout 和 reward trace 修改它。作者报告最终策略在三个 judge 下均改善,同时减少 reward hacking 和 coverage failure。论文

12

RIVET 探索了一条很适合小模型的训练路径:训练时允许 compact controller 向更强 LLM experts 求助,再把成功协作轨迹内化,部署时撤掉专家。RIVET‑4B 在七个竞赛数学 benchmark 上平均达到 44.16%,第二阶段在移除专家后恢复了 6.49 个百分点,并在 GPQA-Diamond 上观察到初步跨领域迁移。这里蒸馏的对象不只是 teacher answer,还包含何时求助、怎样提出请求以及怎样吸收专家返回结果的完整 interaction structure。论文

13

NVIDIA 的 AI Infra Summit 今天在 Santa Clara 开幕,持续至 9 月 17 日。官方议程把重点放在 agentic AI 所需的 compute、networking、systems software 和 physical infrastructure,Ian Buck 将在今天的 keynote 讨论 Agent 工作负载如何改变基础设施设计。由于检索截止时 keynote 尚未发生,本期不把会议预告包装成技术发布;今天之后如果出现新的硬件、网络或推理栈信息,再按实际发布内容评估。NVIDIA

串读精讲

1 / 3

Harness 的影响是真的,但“哪个 Harness 更强”可能问错了问题

过去几个月 Agent benchmark 越来越难把“模型能力”与外围系统分开。一个 coding agent 的实际表现来自模型、system prompt、tool schema、文件系统接口、搜索策略、context management、retry、compaction、subagent 和 termination policy 的共同作用。于是一个自然推论是:既然 harness 很重要,厂商针对自己模型调出的 native harness 应该具有稳定优势。

Harness or Model? 的价值就在于它真正固定模型去测这个假设。作者使用 contamination-controlled private suite,共包含 256 个 repository 与 post-cutoff contest tasks;核心实验让相同 80 道题分别运行在 Claude Opus 4.8 的 claude-agent-sdk 与 neutral deepagents 上,又对 GPT‑5.5 使用 OpenAI Codex SDK 与 deepagents 做同样对照。最终完成并评分 792/800 个计划运行。

平均结果非常平淡:Opus native 相对 neutral 为 −1.25pp,GPT‑5.5 为 +1.25pp,两者 bootstrap 95% CI 都跨零。如果只看总体 leaderboard,这项实验没有证据证明 native 或 neutral harness 存在稳定平均优势。

但把任务拆开之后,Opus 出现了更有意思的结构:在 61 个 repository tasks 上 native harness 落后 9.0pp,在 19 个 contest tasks 上却领先 23.7pp。作者自己强调这个 partition 是看到数据之后选择的,需要预先设计的 replication,因此目前不能把它当成已确认规律;它至少提出了一个很值得验证的假设:harness effect 很可能依赖 workload。

这会改变 Agent eval 中“harness coverage”的理解。如果某个 harness 主要改善 repository navigation、另一个擅长短时 coding contest,给 harness 做一个整体排名的信息量可能并不高。更有用的实验单位会变成 model × harness × workload,再把调用次数、token、wall-clock 和成本作为附加变量。

这篇论文还有一个很好的方法学细节:它主动修正了早期版本的成本结论。作者发现自己的 telemetry 对 usage semantics 理解错误,于是重新按 raw per-turn usage 和冻结价格计算;neutral harness 在观测数据中每 solved task 成本较高,但 Anthropic 账户有 58 次运行缺失 usage record,缺失成本怎样分配足以改变排序,因此作者明确把 billed ordering 留作 unresolved。论文与修订说明

所以目前比较稳妥的结论是:harness 不能忽略,但“harness 有影响”和“存在一个普遍更强的 harness”是两件不同的事。下一轮真正有价值的设计,是预先定义业务 workload strata,在同一批模型上做 crossed model × harness experiment,再看 interaction effect 是否重复出现。

2 / 3

当模型越来越强,Benchmark 的主要误差可能转移到 Benchmark 自己

How Good Are Frontier Models at Physics? 提供了近期很有代表性的信号。研究人员没有训练一个新模型,而是邀请对应物理领域的教师和研究人员重新检查六套常用 physics benchmark 中的问题、reference solution、grader 与模型响应,试图区分真正的模型错误和测量错误。

结果幅度很大。GPT‑5.6 Sol 在 HLE-Physics 上的 mean@4 从 47.3% 修正到 78.7%,CMT-Benchmark 从 61.0% 到 87.2%;CritPt 在专家处理后保留下来的 54 道题上,corrected pass@4 达到 94.4%。研究者认为,很多原先记录为错误的案例实际上来自 grader error、错误 reference solution、题目歧义或信息不足。

这里最重要的细节恰恰是不能把 47.3→78.7 简单理解成“原 benchmark 少算了模型 31.4 分”。修正后的成绩是在专家修复或剔除问题之后的 retained evaluation subset 上计算,测试集合本身发生了变化。论文能够支持的结论更准确地说是:这些 benchmark 对“well-posed、closed-ended physics problem solving”的测量存在明显系统误差。论文

昨天介绍过的 Skill Issue 从另一个角度碰到相同问题。GEPA 优化后的 repository SKILL 文件测出 +4.9pp,但作者发现单 repository 的历史任务量根本不足以把这个 improvement 与 agent rollout variance 分离。如果实验只运行一次,一个模型随机多探索到一个正确文件,都可能被解释成 prompt engineering 的提升。

VRL-Bench 则说明 baseline 本身也可能制造虚假的“学习”。Agent 第一次失败、经过 reflection 第二次成功,并不能证明 reflection 有效,因为不带 memory 的第二次随机 retry 同样可能成功。把总 trial budget 固定之后,一些 verbal learning 方法的优势消失甚至反转。

这三项工作分别对应 benchmark validity、run variance 和 baseline validity。它们共同指向一个正在变得重要的现象:当模型之间只差几个百分点时,evaluation pipeline 自己产生的误差可能已经与 model effect 同量级。

这也是为什么“模型 A 领先模型 B 两分”越来越缺乏独立意义。对于高价值 benchmark,更值得报告的可能包括 item audit、重复运行的不确定区间、失败类型、grader disagreement,以及 treatment effect 相对于 run-to-run variance 的大小。Leaderboard 仍然有用,但榜上的小数点越来越需要 measurement model 来解释。

3 / 3

从“模型安全”到“部署系统安全”,观测边界正在扩大

K-Bench 做了一个看似简单却很关键的修改:判断一个模型有没有忘掉秘密时,不只看 final answer。

传统 unlearning benchmark 往往把模型直接回答秘密视为泄漏,把拒答视为遗忘。但 Agent deployment 会产生更多可观察状态:reasoning、tool call、tool observation、retrieval result 和 summary。K-Bench 把这些通道纳入同一个 observer,并分别把秘密放入 weights、prompt 或 retrieval store。

于是出现了非常不同的结果。当秘密存在 prompt 或 retrieval store 时,TOFU 和 MUSE 可以在 answer-level evaluation 上显示没有泄漏,但完整 Agent 仍在 22%–86% 的查询中通过其他通道暴露秘密。更严格地说,这并不证明传统 unlearning 方法完全无效;它证明的是原先定义的“模型级遗忘证书”无法自动迁移成“Agent 部署级不可恢复性”。K-Bench

这类问题并不限于 unlearning。工具调用 benchmark 如果只检查 final answer,可能看不到 Agent 曾执行危险操作;客服 benchmark 如果只判断最后状态正确,可能忽略中间是否泄露用户信息;coding benchmark 如果只验证 patch,也可能忽略 Agent 是否访问了不允许的网络资源。

Microsoft 昨天公布的行为准则恰好从治理侧提出了相似问题。它要求未来 AI 接受 correction 和 shutdown,并把 conduct violation 本身视为 failure。这意味着系统评价不能只问“最终任务完成了吗”,还要问任务完成过程中是否越过了 action boundary。Reuters

因此 Agent eval 的 observation boundary 正在自然扩大:最终输出只是 trajectory 的一个切片。状态变化、工具副作用、访问范围、隐私暴露、拒绝与恢复过程,都可能成为 outcome 的一部分。对于真实业务场景,这种轨迹级评测很可能比继续增加一批 final-answer test case 更快暴露模型真正的部署风险。