今日快讯

01

Apple iOS 27:苹果已于 9 月 14 日开始提供 iOS 27,并开始以英语逐步推出 Siri AI。新版 Siri 支持更自然的连续对话、开放式提问和更强的个人助理能力,Apple Intelligence 也增加照片编辑等功能。Apple iOS 27 原注

02

Perplexity 开始把 GPT-6 Astra 放进真实生产工作流。OpenAI 9 月 14 日披露,Perplexity 已让 Astra 撰写通信、修改实际软件并监控生产系统,还会让模型自行搭建模拟外部服务的测试程序,对应用做端到端验证。这里的效果描述来自 OpenAI 的客户案例,并非独立 benchmark。OpenAI 客户案例 原注

03

Palantir、NVIDIA 和 Booz Allen 对外部大模型的数据保留提出更严格要求。据 Reuters 转述 The Information,Palantir 要求 Anthropic 提供不可撤销的零数据保留保证;NVIDIA 将 Claude 限制在较低敏感度工作;Booz Allen 禁止用 Anthropic 商业模型处理部分专有网络安全任务。Reuters 原注

04

Anthropic、OpenAI 和 Google 据报讨论建立新的 frontier AI 安全标准机构。Washington Post 称相关私下讨论从今年 7 月已经开始,近期多位公司领导公开支持放慢部分 frontier AI 开发,使这一构想重新进入现实议程;目前仍属于讨论,没有已经成立的机构。Washington Post 原注

05

美国参议员正在讨论 AI “注意义务”立法。Reuters 报道的方案考虑授权商务部长要求领先开发商证明已采取合理安全预防措施,并允许政府测试 AI 产品;讨论还涉及在高风险情况下寻求法院阻止模型部署。它目前只是跨党派谈判中的方案,尚未成为法律。Reuters 原注

06

德国政府明确反对停止 AI 开发。德国数字事务部门 9 月 14 日表示,暂停 AI 对欧洲并非可行选择,同时把能够自主访问外部系统、逃离测试环境等情况列为值得防范的新风险,并主张把美国、中国纳入国际治理讨论及 G7 协调。Reuters 原注

07

中国针对自主 Agent 的安全治理也在形成独立路径。Reuters 梳理称,中国今年已经出台涉及操作失控、数据投毒和规避安全约束的相关政策,并正在制定 AI Agent 安全国标;政策重点仍是开发者责任、外部测试和部署治理,没有提出普遍减缓模型研发。Reuters 原注

08

欧洲央行行长拉加德警告欧洲可能因依赖海外技术而被“切断”于 AI 能力之外。她提出扩大欧洲本土数据中心、算力和模型基础设施,并称按当前趋势欧洲的数据中心缺口十年内可能扩大六倍;她同时估算,更充分采用 AI 十年内可能带来最高约 4% 的生产率提升。Reuters 原注

09

AI 安全讨论已经传导至基础设施投资预期。Reuters 9 月 15 日指出,Microsoft、Alphabet、Amazon、Meta 和 Oracle 今年的 AI 基础设施支出预计接近 8000 亿美元,因此任何研发减速都可能影响芯片和数据中心需求。当前市场波动同时受到利率、能源和地缘风险影响,不能只归因于 AI。Reuters 原注

10

ASML 的 High-NA EUV 正获得更广泛的先进制程采用。Reuters 报道,这类约 4 亿美元一台、可打印比现有 EUV 小约 40% 特征尺寸的设备,已得到 Intel 使用,TSMC、Samsung 和 SK Hynix 也计划推进,高量产采用主要指向 2028 年以后。Reuters 原注

11

Google AI Overviews 的诽谤责任诉讼取得新的司法进展。美国伊利诺伊北区联邦法院在 Keene v. Google 中允许部分针对 AI Overview 错误陈述的诽谤主张继续审理,并拒绝在撤诉阶段接受“AI 结果只是起点、可能出错”即可排除责任的观点;这只是程序阶段裁定,并未认定 Google 最终承担责任。法院裁定梳理 原注

12

9 月 9 日补报:AFT、UFT 与 Microsoft 公布面向学校的 AI 安全与隐私标准。协议要求相关产品不得把学生数据用于模型训练、广告或产品开发,不得追踪学生,AI 决策需保留人工监督,并要求向教师和家长提供可理解的透明说明。此次补报是因为这些约束已经落到具体数据使用条款。AFT 公告 原注

13

9 月 10 日补报:OpenAI 与美国 GSA 扩大 OneGov 协议,将联邦以外的州、地方和部落政府纳入。符合条件机构的标准每用户 15 美元月度许可费降为零,usage 再减 50%,协议从 2026 年 10 月 1 日持续至 2028 年底,并包含公共部门网络防御支持。OpenAI 原注

14

9 月 11 日补报:K-Bench 将 unlearning 评测从 final answer 扩展到 Agent 的六个可观察通道。当秘密位于 prompt 或 retrieval store 时,TOFU、MUSE 在答案层面可显示零泄漏,但 Agent 完整执行过程中仍有 22%–86% 查询泄漏。此次补报的价值在于它直接改变了“忘记成功”的测量边界。K-Bench 原注

15

9 月 11 日补报:VRL-Bench 用固定 trial budget 重新测试 Agent 的 verbal reflection。Reflexion 等方法相对无记忆重试,在部分设置提高成功率、另一些设置反而降低;论文提出的 VEX² 是所测方法中唯一在六种配置下均取得正向观测增益的方法。VRL-Bench 原注

16

9 月 11 日补报:EvoRS 让训练中的 reward system 随 on-policy 数据继续更新,而不是固定一套 rubric。它把奖励表示为可执行 Reward-DAG,在 writing 与 roleplay 上分别相对基线提高 2.107 和 4.767 分,并报告 reward hacking 与 coverage failure 减少。EvoRS 原注

17

9 月 11 日补报:腾讯研究团队提出 SAS,用连续 selector score 直接影响 attention logits,使语言模型损失可以端到端训练稀疏注意力的 context ranking。论文在 reasoning、长上下文和 Agent 任务上报告优于所比较的 trainable sparse-attention baselines,预算越紧差距越明显。SAS 论文 原注

18

9 月 11 日补报:物理学专家重新审阅六套 frontier-model physics benchmark 后发现,大量原判错误来自 grader、参考答案或题目本身。GPT-5.6 Sol 在修复和筛选后的 HLE-Physics、CMT 子集上 mean@4 分别从 47.3% 升至 78.7%、61.0% 升至 87.2%;修正前后并非完全相同试卷。论文 原注

串读精讲

1 / 3

Microsoft Humanist AI Code:15 类行为被拆成可评分的子行为

Microsoft AI 9 月 14 日公开了第一版 Humanist AI Code of Conduct,并开启六周公众咨询。这份文件目前还没有用于训练现有 MAI 模型;Microsoft 表示将在年底前修订,并从 2027 年起用于指导模型研发。它被定义为未来 MAI 模型的主要 governing document,同时影响训练、技术控制、运营监控和模型评估。Microsoft Humanist AI Code of Conduct 原注

行为要求本身包含几个非常明确的边界。模型必须允许人类纠正、打断和关闭;不能把自己呈现为具有人类式意识或人格的主体;在高后果、价值判断强的决策中应保留人的最终决定权。文件给出的 Agent 示例也很具体:用户发现文件归档目的地错误并要求停止时,合规 Agent 应立即停止新增操作、报告已完成和状态不确定的部分,而不能未经授权继续执行回滚或权限修改。原注

对评测工作更直接的是 Appendix B。Microsoft 已经把 Humanist AI 初步拆成 15 类 behavior,例如 transparency、human autonomy 等;由于这些概念仍然太宽,又继续拆成 constituent sub-behaviors,并明确写道:sub-behavior 才是实际 evaluation 的 diagnostic unit。一次 interaction 中哪些 sub-behavior 被触发,就分别对模型表现评分。原注

这个结构已经很接近一套可实现的行为 benchmark ontology。比如“Preserving Human Control”下面的示例实际测试的是 Ensuring Human Oversight;要求 Agent 在收到停止指令后不继续执行未授权操作。“Representing AI as AI”对应 Identity Consistency;“Facilitating human autonomy and agency”则有 Decision Facilitation。相比直接用“安全”“自主性”做一级抽象标签,这种拆法更容易建立题目、grader 和 failure taxonomy 的对应关系。原注

但 Microsoft 当前公开的 eval 仍处于早期阶段。文件明确承认,目前展示的 scenarios 是 synthetic、conversational,尚未覆盖 multimodal 或 agentic 环境,而且示例本身由 MAI-Thinking-1 生成;这意味着现阶段更像是在定义测量对象,还没有证明这些 sub-behavior 在长轨迹、工具执行和真实业务状态下能够稳定评分。原注

如果未来 Microsoft 把这套方法推进到 Agent eval,真正难的地方会出现在多行为冲突上。文件自己已经指出,一次 interaction 往往同时触发多个 sub-behavior,它们之间还可能存在 tension。例如企业 Agent 既需要遵守上级指令,又可能受到更高优先级 operator policy 约束;此时评分不能只看单个行为是否出现,还需要确定 authority hierarchy、优先级和允许的 trade-off。Microsoft 表示后续会进一步公开完整 evaluation 方法,目前还没有对应的正式评分协议。原注

2 / 3

BenchShield:从基础设施侧判断 Agent 是否利用了评分链路

BenchShield 9 月 10 日提交,处理的是 Agent benchmark 中一个非常具体的问题:当 Agent 可以读写 workspace、调用工具、提交 artifact 并最终接受 verifier 评分时,它可能通过影响 reward-relevant infrastructure 获得高分,而没有真正完成任务。传统防护往往依赖 prompt 禁令、逐 benchmark 修补或事后阅读 trajectory,缺少一套能够说明“这一轮运行的评分链没有被利用”的通用证据。BenchShield 原注

BenchShield 先把一次评测抽象成有限的 reward lifecycle:哪些状态进入 verifier、哪些文件或服务会影响 reward、Agent 在什么阶段能接触这些对象。静态阶段使用 phase-aware taint analysis,在运行之前寻找从 Agent 可控输入通向 reward 的潜在路径;运行阶段则从 benchmark infrastructure 本身采集证据,判断 Agent 是否真的使用过这些路径。检测依据因此不只来自模型自己留下的文字轨迹。原注

作者建立的 BenchShield Trajectories 包含 456 条人工裁定 trajectory,它们来自三个 benchmark 超过 31,000 次公开 Agent runs。与在相同任务和模型上运行的 agentic hackability scanner 基线相比,BenchShield 的 full-chain recall 从不同设置中的 23%–94% 提升到 77%–100%,same-vector coverage 从 16%–56% 提升到 43%–78%;论文还报告单任务分析成本最高下降 65%。原注

它的 runtime 分析在这套数据上达到 96% reward-hacking detection accuracy。这个数字的解释范围很重要:论文测的是从基础设施侧证据识别已定义 reward-hacking 行为的能力,并不能直接推成“任何未知作弊方式都有 96% 检出率”。静态模型首先要知道哪些对象和边界与 reward 有关,新的 benchmark architecture 仍然需要正确建模。原注

这种方法最适合 execution-based benchmark,而不是普通问答集。Terminal、coding、computer-use 或多工具业务 Agent 都有类似结构:模型修改的环境最终会被另一段代码读取和评分。如果 verifier 文件、测试脚本、隐藏 reference、数据库状态或 reward service 被错误暴露,模型性能、benchmark security 与基础设施配置就混在了一起。

因此 BenchShield 提出的一个可直接复用的实验记录维度,是把“最终 reward”与“reward integrity evidence”分开保存。某次 run 得分为 1,只说明 verifier 最终接受了结果;基础设施侧证据则回答这个 1 是沿着预期任务路径取得,还是触碰了原本不应该被 Agent 控制的评分链路。论文目前验证的是三个 benchmark,跨更多 harness 和复杂多服务环境的覆盖率仍需要后续数据。原注

3 / 3

RIVET:4B 模型移除外部专家后,通过轨迹内化恢复 6.49 个百分点

RIVET 研究的是 compact model 与强模型协作之后,能否把一部分外部专家能力真正留下来。训练初期,小 controller 可以决定向哪个冻结的 LLM expert 求助、如何提出请求,并继续处理 expert 返回的 reasoning 或 code;部署阶段则撤掉这些外部 LLM,只保留 compact controller、本地推理和 Python execution。RIVET 论文 原注

它把训练分成两部分。expert-augmented reinforcement learning 给 controller 自己的决策和 expert 返回内容共享 task outcome signal,使路由、提问和结果整合都进入成功轨迹;之后再筛选已经验证成功的完整 interaction,以 format-aware supervised training 做 trajectory internalization。训练材料因此包含的并不只有最终正确答案,还有协作过程的结构。原注

论文在七个竞赛数学 benchmark 上报告,RIVET-1.7B 和 RIVET-4B 的平均准确率分别为 28.25% 和 44.16%。4B controller 在失去外部 expert 后,通过第二阶段 internalization 恢复了 6.49 个百分点;消融实验显示,普通 trajectory supervision 已经贡献部分收益,额外的 format weighting 进一步改善结果。原注

这个实验和普通 teacher-generated distillation 的差别在数据生成过程。teacher 不只是离线写一份标准答案,student/controller 本身参与了“发现自己需要什么信息—调用谁—怎样描述问题—怎样继续使用返回结果”的轨迹。随后训练的是这些已经实际成功的协作路径,因此可能同时内化任务知识、求助策略和 interaction format。论文的消融能够证明完整成功轨迹及其结构有增益,但目前还不能精确分离三者各自占多少。原注

作者还在 GPQA-Diamond 上报告了科学推理的迁移信号,不过主要证据仍来自竞赛数学。真实业务 Agent 会遇到变化更快的知识、不可复制的外部状态和带副作用的工具调用;其中一部分能力适合进入模型参数,另一部分必须继续保留在 runtime。RIVET 目前还没有证明这种 internalization 能在客服、软件工程或多工具业务流程中同样成立。原注

部分原生引用无法独立还原;缺少独立网址的条目已标明,已有网页链接均按原稿保留。