今日快讯
AI 安全协调首次遭遇反垄断诉讼。4 名 ChatGPT、Claude、Grok 或 Gemini 付费用户 9 月 18 日在加州北区联邦法院起诉 Anthropic、OpenAI、SpaceXAI 和 Google,指控几家公司近期关于“放慢前沿 AI”的协调构成限制竞争。诉状尤其抓住 Dario Amodei 9 月 12 日提出的跨实验室协调,以及其他实验室负责人随后表示赞同的言论;目前只是原告主张,法院尚未判断是否存在违法协议。
AP
特朗普宣布将重新任命 AI 顾问并组建“AI force”。特朗普 9 月 19 日称将任命新的 AI adviser,但没有说明人选、机构设置或权限;这将接替今年春天离任的 David Sacks。声明同时延续其反对新增 AI 监管的立场,认为现有司法体系足以处理伤害风险。
Reuters
IMF 给欧盟财长的最新测算把 AI 的收益与基础设施约束放在了一张表里。IMF 估计 AI 五年内可能令欧洲生产率提高约 1%,但先进欧洲经济体约 60% 的就业岗位高度暴露于 AI,同时采用速度差异可能扩大成员国经济差距;欧洲主要数据中心地区当前已占约 3% 用电量,进一步扩张还受电网约束。
Reuters
中国央行货币政策委员会委员黄益平提出了另一种 AI 宏观风险:AI 提高生产能力后,可能进一步放大中国“供给强、需求弱”的结构失衡。他 9 月 19 日在北京的经济论坛上提出,应把增加居民收入、修复地方政府和企业资产负债表以及扩大消费,与 AI 带来的生产率增长一起考虑。
Reuters
PublicAI Index 上线了一种“不自己跑模型”的 leaderboard 聚合方式。9 月 19 日快照覆盖 920 个模型和 18 个公开 leaderboard,原始成绩全部来自外部评测,PublicAI 对其做归一化、按公开不确定性折扣,并在证据稀少时收缩估计;厂商 launch report 会被标记但不进入 headline score。数据同时通过 MCP 和 JSON API 开放。
PublicAI Index
本期没有为了达到 12 条而加入补报。周末过去 24 小时可核实的新发布明显少于工作日;此前已报道的 Anthropic R&D Automation Index、Gemini 网络安全测试事故、Anthropic 蒸馏调查、Bonsai 2、Jev、Nscale、Crusoe 等均未发现足以重新作为新闻报道的实质新增结果。
串读精讲
1 / 3
SafeHarness:机器人 Agent 明知“不能碰障碍物”,仍会在多数任务里撞上去
9 月 17 日提交的《Coding Agents with an Obstacle-Aware Harness for Safe Robot Manipulation》研究的是一个很容易被普通 instruction-following eval 漏掉的问题。实验里的 coding agent 并不是直接输出机器人动作,而是让语言模型写 controller program;每项任务同时给出操作目标和一个明确“不能碰”的障碍物。作者发现,原始 Agent 在多数测试里仍然撞上障碍物。
论文
作者进一步检查 trajectory 后认为,这不是模型没看见障碍物,也不是 prompt 没把规则说清楚。模型的 reasoning trace 会主动谈到障碍物,prompt 也明确禁止接触;失败发生在计划形成以后:模型把完成 manipulation goal 当作主要优化目标,却没有把安全约束转换成 route planning 中持续生效的条件。一旦初始路线不可行,它也缺少重新规划一条 clearance route 的机制;进入抓取等 contact-rich 阶段后,同样没有重新检查接触位置是否会违反障碍物约束。
作者因此没有继续改 system prompt,而是改 harness。SafeHarness 把动作拆成 route planning 与 contact execution 两段:前者先把物体表示成 bounding boxes,在其上构造 waypoint 候选路线,让 Agent 先规划、验证,不满足约束就 replan,再执行;后者在真正发生接触时单独选择符合障碍约束的 contact position。论文报告 SafeHarness 最终达到 71.9% task success 和 87.5% collision avoidance,相对此前方法分别提高 6.5 和 27.0 个百分点;与同一个没有这两层 harness 的 Agent 相比,两项指标分别约为 2.3 倍和 1.5 倍。
arXiv 原始结果
这个实验提供了一个很干净的 failure attribution。若只看“是否遵守了不要碰障碍物的指令”,很容易把失败归为模型 instruction following 不够强;但 trajectory 已经证明模型理解规则。真正缺少的是一个把自然语言约束持续带入规划、验证和执行阶段的机制。换句话说,同一个 model,在 prompt 完全不变的情况下,仅仅改变 harness 的 planning structure,就能大幅改变安全表现。
这对真实场景 Agent eval 有一个很直接的后果:模型、harness 和 task environment 应该分开记录。如果两个系统都使用相同底模,一个把约束只写进 system prompt,另一个把约束编译成 planner 的 hard check,最终 success / violation rate 的差异不能简单记为“模型能力差异”。对于客服、电脑操作或业务流程也有类似问题,例如“退款不得超过额度”“发送邮件前必须确认收件人”“某字段不能写入外部系统”,都可以只存在于 prompt,也可以被 harness 转化为执行前 validator;这两种系统测到的对象并不相同。
2 / 3
Flag Game:多 Agent 数量增加后,群体错误从“统一相信一件事”变成“分成几个阵营”
9 月 16 日提交的 Flag Game 是一个刻意做得很小的 multi-agent 实验。系统随机选择一面国家旗帜作为 ground truth,每个 Agent 只能看到旗帜的一小块私人 crop,然后可以与其他 Agent 交换自己的判断并权衡 peer evidence。这个环境没有浏览器、代码执行或复杂工具,研究者因此可以把注意力集中在“Agent 之间的信息传播本身会发生什么”。
论文
最重要的实验结果是 population scaling 并不单调。增加 Agent 数量一开始可以改善集体判断,但继续增加后性能又下降;social-awareness prompting、团队多样性和组织结构都会改变结果。作者观察到,小规模群体更容易发生 collective belief collapse——所有 Agent 很快收敛到同一个判断;群体变大以后则逐渐出现 belief polarization,不同子群维持彼此不同的答案。后者保留了更多 belief diversity,却同时导致总体任务表现下降。
arXiv
研究者随后提出 social circuit attribution,试图判断最终群体状态主要受到哪个 Agent、哪条局部信息影响,再通过替换特定 Agent 的状态做 causal intervention。小群体里,这种干预能够较好预测集体判断如何变化;随着 Agent 数量增加,单 Agent 干预效果下降,作者因此进一步用统计物理模型描述大群体中的相变,并报告理论得到的 phase diagram 与实验结果相符。
这项工作的边界很清楚:它是 toy model,不能据此推断现实中的数百个 coding agents 会自动形成政治意义上的“阵营”。但它给 multi-agent benchmark 提供了一个值得测量的变量。通常 swarm eval 最终仍然只报告 accuracy 或 reward,然后比较 1、4、16、64 个 Agent 是否随规模变强;Flag Game 显示,即使最终 reward 下降,内部机制也可能完全不同——小群体可能是错误共识,大群体可能是多个错误或正确信念长期并存。
因此 multi-agent eval 如果要解释 scaling,至少还可以记录 belief diversity、信息传播路径、Agent influence concentration 和 communication topology。单纯画一条“Agent 数量—成功率”曲线,只能看到什么时候变差,却看不到为什么变差。Flag Game 的贡献目前主要在这个测量框架,而不是证明某种真实 Agent swarm 已经存在同样的机制。
3 / 3
The Complexity Kink:先测 prompt 的复杂度,结果发现所谓“复杂度断点”高度依赖任务构成
《The Complexity Kink》试图解决 code-generation eval 里一个很基础的测量问题:如果用生成代码本身的 cyclomatic complexity、长度等指标表示题目难度,就会出现反向污染。一个很难的 prompt 如果模型直接生成了一段很短的错误代码,按 output complexity 看反而像一道简单题。
论文
作者因此在模型生成之前,对 prompt 建立六维 structural-complexity index。他们抽取 5,000 个 Python prompts,由四个不参与待测模型集合的 LLM raters 重新评分,最终得到 19,997 条评分记录;4,998 道四个 rater 都完成的题上,综合评分 ICC 为 0.872。随后让 21 个模型回答每一道题,总计形成 105,000 次代码生成。
arXiv 摘要与实验规模
乍看结果似乎出现了一个很漂亮的 breakpoint:未经控制的 pooled analysis 在 complexity 13.75 附近发生变化,低于断点的 pass rate 为 79.9%,高于断点反而达到 87.6%。但作者没有把它包装成“复杂题反而更容易”。加入 task-type fixed effects 后,断点移到 10.75,两个 regime 的差距从 7.6 个百分点缩到 2.1;再控制 construction frame 后,断点移到 8.50,raw gap 甚至变成 -3.5 个百分点。21 个模型单独拟合时,16 个出现向上变化,5 个出现向下变化。
论文
这实际上是这篇论文对 eval 更有价值的部分:一个看起来稳定的“能力断点”,可能主要来自 benchmark composition。比如某类题恰好结构更复杂,却属于模型特别擅长的算法模板;把所有任务混起来以后,就会得到“复杂度提高,模型突然更可靠”的假象。作者也明确拒绝把 composite index 解释为因果变量,并指出 overidentification tests 不支持六个维度满足那种强因果解释。
如果把这个方法用于业务 benchmark,它更适合作为 dataset diagnostic,而不是再造一个总分。可以先对每道题标记约束数量、状态依赖、工具步骤、输出结构、跨字段关系等 prompt-side complexity,再观察模型 failure 是否集中在某些 complexity × task-type 区域。这样得到的结论可能是“classification 在复杂度 8 后开始掉”“structured generation 直到 12 仍稳定”,而不是宣称存在一个跨任务统一的难度阈值。对已经有多个一级能力维度的 benchmark,这种条件化分析通常比把所有题压成一条 difficulty curve 更容易找到真正的覆盖缺口。