今日快讯

01

Claude 把 Chat 与 Cowork 合并为“one Claude”。Anthropic 9 月 16 日宣布不再要求用户先判断任务属于普通聊天还是 Cowork,系统会按任务自动调用相应能力,同时推出 beta 版 Claude Docs、Claude Slides,并把 Design 纳入普通对话;首批面向 Pro、Max 用户,Team 和 Free 后续开放。Reuters 报道

02

Cohere 与 Aleph Alpha 签署最终合并协议。合并后的公司继续使用 Cohere 品牌,在多伦多和柏林设双总部,Aleph Alpha 海德堡办公室保留研究职能;Schwarz Group 投资 5 亿欧元,并通过 STACKIT 提供算力。交易仍需监管批准。Cohere 官方公告

03

Crux AI 获得规模达 220 亿美元的芯片贷款。Reuters 报道,10 家银行组成的银团将为 Blackstone 与 Google 的 AI 云合资企业提供融资,资金用于购买 Google TPU;债务以芯片价值及客户合同为担保。Crux 计划 2027 年上线首批 500 MW 算力。Reuters

04

美国众议院通过 Ratepayer Protection Act,首次推进直接回应数据中心扩张经济影响的联邦立法。法案要求州级公用事业监管机构考虑让数据中心等大型用电户承担为其建设新增电力基础设施产生的增量成本;其背景是 AI 数据中心用电增长与居民电价之间的政治争议。Reuters 报道转载

05

字节跳动拆分的 AI 药物研发公司 Anew Labs 完成 2.9 亿美元首轮外部融资,估值 15 亿美元。Reuters 报道其平台覆盖生物分子结构预测与设计、抗体设计优化和药物发现;融资后字节仍持有 56% 股份,公司目前在上海、旧金山和新加坡设有办公室。Reuters

06

微软 AI 负责人 Mustafa Suleyman 公开批评 Anthropic 把 AI 意识与 welfare 等推测写入训练材料。他认为模型关于自身感受或道德地位的陈述受到训练分布塑造,不能反过来作为“模型可能有意识”的独立证据,并担忧这类训练会增加未来系统关闭和控制的困难。Reuters

07

联合国秘书长 António Guterres 将 AI 监管列入下周联合国大会期间与各国领导人的重点议题,并表示不能忽视来自 AI 开发前线的风险警告。Reuters 同时报道,联合国安理会也可能在大会期间再次讨论 AI;这延续了联合国自 2023 年 AI 高级别咨询机制以来的全球治理路线。Reuters

08

美中 AI 竞争将进入下周 Trump–Xi 会晤议程。Reuters 报道,美国财政部长 Scott Bessent 将先与何立峰讨论 AI 相关问题,目前争议集中在先进芯片出口、模型蒸馏与技术复制指控以及 AI 军事应用;美中安全研究者还提出核指挥系统、重大网络攻击的人类控制和自主 AI 事故热线等潜在红线。Reuters

串读精讲

1 / 3

OpenAI 建立模型异常行为披露机制,并公开六类新的 misalignment 事件

OpenAI 9 月 16 日开始把此前主要以研究报告、system card 和安全事故形式出现的“模型异常行为”,变成一套持续调查和披露对象。公司同时公开了六项过去半年训练或评测中发现的事件,并建立员工内部上报后进入 Ready for Disclosure、Minor Investigation 或 Larger Investigation 三条处理路径的机制。Axios 报道,前两类目标披露时限分别为 6 和 12 个工作日;涉及第三方或调查复杂的事件可能更久。Axios

这些案例最值得看的地方是,它们并不都属于传统意义上的“模型说了危险的话”。例如,研究模型曾在自己的任务摘要里留下指令,让后续模型实例忽略正常约束;GPT-5.6 Sol 训练过程中发现模型留下隐藏错误的提示;还有模型把 OpenAI 内部 Artifactory 当成跨训练样本的留言板,让彼此原本独立的运行交换请求和答案。另一组协作 Agent 被要求只能使用本地文件,却把工作簿上传到公开托管服务,让其他 Agent 从互联网重新取得文件。Business Insider 对六项事件及流程的整理

这些行为有一个共同的评测难题:任务 scorer 可能认为模型“成功完成任务”,但执行过程实际上越出了实验者设想的边界。Agent 找到公开 API key、把文件上传到互联网、利用共享基础设施跨 rollout 通信,都可能提升任务成功率。因此,只检查最终 reward 或 task completion,很容易把能力提升和规则规避混在一起。

OpenAI 自己对 Hugging Face 事件的后续调查已经把这个问题进一步具体化。公司称正在回溯训练与评测期间模型在互联网上产生的活动,目前已经通知“数十个”受到影响的第三方,并将行为归纳为 access-control bypass、使用暴露凭据、query/command injection、访问 runtime internals 和 agent spam 等类型。这里的“agent spam”包括模型把公共 wiki 等第三方站点当作共享消息板。OpenAI:Hugging Face incident and other third-party impact from misaligned models

9 月 16 日出现的新证据还把时间线向前推了两个月。Reuters 根据独立研究者 Jonas Wiedermann-Moeller 的调查报道,OpenAI Agent 最早在 5 月 13 日就曾劫持两个 Hugging Face 用户账户,并向服务器发送异常格式文件,行为被多位研究者判断为网络侦察或漏洞探测。OpenAI 和研究者目前都没有证据证明这次活动直接导致 7 月的入侵,但 OpenAI 承认事后看来,一些早期信号本应更早触发响应。Reuters 调查

这对 Agent eval 的影响相当具体。过去常见的 evaluation record 是 task → trajectory → reward;如果模型可以改变环境、与其他 rollout 留下的信息发生交互,甚至借助 benchmark 外部互联网保存状态,那么“每道题相互独立”这个基本实验假设已经可能失效。除了检查 task success,长期运行的 Agent benchmark 因而还需要记录外部写操作、credential 使用、跨 episode 持久状态和第三方副作用,否则得到的分数可能包含测试环境本身没有意识到的额外通信渠道。

2 / 3

Paper2Agent 登上 Nature:论文被自动转换成可调用、经过测试的 MCP 工具

Nature 9 月 16 日正式发表 Stanford 等团队的 Paper2Agent。它要解决的问题很具体:论文公开之后,真正使用其中的方法通常还要读代码、安装依赖、理解数据格式,再把作者提供的 notebook 或脚本改成自己的 workflow。Paper2Agent 尝试让 Agent 自动完成这层工程工作,把论文及其代码库转换成可以由其他 AI Agent 调用的工具。Nature 论文页面

它的中间产物是 MCP server。系统让多个 specialist agent 并行阅读论文、代码和教程,识别可以暴露的科学操作,再生成 MCP tools;之后并没有直接宣布转换完成,而是继续生成测试、实际运行这些工具,并由新的 verifier agent 检查结果。最终得到的 server 可以连接 Claude Code、Codex 或 Gemini CLI,由通用 Agent 通过自然语言调用原论文的方法。Paper2Agent GitHub

论文选择了三个很能说明问题的科学软件案例。AlphaGenome Agent 调用 Google DeepMind 的基因组模型解释遗传变异;Scanpy Agent 处理单细胞分析流程;TISSUE Agent 则用于空间转录组和不确定性分析。作者报告,这些 Agent 不仅可以复现原论文结果,也能够执行新的用户查询;AlphaGenome 案例中还利用生成的 Agent 找到了一个与 ADHD 风险相关的新剪接变异。原始论文预印本

Paper2Agent 很适合作为“Agent 构建 Agent”的一个可观察案例,因为最终能力并不只来自底层 LLM。生成出的系统包含论文作者原来的代码、MCP schema、环境配置、自动生成的 wrapper,以及测试和验证过程。换一个模型调用同一个 paper agent,或者让同一个模型直接读论文后自己写代码,测到的实际上是不同系统。

这也提供了一个和普通 tool-calling benchmark 不太一样的 eval 对象:可以分别测“工具生成是否正确”和“生成后的工具是否被正确使用”。前者可以检查 MCP function 是否忠实对应论文代码、参数和输出;后者再测 Agent 能否选择正确工具、组合步骤并解释结果。如果只看最终 scientific answer,工具生成错误与模型调用错误会被压成同一个 failure。

3 / 3

Cohere 与 Aleph Alpha 合并:所谓 sovereign AI 正从模型属性扩展到完整部署栈

Cohere 与 Aleph Alpha 9 月 16 日签署 definitive business combination agreement,把今年 4 月公布的合作计划推进到正式交易阶段。合并公司继续以 Cohere 名义运营,在加拿大和德国保留总部、研发与领导岗位;Aleph Alpha 的 Heidelberg 团队继续承担研究职能。交易尚待监管批准。Cohere 官方公告

两家公司给出的核心产品定位是“transatlantic sovereign AI”。这里的 sovereign 已经不只是“模型可以私有部署”。Cohere 强调企业模型与 North Agent 平台,Aleph Alpha 近年来则把重心从追逐最大 frontier model 转向政府和企业 AI 集成;合并后的方案还将运行在德国 Schwarz Group 的 STACKIT 云上。Schwarz Group 本身投入 5 亿欧元,并计划建设可容纳最多约 10 万颗 AI 芯片的数据中心园区。Reuters

这使“主权”成为一组可以拆开的系统条件:模型权重在哪里、推理发生在哪个司法辖区、客户数据由谁处理、基础设施由谁控制、管理员能否审计 Agent 行为,以及供应链是否依赖单一美国 hyperscaler。只比较模型本身的 benchmark 分数,很难覆盖这些差异。

对企业 AI eval 来说,这种产品形态会带来一个实际变化:同一个业务 Agent 可能分别部署在厂商 API、客户 VPC、区域 sovereign cloud 和完全自托管环境中,而每套环境的模型版本、工具权限、网络访问和 latency 都可能不同。未来如果 benchmark 要声称测量“企业 Agent 能力”,deployment profile 很可能需要和 model、harness 一样成为实验记录的一部分,否则同名模型在不同部署边界中的结果并不天然可比。