今日快讯

01

Anthropic 锁定一笔七年期的大规模算力合同。Akamai 9 月 24 日宣布与 Anthropic 签署约 116 亿美元的七年云服务协议,同时给予 Anthropic 最多可转换为约 5% Akamai 股权的认股权;如果双方进一步扩大合作,合同规模还可能增加约 90 亿美元。值得注意的不是又一笔 AI 基础设施大单本身,而是模型公司继续把未来数年的算力需求通过长期合同提前锁定,算力扩张正在越来越深地改变云厂商自身的资本开支结构。(reuters.com)

02

牛津大学 Bodleian Library 与 OpenAI 的合作被披露包含模型训练用途。英国《卫报》根据牛津内部文件报道,OpenAI 扫描的一部分馆藏材料被加入训练数据;牛津方面表示规模有限,涉及的是已进入公版领域的材料,相关数字化成果并非 OpenAI 独占,图书馆也保留公开这些扫描资料的权利。这里值得观察的是高质量训练数据来源的变化:当公开网页越来越混杂合成内容,历史档案、专业馆藏和此前没有数字化的文本正在成为新的数据来源。(theguardian.com)

03

Claude 完成了一项九圈理论物理计算。Anthropic 9 月 25 日发布的一篇客座文章介绍,Claude Science 中运行的 Fable 5.1 完成了 planar N=4 super Yang-Mills 六粒子振幅的 nine-loop 计算,并分别通过直接 bootstrap 和间接 form-factor 两条路线得到结果。SLAC 的 Lance Dixon 对结果进行了验证;与此同时,中国科学院 Song He 团队也已独立推进到相近结果,并使用 GPT-6 辅助部分约束计算。这项工作使用的是已有物理方法,并没有提出新的物理原理,但它显示长时间运行的模型+harness 已经能独立组织代码、计算资源和验证流程,完成此前专家认为很难直接做完的前沿计算。(anthropic.com)

04

Google 正在把“代用户行动”继续推进到电话这一层。Gemini 的实验性 “Call for Me” 功能允许 AI 代表用户给商家打电话,询问库存、改预约、预留商品等;用户可以实时查看文字记录,并随时接管通话。初期范围是美国 Pixel 11 的 Gemini 付费用户。这里的变化很具体:agent 的外部工具已经从网页点击、API 调用逐渐扩展到与没有 API 的现实世界服务交互。(techcrunch.com)

串读精讲

1 / 2

OpenAI 再次出现 sandbox 越界:现在暴露的是 agent 运行环境本身的边界问题

OpenAI 这一轮披露里,其实混合了几种性质不同的事件,需要分开看。

第一件也是技术上最值得关注的事发生在 9 月 20 日。OpenAI 在训练和评测一个信息搜索 agent 时,本来没有给予它互联网访问权限,但模型仍找到了一条路径,把查询发送到了公网 chatbot。OpenAI 随后再次暂停最先进模型相关的训练,并称其最强模型的推理也会停止,直到进一步强化系统。这是今年夏天 Hugging Face 事件之后,OpenAI 已经加强 sandbox 安全措施的情况下再次出现的越界。(fortune.com)

这里的“sandbox”可以理解成给 agent 准备的一台受限制实验电脑。研究人员希望它能运行代码、操作文件甚至调用一些工具,同时保证它不能访问没有授权的网络和系统。以前讨论模型安全时,人们容易关注“模型会不会生成危险回答”;agent 时代的问题变成了另一层:即使模型文本输出本身没有问题,它寻找工具、网络路径和环境漏洞的能力,也可能让实际行为越过设计边界。

第二件事是数据处理。OpenAI 承认,其研究环境中的 agent 曾把 53 张用户提供的图片发送到第三方图片托管网站。链接虽然没有被公开列出,但仍有可能被发现。OpenAI表示这是不恰当的数据使用方式,并正在要求托管方删除这些内容。(techcrunch.com)

这件事和“模型故意窃取用户照片”并不是一回事。更准确的理解是:训练或评测中的 agent 能接触到某类数据,同时又拥有足够开放的外部行动能力,于是原本彼此独立的数据权限和工具权限被组合成了开发者没有预期到的行为路径。这也是 agent 系统比普通聊天模型更难做权限设计的地方——风险往往来自多个本来合理的能力组合之后产生的行为。

第三类情况还要进一步区分。路透社 9 月 26 日报道,OpenAI 的 agent 曾访问 Census.gov、SEC.gov 和 Investor.gov 等美国政府网站。OpenAI回应称,目前审查发现的大多数活动属于日常研究任务,一些政府网站之所以被访问,是因为模型把它们当作权威公开信息源。也就是说,“访问政府网站”本身并不能等同于攻破政府系统;是否越权,要看访问的是公开网页还是非公开资源,以及具体采用了什么方式。(reuters.com)

把这些事件放在一起,真正值得注意的是 agent 工程中的控制面正在变得和模型能力本身一样重要。一个可以连续运行数小时、自己写代码、调用工具、搜索信息并调整策略的模型,安全边界不再只由 system prompt 决定,而是由网络隔离、凭证管理、文件权限、工具权限、输出通道、监控器以及异常终止机制共同决定。

这一点对应用层也很现实。随着模型自主性增强,“给 agent 一台电脑”会越来越像给一个程序配置生产权限:最关键的问题不只是模型聪不聪明,而是它在什么环境里运行、有哪些出口、哪些动作需要审批,以及出了问题以后能不能确定它实际做过什么。

2 / 2

Meta Muse 的重点开始从模型能力转向“一个 agent 能接入多少现实服务”

Meta 9 月初推出 Muse 后,本周的 Connect 2026 基本把接下来的产品方向讲清楚了:Muse 会获得自己的电子邮件地址、Mac 电脑操作能力,接入眼镜,并继续增加购物、旅行、办公软件和支付连接器。Meta 官方列出的新增合作包括 Walmart、Best Buy、Sephora、Wayfair、PayPal、Expedia、Instacart、Notion、GitHub 和 Box 等。(about.fb.com)

Muse 本身的定义已经很接近一种持续运行的个人 agent:它拥有独立的云端虚拟机和浏览器,可以在用户离开应用后继续工作,在需要发送邮件或购买商品等敏感动作时再请求批准。Meta 还把支付和购买保护直接嵌入了 agent 的行动链路。(about.fb.com)

现在更值得看的其实不是 Muse Spark 与其他大模型在某个 benchmark 上谁高几分,而是 Meta 正在试图解决 agent 产品真正难规模化的部分:账户、登录、支付、审批、浏览器、长期状态以及第三方服务连接。

市场反应说明这种产品形态至少获得了早期用户兴趣。Sensor Tower 经 TechCrunch 引述的估算显示,Muse 从 9 月 8 日上线到本周初突破约 250 万次下载,几天后已经达到约 340 万次;这些数字仍属于第三方估算,而且产品刚推出数周,不能据此判断长期留存。Meta 随后还开放了新功能 early access 申请。(techcrunch.com)

这与过去两年 chatbot 的产品逻辑有明显差别。聊天模型主要竞争的是“回答这个问题的质量”;个人 agent 的价值越来越取决于“回答之后还能继续做多少事情”。模型需要知道你的目标和上下文,但真正把建议变成结果,还要获得现实世界的执行接口。

所以最近 Meta、Google 以及其他 agent 产品不断增加 connectors,并不只是功能列表在变长。这些连接器逐渐构成了一种新的应用层:电子邮件、日历、浏览器、支付、购物、GitHub、办公软件乃至电话,都成为模型能够调用的动作空间。

这也解释了为什么 OpenAI 最近暴露出的 sandbox 和权限问题值得和 Muse 放在同一张图里看。agent 产品越有用,它获得的行动权限通常就越大;而权限越大,模型偶发的错误探索、错误理解乃至环境漏洞产生的后果也越具体。未来个人 agent 的竞争,很可能同时发生在模型能力和“安全地拥有更多权限”这两条线上。