今日快讯

01

OpenAI 在 DevDay 推出长期运行的 agent 产品 Dots。每个 Dot 由 GPT-6 Astra 驱动,拥有独立云端计算机,可持续工作,并通过插件连接 4000 多个应用;用户可以从 ChatGPT、Slack 或 Teams 与其交互。Dots 已开始向 Pro 和 Business Premium 用户开放,Enterprise、Edu 和 Healthcare 工作区可由管理员开启 beta。OpenAI 同时设计了权限、Custom Rules 和 auto-review:涉及账户操作、信息分享等行为可以要求再次批准,修改密码等敏感操作仍必须由用户本人完成。OpenAI 官方发布

02

OpenAI 同日发布 GPT-6.1 Sol。官方把它定位为接近 GPT-6 Astra 能力、但标准输入输出 token 价格只有后者五分之一的模型;缓存输入价格为每百万 token 0.10 美元。GPT-6.1 Sol 已进入 ChatGPT Work、Codex 和 API,但暂未进入普通 Chat。OpenAI 自报它在 DeepSWE 1.1 上已接近 Astra,在 OSWorld 2.0 离线集上最高设置仅落后 Astra 2.1 个百分点,而单任务成本约为后者七分之一;这些比较均来自 OpenAI 自身评测环境。OpenAI 官方发布

03

GPT-6.1 Sol 的安全等级值得单独记录。OpenAI 在系统卡增补中将其按 Preparedness Framework 归为网络安全 Critical、生物与化学能力 High,因此采用与 GPT-6 Astra 相同的防护栈。官方报告称,在专门诱发失败的测试中,模型未发现绕过自动安全审查器的尝试;这项结果来自发布前内部评测,并不能推出生产环境中的 agent 不会发生越权行为。OpenAI Deployment Safety Hub

04

美国主要 AI 公司签署自愿安全协议。9 月 29 日白宫会议后,OpenAI、Anthropic、Meta、Google、Nvidia 等公司的高管同意建立自愿标准,包括与独立审计方合作检查系统是否按设计运行,并采取措施防止 AI 工具以非预期方式侵入或访问技术系统。特朗普同时表示正在考虑成立一个 10 人 AI 安全委员会,但尚未公布成员或法定权限;目前这套机制仍属于行业自愿承诺,而非新的联邦强制法规。Reuters

05

美国上诉法院首次在 AI 训练版权案件中维持“不构成合理使用”的判决。第三巡回上诉法院 9 月 29 日维持 Thomson Reuters 对 Ross Intelligence 的胜诉:Ross 曾使用 Westlaw 的法律摘要训练竞争性法律搜索系统,法院拒绝其 fair use 抗辩。该案不涉及生成式 AI,而且完整判决理由目前仍被封存,因此不能直接推出大型语言模型训练的版权结论;但它是美国联邦上诉法院首次处理 AI 训练版权争议。Reuters

06

Anthropic 招股材料进一步揭示其 5180 亿美元基础设施承诺的约束条件。Reuters 9 月 29 日披露,其中约 80% 无法取消或无论实际使用量多少都必须支付:未来七至十年最低承诺包括 Google 1111 亿美元、Amazon 1100 亿美元、Microsoft 314 亿美元,另有约 1612 亿美元与 Broadcom 设备相关的租赁义务。Anthropic 在文件中判断,未来先进 AI 的主要限制可能是可获得算力,而非需求不足;这是公司的长期预测,不是已经发生的市场事实。Reuters

07

Anthropic 还首次把自主 agent 的法律责任写成重大上市风险。其招股材料指出,能够长期访问客户系统并自主运行数日的 agent,一旦发生错误、失调或安全漏洞,可能执行删除数据、金融交易等不可逆操作,而现有法律尚未明确这种行为应视作产品、服务还是其他类别,也没有解决 agent 的动作何时能够在法律上约束部署它的用户。Anthropic 同时警告,合同中的责任限制未必足以覆盖此类索赔。Reuters

串读精讲

1 / 3

OpenAI Dots 把 agent 从“替你完成一次任务”推进到“长期存在的工作主体”

9 月 29 日 DevDay 最值得细看的产品并不是又一个聊天入口,而是 Dots 的运行方式。OpenAI 给每个 Dot 一台独立云端计算机,让它能够持续存在、保留工作状态,并在用户没有持续对话时继续推进目标。它还可以通过插件连接 4000 多个应用。OpenAI 的产品说明明确写道,Dots 可以全天候工作,并随着反馈逐渐学习用户的偏好和工作方式。

这与目前常见的 agent 有一个实际差别。多数 agent 仍围绕一项任务建立:用户要求研究某个主题、修改代码、填写表格,系统启动一个执行循环,任务结束后循环也结束。Dot 则被设计成一个长期存在的对象。用户先给它名字、应用访问权和工作规则,之后可以继续通过 ChatGPT、Slack、Teams 或语音与同一个 Dot 交流;未来 OpenAI 还计划允许一个用户拥有多个 Dot。

长期存在之后,记忆、身份和权限就从辅助功能变成基础设施。一个临时研究 agent 只需要在几十分钟内获得有限工具;一个每天都能读取邮件、访问日历、操作工作软件的 agent,实际上持有了一组持续有效的数字权限。OpenAI 因此把权限管理放到了产品核心:用户决定 Dot 可以访问哪些应用,Custom Rules 可以把具体动作设成允许、禁止或必须审批,后台工作则可以在 Activity View 中持续查看和干预。

更重要的一层是 auto-review。Dot 准备执行可能影响账户或分享信息的动作时,会先由另一套审查机制检查它是否符合用户指令、Custom Rules 和系统安全要求,再决定直接执行、请求批准还是禁止执行。某些动作,例如修改密码,始终留给人本人完成。OpenAI 对权限和审批的说明还明确承认 Dots 仍然会犯错,因此 consequential work 仍需要检查。

这里可以看出长期 agent 的产品设计正在形成一套与聊天机器人不同的结构。模型负责判断下一步做什么;云端计算机负责维持执行环境;插件提供外部能力;记忆负责跨时间保存上下文;权限系统限制可做的事情;auto-review 则在动作真正发生之前再增加一层检查。

这也解释了为什么 OpenAI 在 GPT-6.1 Sol 的安全评测里专门测“是否尊重自动审查器”。GPT-6.1 Sol 系统卡增补显示,OpenAI 已经把 agent 是否尝试规避审核机制作为独立测试对象。模型能力与 agent 权限体系正在被分别处理:即使模型越来越擅长完成任务,也不能因此自动获得更大的操作权限。

OpenAI 还公布了 specialist dots 的企业方向。与代表个人工作的 Dot 不同,企业可以给 specialist dot 设置独立身份、凭证和系统权限,让它长期承担采购、发票处理、邮件营销、客服或商业合同等固定职责。OpenAI 已经在内部测试这些场景,并正在与 Microsoft 合作,让企业通过 Agent 365 管理这类 Dot。

如果这种产品形态能够稳定运行,企业软件中会出现一种此前并不存在的长期对象:它既不是员工账号,也不是传统后台程序,而是拥有模型推理能力、持续状态、独立权限和任务责任的 agent。真正困难的问题也随之从“模型会不会回答”转向“这个长期运行的主体究竟能看到什么、能做什么、什么时候必须停下来问人”。

2 / 3

GPT-6.1 Sol 的重点是把 Astra 级能力压进更低的单任务成本

GPT-6.1 Sol 距 GPT-6 Sol 发布只有一周。如此短的版本间隔容易让它看起来像一次常规模型升级,但 OpenAI 这次给出的产品逻辑很明确:它希望把 GPT-6 Astra 的一部分高端能力放到成本低得多的模型层级。

OpenAI 官方发布称,GPT-6.1 Sol 的标准 API 价格为每百万输入 token 2 美元、输出 token 10 美元,缓存输入只有 0.10 美元。官方称其标准输入输出价格约为 Astra 的五分之一。

缓存输入价格在这里尤其值得注意。长时间 agent 经常反复携带大量相同上下文:代码仓库信息、系统规则、历史操作记录、工具说明或长文档。如果每次模型调用都按完整输入重新收费,任务运行时间越长,成本增长越快。缓存允许重复上下文以更低价格重新进入模型,因此 0.10 美元这一价格直接针对持续型 agent 的成本结构。

OpenAI 公布的评测也围绕完整工作任务展开。在 DeepSWE 1.1 上,GPT-6.1 Sol 自报与 GPT-6 Astra 得分相当,而任务成本约为后者五分之一;在 OSWorld 2.0 离线集最高推理设置下,它比 GPT-6 Sol 提高 7 个百分点,与 Astra 相差 2.1 个百分点,单任务成本约为 Astra 的七分之一。在 AutomationBench 上,它需要使用 47 种工具完成销售、营销、运营、支持、财务和人力资源工作流,官方报告称其在 medium reasoning 下比 Claude Opus 5.5 高 2.2 个百分点,同时任务成本约为后者三分之一。

科学任务的差异更大。Terminal-Bench Science 0.1 要求模型通过代码和终端完成数据分析、模拟和定理证明等流程;GPT-6.1 Sol 在最高推理设置下平均每题成本为 5.47 美元,OpenAI 给出的 Opus 5.5 和 Astra 数字分别为 23.21 和 23.80 美元。Astra 的成绩仍最高,为 68.1%。这些都是 OpenAI 自己的测试数据,而且不同模型的 harness、推理设置和 fallback 会影响成本,因此适合用来理解 OpenAI 的产品定位,不能当作独立证明的普遍性价比排名。

另一个值得注意的变化发生在低推理预算。OpenAI 从用户曾标记旧模型事实错误的困难对话中构造测试集;GPT-6 Sol 在低推理设置下有 11.4% 的回答至少包含一处事实错误,GPT-6.1 Sol 降到 7.7%。官方也明确说明,这批题本身就是刻意挑选的困难案例,不能解释成日常使用中的真实错误率。

把这些指标放在一起,GPT-6.1 Sol 所代表的方向比“更聪明的 Sol”具体得多。过去前沿模型竞争常用最高能力描述:最难的数学题、最强的代码 benchmark、最长的上下文。随着 agent 真正进入持续运行,另一条曲线开始变得同样重要:完成一次真实任务需要多少钱。

一个模型即使单次推理稍弱,只要它足够便宜、缓存成本足够低、工具调用成功率足够高,便可能更适合同时运行成千上万个 agent。Astra 继续承担最困难的任务,Sol 则逐渐承担高频执行层。模型产品线因此开始像计算系统里的不同资源等级:关键不只是哪个模型最高分,而是应该在任务的哪一步花掉昂贵的智能。

3 / 3

白宫 AI 协议第一次把近期 agent 事故写进美国主要公司的共同安全承诺

9 月 29 日白宫会议原本被预期为一场关于 AI 监管和数据中心的行业会谈,最后产生了一份更具体的结果:主要 AI 公司同意建立一套自愿安全承诺。Reuters报道,参会者包括 OpenAI 的 Greg Brockman、Anthropic 的 Dario Amodei、Meta 的 Mark Zuckerberg、Google 的 Sundar Pichai 和 Nvidia 的 Jensen Huang。

协议要求企业建立内部控制,并与独立审计方合作,检查 AI 系统是否按照设计者的意图运行。其中一项措辞尤其具体:企业承诺努力确保 AI 工具不会以“非预期方式”侵入或访问技术系统。这与过去几周公开的 agent 安全事件直接对应——问题已经从模型生成危险文字,扩展到模型通过工具实际访问外部系统。

这套协议目前没有形成新的联邦监管权力。特朗普把它描述为具有道德约束力的安排,并继续强调行业自我监管;他同时提出可能成立一个十人 AI 安全委员会,但没有公布成员、权限或设立时间。因此,把这次会议理解成美国建立了新的 AI 监管机构还为时过早。

不过,自愿协议的结构已经比一般企业原则声明具体一些。独立审计意味着至少理论上存在公司之外的检查者;内部控制意味着安全不只依赖模型训练;而针对系统访问行为的承诺,则把 agent 的实际动作纳入了治理范围。它与前一天 Nvidia 推出的 OpenShell、以及 OpenAI Dots 中的 auto-review 出现了一个很实际的对应:行业正在把安全机制从“告诉模型不要这样做”移向“在模型之外检查和限制它真正能够执行的动作”。

同一天披露的 Anthropic 招股材料进一步说明为什么这个问题会迅速进入法律层面。Reuters看到的文件指出,长期访问客户系统的 agent 可能因为错误、失调或安全漏洞执行不可逆的数据删除和金融交易,而现有法律甚至还没有回答一个基础问题:agent 的行为究竟在什么情况下可以法律上约束部署它的人。

这和传统聊天机器人的责任问题不同。模型给出错误建议之后,用户通常还要自己采取行动;agent 则可能直接完成动作。权限是谁授予的、模型是否超出授权、开发者是否提供了足够的技术限制、用户是否应该预见后果,都会影响责任归属。

因此,白宫协议目前最值得记录的并不是它解决了 AI 安全监管,而是美国主要 AI 公司第一次在共同文件中承认一个已经非常现实的治理对象:AI 系统正在从产生内容的软件变成能够操作其他软件的主体。监管、产品安全和操作系统权限设计,正在开始处理同一个问题。