今日快讯

01

FTC 正式调查 OpenAI、Anthropic 等机构的 AI agent 安全问题。 9 月 30 日,美国联邦贸易委员会已开始向包括 OpenAI、Anthropic 以及独立研究机构 METR 在内的组织索取信息,并计划要求相关高管作证。Reuters 报道称,调查重点之一是 agent 技术可能造成的消费者伤害,以及今年 OpenAI agent 在评测过程中访问 Hugging Face 真实系统等事件。现阶段这是调查程序,并不意味着 FTC 已认定相关公司违法。Reuters

02

DeepSeek 与华为把合作推进到 Ascend 的编程栈。 9 月 30 日,DeepSeek 宣布与 Huawei 合作开发针对 Ascend 芯片优化的计算与通信基础设施,并将相关组件开源;双方还围绕 128 颗 Ascend 950 组成的“超节点”优化计算和通信。DeepSeek 特别提到开源高层编程语言 TileLang,希望降低 AI kernel 编写难度,同时保留接近硬件性能上限的优化空间。这里真正值得观察的是软件栈:国产 AI 芯片与 Nvidia 的差距长期不只来自芯片本身,也来自 CUDA 周围成熟的编译器、kernel、通信库和开发工具生态。Reuters

03

CoreWeave 开始把 agent 的 CPU 侧负载当作独立基础设施问题。 9 月 30 日,CoreWeave 宣布将提供 NVIDIA Vera CPU,并已让 Cognition 在 Vera Rubin NVL72 上运行生产负载。单个 Vera rack 配置 128 颗 CPU、11,264 个核心,面向大量并行 sandbox、强化学习环境、代码执行和工具调用;CoreWeave 自报测试中,Vera 的 agent sandbox 启动速度较 x86 CPU 提升超过 3 倍,Terminal-Bench 已通过任务的执行性能提升 1.7 倍。这些数字目前来自厂商测试,尚不能视作跨平台独立 benchmark。NVIDIA CoreWeave

04

CoreWeave 同日发布 Forge,试图把生产轨迹重新接回训练循环。 Forge 将 Weights & Biases、OpenPipe 的后训练能力、开源 marimo notebook 以及 CoreWeave 自身训练、推理和 sandbox 服务组合到同一开发层,目标是让“运行—观察—整理数据—改进—评测”形成连续循环。它保持模型、框架和云平台开放,Canva 与 MasterClass 已在使用。这里比“又一个 agent 平台”更具体的变化,是基础设施厂商开始把 production trace、eval 和下一轮 post-training 视作同一数据闭环。CoreWeave

05

Microsoft Research 用机器学习把空间天气预警细化到 66,935 个美国变电站。 9 月 30 日公布的系统从 L1 拉格朗日点太阳风观测出发,预测 AE、Dst 等地磁指标,再结合纬度、当地地质电导率和电网数据估计地磁感应电流风险,可提前约 30—60 分钟生成位置级风险。2020—2026 年评测中,对 major、severe、extreme 三档事件的检测率分别为 76.5%、81.2% 和 64.1%。研究团队明确表示,目前仍需要公用事业公司的真实运营数据进一步验证,尚不是已部署的电网控制系统。Microsoft Research

串读精讲

1 / 3

Gemini 4 Argon:Google 把“长任务”从长上下文推进到了长输出和持续执行

9 月 30 日,Google 正式公布 Gemini 4 Argon。它目前还不是一次面向所有人的常规模型上线:首批访问对象是 Fairwind Program 中经过筛选的网络安全防御人员,Google 表示随后才会逐步开放给开发者、企业和消费者,计划首先覆盖付费 API 用户与 Google AI Ultra 用户。初始 API 定价为每百万输入 token 2 美元、输出 token 10 美元,缓存输入按输入价格的 5% 计费;优惠期结束后则分别变为 4 美元和 20 美元。Google

Argon 最显眼的规格并不是输入上下文,而是 单次输出上限提高到 100 万 token,此前为 64K。这个变化值得单独理解。过去所谓“长上下文”主要解决模型能读多少材料;但 coding agent、研究 agent 和长时间运行的企业工作流面临另一个限制:模型可能读得下整个代码库,却无法在一个持续轨迹里进行足够多轮推理、调用工具、检查结果和继续修正。把输出预算扩大一个数量级以上,实际是在给单次 trajectory 更大的计算和行动空间。Google 对 Argon 的产品描述也明显围绕 long-horizon workflow,而不是传统问答。

Google 给出的内部案例比单纯 benchmark 更能说明这种设计想解决什么问题。一组 Argon agents 分析 Google 数据中心的 profiling telemetry,寻找并应用内存优化;Google 称已实际释放超过 300 TiB 内存,并估计最终可达到 500 TiB—1 PiB。另一个项目是大规模 C/C++ 到 Rust 的迁移:任务规模从数万行代码一直延伸到 Fuchsia Zircon kernel 的 80 万行以上。针对视频解码库 libgav1,Argon agents 对原有 Rust port 中约 3.2 万行 SIMD 代码反复进行 profile-guided experiments,最终生成可以由编译器自动向量化的 safe Rust;Google 自报最终版本相较原 Rust port 快 2.7 倍,同时保持相同视频输出。需要注意,这些都是 Google 自己的内部工程结果,并非外部独立测试。

公开评测则提供了另一组观察窗口。Google 报告 Argon 在 DeepSWE v1.1 上达到 77.9%,在 Zapier 的 AutomationBench 上达到 51.3%,LVBench 长视频理解为 91.7%;它还声称模型在 Vals Index、Vals Finance Agent v2 和 Harvey Legal Agent Benchmark 等专业知识工作评测中处于领先位置。这些 benchmark 的任务定义和 harness 不同,因此数字不能简单横向拼成一个“综合能力分”,更适合看 Google 把模型能力押在哪些工作负载:真实软件工程、多步骤业务执行、专业研究以及长视频和文档处理。Google

网络安全则是 Argon 首发策略最特殊的一部分。Google 称模型可以自主发现、验证并修复漏洞;在 CWE-bench v1 上报告 68% 的修复成绩,并表示 Wiz 已经通过 Scan for Good 使用 Argon 寻找公共基础设施中的安全问题。对于经过筛选的防御团队,Google 准备提供不带通常 cyber guardrail 的版本,让他们使用完整网络安全能力;面向更广泛用户的版本则继续保留针对网络攻击和 CBRN 滥用的限制。

这也解释了为什么 Argon 没有直接全面发布。Google 描述了几层额外控制,包括针对 indirect prompt injection 的对抗训练、监控模型内部推理与行动并在越界时终止执行,以及在高风险训练和评测前进一步隔离 sandbox。这里出现了一个越来越实际的工程关系:模型拥有更长的行动轨迹之后,能力提升与 control problem 会同时被放大。100 万 token 的输出预算如果只是写文章意义有限;如果这些 token 对应数百次代码修改、shell 操作、浏览器行为和工具调用,运行时监控、sandbox 和权限控制就会成为模型能力的一部分。Google

2 / 3

SynthID Bio:水印第一次从 AI 内容进入了真正合成出来的蛋白质

Google DeepMind 9 月 30 日发布的 SynthID Bio 很容易被“AI 水印”这个熟悉标签低估。此前 SynthID 主要处理图像、音频、视频和文本等数字内容,而 SynthID Bio 想解决的问题更特殊:如果生成模型设计了一条新的蛋白质序列,水印能否跟着这条序列进入 DNA 合成、蛋白表达和实验环节,最后在真正存在于实验室里的分子上仍然可检测?Google DeepMind

蛋白质序列允许这样做,是因为同一种功能往往不只对应唯一一条氨基酸序列。SynthID Bio 在模型生成序列时,对氨基酸选择施加很小的、有结构的偏置,把可统计检测的模式编码进去。对于三维蛋白结构,它采取另一条路线:微调 AlphaFold 3 diffusion network 的一小部分,使模型输出的原子坐标天然携带水印信号。也就是说,水印并不是生成结束后附加的一段 metadata;它被写进了生成过程本身。

真正困难的条件是:这种扰动不能把蛋白质弄坏。DeepMind 用 AlphaProteo 与启用 SynthID Bio 的 ProteinMPNN 设计 protein binders,并针对 VEGF-A、SARS-CoV-2 spike RBD 和 PD-L1 三个靶点进行了湿实验。团队报告,带水印设计与无水印设计在命中率、结合亲和力以及天然序列多样性上相当,并实际得到能够发挥生物功能的水印蛋白质。对于 AlphaFold 3 结构水印,团队则称预测精度基本保持,同时检测率接近 100%,而且经过数字噪声或轻微坐标修改后仍能检测。Google DeepMind

它的用途也和普通图片水印不同。生成式蛋白设计正在使“一个序列究竟来自自然界、人工设计还是某个生成系统”变得越来越难判断。与此同时,DNA synthesis screening 通常依赖已知危险序列和相似性匹配;真正新颖的 AI 设计可能天然位于已有数据库之外。SynthID Bio 提供的是 provenance 层:如果设计工具主动采用这套机制,之后可以验证某个蛋白序列或预测结构是否来自相应生成流程。

边界也很明确。它并不能给所有 AI 生成蛋白自动打上标签,更不能识别没有采用 SynthID Bio 的其他生成系统;攻击者如果从一开始就不用带水印的模型,水印本身不会提供保护。因此它更接近一项可以嵌入可信设计工具链的基础设施,而不是通用的生物安全检测器。DeepMind 此次最有价值的证据,是已经跨过了“数字模拟里能检测”的阶段,在三个靶点上实际合成并测试了带水印、仍有功能的蛋白质。Google DeepMind

3 / 3

Anthropic 的机器人工作暴露指数:能做 34% 的工作时间,与经济上值得做只有 0.3%,可以同时成立

Anthropic 9 月 30 日发布了一项关于机器人与就业的研究,试图把一个经常被混在一起的问题拆开:机器人在技术上“能做”一项工作,与企业今天“值得用机器人来做”并不是同一个变量。研究使用 O*NET 中约 900 个职业、约 1.9 万项工作任务,让 Claude 按身体、认知和人际要求识别物理任务,再结合现有机器人能力、工作环境以及成本估算,构建 robot exposure index。Anthropic

按照这套定义,今天已经存在的机器人能够以某种方式完成美国约 74% 的物理任务;这些任务折算后占全部工作时间约 34%。机器人和 LLM 的能力覆盖合并计算时,大约 80% 的工作时间至少暴露于其中一种技术。这个数字听起来非常接近“大规模自动化”,但它包含大量只能在高度结构化环境中工作的机器,也没有首先考虑部署价格。

研究进一步询问为什么这些技术能力没有直接变成现实中的自动化。Claude 对任务逐项估计后,Anthropic 得到的最大限制来自机器人能力本身和成本:约 70% 的物理任务仍存在能力障碍,其中最突出的不是语言推理,而是 manipulation——触碰、抓取、摆放和处理现实物体。约一半物理任务如果没有更好的操作能力就无法大规模自动化;相比之下,主要受 planning 和 reasoning 限制的只有约 8%。法规被估计会限制约 14% 的物理任务,人类偏好则影响约四分之一。

成本把数字进一步压缩。Anthropic 为每项暴露任务估算机器人购买、安装、维护、监督、能源等完整成本,再按照设备寿命和资本成本年化,与完成同等工作量的人类总薪酬比较。按这一口径,技术上机器人可以完成的任务占全部工作时间 34%,但今天真正达到成本竞争力的只有约 0.3%。

一个具体例子是仓库包装工。研究估算完成相关任务所需的一组机器人购买和安装成本超过 200 万美元,但可以替代大约 14 名员工的年工作量;考虑约十年设备寿命、8% 资本成本以及维护、能源和监督后,每替代一名员工的年成本约 4.5 万美元,而该职业总薪酬约 4.9 万美元,因此已经接近经济可行。美国约有 56 万名 packers and packagers,过去十年该职业就业人数已经下降约 22%。这些成本数字大量依赖 Claude 对具体机器人和部署环境的估算,研究本身也把它们视为近似值。

把成本曲线往未来推,结论与常见的机器人叙事差别更明显。历史数据表明机器人价格大约每年下降 3%;如果这一速度持续,要让机器人在今天 10% 的人类工作上达到成本优势,需要总体成本下降约 70%,大约要四十年。Anthropic 的基准情景甚至要到 2085 年,机器人才能在一半物理工作上达到成本竞争力。研究也构造了更激进的情景:如果质量调整后的成本下降速度达到历史水平的四倍,同时新能力获得速度提高一倍,那么一半物理工作可能在 2050 年左右达到成本竞争力。

这项工作的价值因此不主要在预测一个自动化年份。它给出了一个更有用的分解框架:技术覆盖、操作能力、环境结构、法规与偏好、资本成本、单位工作成本分别决定机器人最终能否替代一项工作。LLM 让 planning 和 reasoning 快速变便宜,并不意味着物理自动化会以相同速度推进;如果最后卡住的是机械手无法可靠解开电线、清洁非标准环境,或者一套设备的资本成本仍远高于人工,那么“机器人已经会做”与“机器人会被部署”之间仍然可能隔着几十年。Anthropic