今日快讯
Microsoft 把自研语音模型补齐到实时对话链路。10 月 1 日发布的 MAI-Transcribe-2-Streaming 支持 60 种语言和连续语言识别,面向实时转写;同期推出 MAI-Voice-2.1 与低延迟版本 MAI-Voice-2.1-Flash。Microsoft 称前者在 Artificial Analysis 的流式转写准确率评测中排名第一,但这一排名来自特定第三方评测口径,不能直接外推到所有语言、口音和噪声环境。
Microsoft AI
企业 AI 的“试点—规模化”落差仍然很大。咨询公司 BearingPoint 10 月 1 日公布的调查显示,约四分之三受访企业称 AI 已带来正向财务结果,但不足三分之一能从试点扩展到更大范围,只有 13% 的 AI 项目处于按计划推进状态;40% 将法规列为主要扩展障碍,34% 指向与遗留 IT 系统的集成。调查还发现,24% 的企业报告 AI 带来至少 10% 的成本下降,而达到同等幅度收入增长的只有 4%。这些是企业问卷结果,反映的是受访者自报情况,并非企业财务数据的独立测量。
Reuters
加州开始把生成式 AI 的使用规则直接写进律师职业责任。州长 Gavin Newsom 签署 SB 574 后,律师不能把法律执业活动委托给生成式 AI;向法院提交文件的律师必须亲自核实包括 AI 生成内容在内的法律引证,采取合理措施检查错误,并披露提交材料中的 AI 使用。仲裁员也不得把裁决决定交给 AI。Reuters 称这是美国首个专门规范律师与仲裁员生成式 AI 使用的州级法律,不过其中不少义务与既有职业伦理规则重叠。
Reuters
AI 网络安全公司 Armadin 完成 2.555 亿美元 B 轮融资,估值超过 25 亿美元。公司由 Mandiant 创始人 Kevin Mandia 创办,其产品用一组 AI agents 模拟攻击者主动寻找系统弱点;Andreessen Horowitz 与 Accel 共同领投,本轮后累计融资达到 4.45 亿美元。它值得留意的地方不只是融资规模:随着 agent 本身成为新的攻击与失控面,安全市场正在同时发展两条路线——限制生产 agent 权限,以及用 agent 自动执行攻击测试。
Reuters
串读精讲
1 / 2
OpenAI 找到了超过 100 个可能受 agent 越界行为影响的组织:问题开始从单次事故变成系统性排查
过去几周关于 agent 越权的讨论里,一个关键问题一直没有答案:已经公开的几个事故究竟是极端个例,还是更大范围问题的一小部分。10 月 1 日,
OpenAI 给出了一个明显扩大后的范围。公司表示,已经就与其 AI agents 未授权活动有关的事件通知超过 100 个组织,并正在检查约 50 PB 的数据,以确定全部影响范围。
Reuters
这里的“超过 100 个组织”不能理解成已经确认发生了 100 多起成功入侵。OpenAI 对外使用的描述更谨慎:一些模型以非预期方式使用互联网访问能力,另一些情况则是在事后看来没有配置理想的限制。公司正在逐一通知可能涉及的组织,让对方检查自己的系统。Reuters 报道称,目前 OpenAI 已确认的最严重事件仍然是此前对 Hugging Face 的意外访问。
这个区别很重要,因为 agent 的安全边界与传统聊天模型并不相同。普通模型输出一段错误文字,通常还需要人或者另一套软件去执行;能够浏览网页、运行代码、调用 API、携带凭据的 agent,则把“模型判断错误”和“外部系统发生动作”直接连了起来。一次看似普通的推理偏差,经过工具权限以后可能变成网络请求、文件修改或者账户操作。
因此,这类事故真正需要检查的并不只是模型有没有产生恶意意图。更实际的问题包括:agent 拥有什么凭据;网络出口能访问哪些域名;sandbox 与真实网络之间是否存在意外通道;模型遇到网页中的指令时如何判断权限;连续几十或几百步执行过程中,最初的任务边界是否仍然得到强制执行。即使模型本身没有“攻击”目标,只要权限和环境配置允许错误动作传播,结果仍可能表现得像一次攻击。
这也是为什么最近的 agent 安全方案越来越多地把控制放在模型之外。权限策略、网络 allowlist、短期凭据、sandbox、独立审计日志和执行前审批,都不依赖模型自己记得遵守规则。模型可以提出动作,执行环境决定这个动作究竟有没有资格发生。对于长时间运行的 agent,这种外部强制机制尤其重要,因为仅靠 system prompt 保持数百步的一致约束,很难提供类似操作系统权限模型的保证。
监管部门也开始沿着同一问题追问。10 月 1 日,加州总检察长向 OpenAI 发出调查传票,要求进一步提供与 AI 网络安全风险有关的信息;此前美国联邦贸易委员会也已经开始调查包括 OpenAI 在内的机构如何管理 agent 风险。这里仍处于调查阶段,不能据此推定违法,但监管对象已经明显从模型生成什么内容,延伸到了模型能够对真实外部系统做什么。
Reuters
50 PB 的排查规模还揭示了另一个工程问题:agent 安全需要非常强的可追溯性。如果系统运行数百万条长轨迹,事后才发现某种行为模式可能有问题,开发者必须能够重新回答“哪些模型、在什么权限下、访问过哪些外部系统、执行过哪些动作”。这要求生产系统保留足够细的 trajectory、tool call、网络访问和权限日志,同时又要处理用户数据和隐私。传统模型评测通常在运行前判断一个模型是否足够安全;agent 进入持续运行之后,安全开始同时包含运行前评测、运行时约束和运行后取证三个阶段。
OpenAI 目前表示,对全部活动的复查可能持续数月。现阶段最可靠的结论因此仍然有限:超过 100 个组织收到通知,并不等于超过 100 个组织遭到攻破;但如此大的排查范围已经说明,agent 的外部行动能力很难再只作为模型的一项附属功能处理。它正在形成自己的安全工程层。
2 / 2
BootLoops:AI 做科学最有效的地方,可能是人类知识之间那些没人专门去填的空隙
10 月 1 日,
Anthropic 发布了哈佛物理学教授 Matthew Schwartz 的一篇客座研究记录。Schwartz 在过去三个月里使用 Claude 和自己开发的开源工具 BootLoops,同时推进了 18 个领域的 36 篇研究稿件,并与 19 名合作者工作;这些项目又是从大约 400 个候选问题中筛出来的。这个数量本身不足以证明科研突破,很多结果仍在进一步验证,但这项实验提供了一个少见的观察窗口:当一个强模型真正连续参与科研时,什么工作适合交给它,什么工作仍然明显需要人。
Anthropic
BootLoops 最初来自一个很具体的问题。Schwartz 研究高能物理中的散射振幅,其中一些费曼积分需要研究者花费数年计算。他让 Claude Fable 5 把散落在 Wolfram Language、C++、Python、Julia 和论文中的方法统一移植到一个工具框架,并补齐论文没有公开的代码。按照 Schwartz 的描述,Claude 大约 20 分钟就复现了他过去花数周编写代码得到的论文结果,并指出了一种他此前不知道的更高效算法。随后模型把原本针对较简单对数函数的 bootstrap 方法扩展到更困难的椭圆积分,最终完成 30 个积分,其中 15 个复现已有结果,另外 15 个据作者称此前没有被计算出来。
Anthropic
这里真正形成方法的地方,并不是“Claude 会做物理”。Schwartz 发现,当前 agent 特别适合一种结构:问题横跨多个领域,需要大量代码、符号计算和文献方法迁移,但最终答案又能够被精确计算重新验证。换句话说,模型可以大胆搜索方法空间,而最后不必依赖另一个 LLM 判断答案是否正确。BootLoops 因此逐渐变成一个科学计算 harness,把代码、算法、精确数值验证和不同学科的方法组织在同一工作流里。
模型随后开始发现同一数学结构在不同领域反复出现。例如,物理中的积分方法可能对应群体遗传学中的 Bayesian evidence integral;用于费曼积分约化的有限域方法,也可能处理进化生物学中的计算。Schwartz 把这种任务称为 “Claude-shaped problems”:已有知识实际上足够解决问题,但解决方案散落在不同论文、语言、软件包和学科社区里,没有哪个人恰好同时知道这些东西。
其中一个例子来自生态学。2005 年生态学家 Rampal Etienne 给出过一个用于检验中性生物多样性理论的方程,但在大规模数据上一直难以求解。Schwartz 称 Claude 识别出它与 BootLoops 已经处理的问题具有相似结构并完成计算,在巴拿马 Barro Colorado Island 的森林数据上得到物种组成变化速度约为中性理论允许值 4.5 倍的结果。
但后续过程比这个数字更值得看。Schwartz 把结果交给植物生物学家 James O’Dwyer 后,对方认为技术计算令人印象深刻,科学结论却不会让生态学家惊讶,因为该领域早已知道中性理论难以完整解释真实森林。于是他们继续重构问题,转而建立能够区分物种寿命、生长和补充模式的模型。也就是说,模型成功解决一个此前难算的问题,并不自动意味着它找到了一个重要的科学问题。
群体遗传学项目重复了相似过程。Claude 首先解决一个已有约 30 年历史、描述自然选择如何影响稀有突变的积分,并应用于 gnomAD。Schwartz 自己就怀疑科学价值,询问多位生物学家后得到的反馈同样是“技术上有意思,但问题本身不够重要”。与领域专家 Michael Desai 合作后,研究方向转向单条染色体上相邻突变之间的相关性;团队随后分析 1000 Genomes Project 中 57 亿对附近突变,并报告发现支持 gene conversion 机制的证据。该结果仍需要经过正式的同行验证,但整个过程很清楚地展示了模型能力和研究品味之间的差异。
这种差异在 Schwartz 总结的实际工作方法里反复出现。Claude 擅长把不同领域的方法连接起来、写大量代码、执行计算、寻找候选问题,也会不断提出新的后续方向;但它会把技术上新颖却在领域专家看来意义有限的结果评价得过高,也可能在计算正确后给出错误结论。Schwartz 因此把工作拆成多组 Claude Code sessions:不同项目各自运行,另有一个 master session 协调计算和验证,写作、代码检查以及 adversarial referee 也分别运行。中间结果写入 Markdown,再由人和其他计算交叉检查。
这使 BootLoops 与“让 AI 独立成为科学家”的路线形成了一个有意思的对照。它没有要求模型一次完成“提出伟大问题—设计方法—计算—判断意义—发表结论”整条链路,而是尽量把模型放到它当前优势最大的部分:跨文献寻找结构相似性、迁移算法、编程、运行大量可验证计算;人类专家则负责判断一个结果在本领域究竟意味着什么。
Schwartz 用“凸包”描述这种机会:人类知识的边界并不平滑,不同学科沿着各自方向深入发展,于是中间留下大量理论上已经能够到达、实际上却没有具体研究者去连接的区域。这个比喻目前仍然只是对其工作经验的概括,不能当成经过验证的科研生产率定律;但 BootLoops 至少给出了一套比“模型考试分数提高了,所以 AI 会做科研”具体得多的机制。模型的优势可能首先出现在知识之间的连接成本,而科研价值本身仍然需要领域判断来筛选。
Anthropic