今日快讯

01

美国政府组建“Super Intelligence Force”。当地时间 10 月 4 日,特朗普宣布成立新的联邦 AI 工作组,由国家情报总监 Jay Clayton 牵头,FTC 主席 Andrew Ferguson、负责研发的国防部副部长 Emil Michael 和美国人事管理局局长 Scott Kupor担任副主席。工作组将协调联邦政府面对先进 AI 的政策,并在 120 天内提交关于风险与机会的报告;其章程同时提出应对 AI 所带来的社会威胁,以及避免以监管抑制创新和竞争。这个机构出现在白宫本周召集主要 AI 公司并达成自愿性安全承诺之后,因此目前更值得关注的是它获得了什么实际协调权限,以及 120 天报告最终会不会转化为具体监管措施,而不能仅从名称判断美国 AI 政策已经发生方向性转变。AP · Washington Post · TechCrunch

02

Google 暂停开源软件漏洞奖励计划中的产品漏洞提交。Google 的 Open Source Software Vulnerability Rewards Program(OSS VRP)从 10 月 1 日起停止接收这类报告,并计划在 2027 年第一季度公布后续安排。Google 给出的原因是自动化提交显著增加,而且“绝大多数”无效。这个问题其实已经积累了一段时间:Google 今年 3 月就修改过 OSS VRP 规则,明确提到 AI 生成报告中存在虚构漏洞触发方式、把没有实际安全影响的代码错误当成漏洞等问题,并要求部分高等级项目提交 OSS-Fuzz 复现或已经合并的补丁。半年后从提高证据门槛走到暂停接收,说明生成式 AI 在安全研究中的一个现实瓶颈已经落到人工验证成本上:发现候选问题越来越便宜,但证明问题真实、可触发并有安全影响依然昂贵。Google Bug Hunters:3 月规则调整 · TechCrunch

03

AI 人才扩张中的性别差距开始有了更具体的数据。10 月 4 日《卫报》援引 LinkedIn 数据报道,过去一年 AI 岗位的新招聘中女性约占四分之一,而非 AI 岗位的新招聘中女性约占一半;AI 领域高管职位中女性比例进一步降至约 13%。报道同时指出,女性又更多集中在客服、数据标注等更容易受到自动化影响或薪酬较低的岗位。这组数据不能单独证明 AI 导致了性别差距,但它提醒人们观察“AI 对就业的影响”时,岗位总量远远不够:谁进入新形成的高薪技术岗位、谁集中在被自动化重塑的工作中,可能决定 AI 劳动力市场最终呈现出的分配效果。The Guardian

04

OpenAI 10 月 4 日发表了一篇关于“智能之后什么会变稀缺”的长文《The eternal complement》。文章属于 OpenAI 新设的 Intelligence Age 平台,但作者 Hemanth Asirvatham 和 Elliott Mokski 特别注明,观点代表作者本人,并不代表 OpenAI。文章把 AI 的经济影响放在一个经常被忽略的约束上:产生想法只是创新过程的一部分,实验、工程、组织协调、供应链和大量日常执行工作同样决定想法能否成为现实。作者认为,今天 AI 首先降低的是这部分执行成本;如果未来 AI 连产生高质量研究方向和设计方案也大幅自动化,新的瓶颈反而可能再次落到实验设备、能源、制造和物理建设等执行能力上。这个论点值得单独展开,见下文精讲。OpenAI

串读精讲

1 / 1

当“想出答案”越来越便宜,AI 的瓶颈可能转向把答案做出来

讨论更强 AI 时,一个很自然的假设是:如果模型可以更快写代码、设计实验、解决数学问题甚至提出新的研究方向,那么科技进步也会以接近同样的速度加快。OpenAI 10 月 4 日发布的《The eternal complement》讨论的正是这个假设中容易被略过的一环。两位作者没有尝试预测下一代模型能达到什么 benchmark,而是问了一个更基础的问题:知识生产究竟由多少“智能”之外的东西共同完成?

他们借用了经济学中的“互补品”概念。一个优秀的科学想法需要实验设备、技术人员、资金、组织、监管、供应链和制造能力才能转化成结果,因此前沿智力与执行能力实际上是互补投入。文章举了一个很直观的尺度变化:伽利略时代扩展人类观测能力需要的设备和组织相对简单,而詹姆斯·韦布空间望远镜耗资约 100 亿美元,由 14 个国家、约 300 个组织共同完成。现代科学问题本身越来越复杂,与此同时,把一个好问题真正变成实验和工程项目所需要的组织规模也在扩大。OpenAI

文章引用的研究生产率数据让这个问题更具体。斯坦福经济学家 Nicholas Bloom 等人的研究估计,为维持摩尔定律所需要的研究人员数量,相比 1970 年代早期已经增加超过 18 倍;从更大的经济尺度看,美国有效研究投入长期大幅增长,而单位研究投入产生的生产率增长却持续下降。OpenAI 的文章还引用美国国家科学基金会相关统计,指出技术人员队伍的增长速度快于科学家,以及现代科研对专门设备的依赖不断提高。作者由此提出一种解释:很多领域今天缺少的未必只是更聪明的研究者,还包括让研究者的想法得以执行的大量普通工作。OpenAI · Are Ideas Getting Harder to Find?

这使今天的生成式 AI 出现了一个很有意思的位置。代码生成、文献检索、数据处理、原型制作和文档工作,本来都是“有了想法以后”必须支付的执行成本。模型在这些任务上的进步意味着一个人可以调动过去需要小团队才能获得的能力。文章认为,在这一阶段,AI 更像一种扩大个人执行能力的基础设施:过去因为组织成本太高而无法尝试的电影、软件、研究问题或者小型产品,现在可能由更少的人完成。

如果这一趋势继续,稀缺资源会发生第一次转移。实现一个想法变便宜以后,“有什么值得实现”会变得更加重要。文章把这种能力概括为 taste,也就是从大量可能方向中识别哪些问题和作品值得投入资源。这个判断并不要求假定 AI 永远缺乏品味;它只是描述了当前阶段的一种相对价格变化:生成和执行候选方案的成本下降得比选择正确方向更快。OpenAI

更有意思的是第二阶段。假如未来模型不仅执行人的研究计划,也能提出大量高质量研究问题,今天的关系可能再次倒转。原来一个实验室有十个值得尝试的假设、资源只够验证两个;未来 AI 可能产生一万个同样值得验证的假设。即使分析和软件部分高度自动化,粒子加速器仍然只有一台,生物实验仍需要真实材料和时间,芯片仍需要晶圆厂生产,电网、机器人、矿山和建筑也不能以 token 的速度扩张。认知供给越丰富,物理世界反而越容易成为约束。

这也是这篇文章最值得保留的地方:它给“AI 加速科学”增加了一个比模型能力更完整的生产函数。模型解决问题的速度、实验吞吐量、机器人和自动化设备、能源、资本以及组织制度可能同时决定最终速度。只观察模型在数学、代码或科学 benchmark 上提高多少,很难直接推导现实科研生产率会提高多少。

这个框架也能解释为什么 agent 的发展越来越强调工具和环境。语言模型能够提出正确操作,并不意味着任务已经完成;数据库必须真的被修改,代码必须能够运行,采购和付款必须发生,实验设备必须执行指令,失败以后还需要恢复。最近的 agent 研究越来越把这些外部状态纳入评价,本质上是在测量“认知结果能否穿过执行链条”。例如 10 月 1 日发布的 Argo-Bench 构造了一个拥有 235 张表、约 75 亿行数据的企业数据仓库,让 agent 不只回答分析问题,还要做出封禁欺诈账户、分配骑手激励预算、补发薪资等操作;评分依据这些行动在模拟业务世界中造成的后果。14 个被测模型中,表现最强的模型也只有 34.8% 的任务达到 95 分以上。Argo-Bench 论文 · 项目页

把两件事放在一起看,可以得到一个相当具体的观察:随着模型推理能力继续提高,AI 系统的进步越来越可能取决于模型之外的执行系统——工具、权限、数据库、记忆、工作流、验证机制,以及最终与物理世界连接的设备。模型能够想到正确答案只是整个链条中的一个节点。

OpenAI 文章最终把这个问题推到了更长的时间尺度:即使未来机器同时拥有极强的创造能力和组织协调能力,物质世界仍然存在速度限制。工厂需要建设,能源需要生产,航天器必须飞过真实距离。作者甚至用光速作为这个思想实验的极端边界。这里已经明显属于关于长期未来的推演,而不是能够验证的近期预测;文章本身也没有给出 AI 何时会跨过这些阶段的时间表。OpenAI

因此,这篇文章对当下最有用的部分反而比较朴素:评价 AI 带来的生产率变化时,可以开始分别观察“产生方案”“选择方案”和“执行方案”的成本。过去几年最显眼的变化发生在前两者以及数字世界中的执行环节,而真正需要组织、设备、能源和物理操作的工作下降得慢得多。未来模型再提高一个数量级之后,这种差异可能比单纯比较两个模型谁更聪明,更能解释 AI 最终把现实世界推进了多快。