今日快讯
OpenAI 开始把不可见水印扩展到文字。10 月 5 日,OpenAI 宣布为满足欧盟《AI 法案》的内容来源透明度要求,未来数周将在欧盟为符合条件的 ChatGPT 和 Codex 文本加入不可见统计水印;API 客户则从当天起可在部分模型上自行开启,默认关闭。水印通过调整模型选词留下机器可检测的统计信号,不能证明作者身份、人工参与比例或文本真假,短文本和后续改写也会降低检测可靠性。因此它更接近“来源信号”,并不是通用 AI 文本鉴定器。
OpenAI ·
OpenAI Developer Community · TechCrunch
Anthropic 的 Claude 在印度获得境内推理路径。10 月 5 日,Anthropic 宣布 Claude Opus 5、Sonnet 5 和 Haiku 4.5 可通过 Amazon Bedrock 的印度端点处理请求,使受监管企业能够把推理留在印度境内。AWS 实际已于 9 月 29 日开放这项基础设施:印度使用 Mumbai 与 Hyderabad 两个区域之间的 geographic cross-Region inference,因此“境内”并不意味着固定在单一数据中心,也不意味着所有 Claude.ai 或其他 API 请求自动本地化。这个区别对金融、医疗和公共部门的数据驻留审查很重要。
AWS ·
Business Standard
英国准备把 AI 医疗器械监管从一次审批延伸到整个生命周期。10 月 6 日凌晨 Reuters 报道,英国政府将接受一份独立报告提出的全部 44 项建议,并在 2027 年春前公布完整实施计划;MHRA 同时将启动 AI Airlock 第三阶段,重点测试上市后监测和生命周期管理。监管部门给出的理由很具体:部分 AI 医疗器械包含会随使用继续变化的非确定性算法,仅在上市前验证一次,难以覆盖实际部署后的性能漂移和环境变化。
Reuters
AI 算力开始出现迄今规模最大的芯片融资结构之一。10 月 5 日,《金融时报》报道,美国银行、花旗和摩根士丹利正在组织一笔约 600 亿美元债务融资,用于支持 Anthropic 租用 Google 与 Broadcom 体系的 AI 芯片,其中约 420 亿美元为 Broadcom 提供支持的高级担保贷款,另有约 180 亿美元次级债务。这仍是一项正在组织中的融资,并非已经完成的资本支出;它值得注意之处在于,大规模模型算力越来越通过设备租赁、债务和担保结构进入资本市场,而不再只表现为云厂商自己的资产负债表支出。
Financial Times
德国工业机器人公司 RobCo 在新一轮股份交易后估值达到 10 亿美元。公司今年 1 月融资 1 亿美元,本轮约 4000 万美元交易同时允许员工出售部分股份;CEO Roman Hoelzl 已迁往美国拓展其增长最快的市场。RobCo 当前产品主要面向制造业,正在准备 2027 年 3 月推出双臂、自学习工业机器人 Alfie,已有客户部署原型。与大量通用 humanoid 项目相比,它的路线更接近从已有工厂自动化客户逐步增加感知和自主适应能力。
Reuters
串读精讲
1 / 1
Reflection Beam:501B 参数之外,更值得看的是一次 10,500 张 GB300、上亿条 rollout 的强化学习训练
10 月 5 日,美国初创公司 Reflection AI 公布首个自研模型 Beam。它是一个稀疏 MoE,拥有 501B 总参数、每个 token 激活约 23B,预训练使用 23.8T token,定位集中在代码、推理和 agent 工作。Reflection 已开放少量 early access,但截至本期检索截止,模型权重、完整技术报告和 model card 尚未发布;公司称这些材料将在 10 月内以 Apache 2.0 许可陆续开放。因此今天能够分析的是 Reflection 公布的训练方法和自报评测,还不能把 Beam 当作已经可由外部完整复现的开放模型。
Reflection AI ·
Reuters
Beam 的模型尺寸本身并不特别反常。它与当前许多大型开放模型一样使用 MoE,让总容量远大于一次推理实际参与计算的参数量。Reflection 真正押注的方向,是把强化学习继续当作一条可以大规模扩展的计算轴:预训练建立一个足够稳定的 base model,然后通过大量真实可执行环境和长轨迹,让模型持续学习代码、终端、工具调用和多步推理。
这一次 RL 的规模非常大。Reflection 称,四周训练期间使用约 10,500 张 NVIDIA GB300,生成超过 1 亿条 rollout,最大训练上下文为 256K;整个过程中约使用 13 亿个 sandbox 实例。训练任务来自近 100 万个环境,覆盖软件工程、终端操作、竞赛编程、STEM、搜索、工具调用和一般知识工作。公司表示,单是 reasoning expert 的训练就包含约 8000 万条 rollout。
Reflection AI
这里的 rollout 可以理解为模型在一个任务环境中真正走完的一次尝试。对一道数学题,它可能只是生成推理和答案;对软件工程任务,它可能包含阅读代码、修改文件、运行测试、看到错误、再次修改等一连串动作。RL 训练需要判断最后有没有完成任务,再把结果转化成训练信号。
当 rollout 从几十万扩大到上亿,工程问题会发生变化。一个 agent 可能运行很久,而训练器在它运行期间已经更新了许多次模型。等这条轨迹完成时,它实际上来自一个“旧版本”策略。如果训练系统只允许最新模型产生的数据进入下一步训练,大量 GPU 就必须互相等待;如果旧数据直接拿来训练,又可能因为当前模型与生成数据时的模型差异过大而破坏学习稳定性。
Reflection 选择了完全异步的做法。agent 持续生成轨迹,训练器同时持续更新模型,每个 token 都记录由哪个模型版本产生;算法再显式处理这种 policy staleness。公司称,即使某些训练样本来自一天以前、落后当前模型 107 个权重版本,训练仍能保持数值稳定。
Reflection AI
支撑这套机制的基础设施规模也很少在开放模型发布中披露得如此具体。训练期间平均同时运行约 11 万条 rollout,峰值支持 17 万个并发 sandbox;整个系统累计处理超过 10 亿次 sandbox 创建请求,横跨两个云、四个区域和 20 多个集群。新权重从训练器分发到推理集群的中位时间约 12 秒。Reflection 称,通过先跨机架分发、再利用 NVLink 在本地复制权重,相比每个 replica 分别拉取权重减少了 75% 的跨机架流量。
这组数字解释了为什么“扩大 agent RL”与过去单纯增加训练 token 不完全是一回事。预训练的数据已经存在于存储系统里,主要问题是把 token 高效送入 GPU;agent RL 的数据需要实时制造。每条轨迹背后可能还要启动 Linux 环境、安装依赖、执行程序、访问网页、等待测试并计算 reward。训练集群因此同时变成了一个超大规模的软件执行平台。
Reflection 对训练环境质量的描述也值得留意。团队先从真实或合成任务建立候选池,再过滤过于简单、几乎不可能完成、条件不充分、可以猜答案或能够 exploit verifier 的任务;然后实际运行 RL,根据训练结果继续找出奖励漏洞和难度问题,再重新整理环境。公司称,环境质量下降时模型能力很快出现 plateau,而改善任务质量后训练收益又继续增长。
Reflection AI
这与近两年可验证强化学习的经验相符:算力只有在 reward 真正对应目标能力时才有价值。如果模型发现“通过测试”比“解决问题”更容易的捷径,大规模 RL 只会更高效地强化捷径。Beam 的系统因此还保存逐 token 记录,用独立 judge 重新检查已经通过的解答是否利用 verifier 漏洞,并让训练轨迹能够 replay。Reflection 没有公开足够材料让外界判断这套检查最终过滤掉多少 reward hacking,目前能确认的是它把 reward integrity 当成了训练基础设施的一部分。
Beam 还有一个与推理成本直接相关的训练设计。Reflection 给成功解答增加可控的长度惩罚,希望模型不要为了得到更高分无限延长 reasoning。其训练曲线呈现两个阶段:早期模型能力上升的同时输出反而缩短,说明它学会用更少 token 完成已有任务;随后随着更复杂的 agent 能力出现,高 reasoning effort 下的输出重新变长,并带来进一步性能提升。产品侧因此提供 reasoning effort 参数,让用户在推理长度与能力之间选择。
公司由此声称 Beam 在若干高级推理任务上达到与 GLM-5.2 相近的水平,但所需 inference compute 低约 3—4 倍。这个数字需要非常谨慎地理解。Reflection 的计算方法大致使用 2 × 激活参数量 × 平均生成 token 数 估算 FLOPs;它没有计入 prompt prefill、随上下文变化的 attention 开销和真实 serving overhead,因此描述的是近似生成计算量,并不是数据中心实际测得的单请求成本。
Reflection AI
模型成绩本身也呈现出相当清楚的边界。在 Reflection 公布的结果中,Beam 在 SWE-Bench Verified 得到 80.9,Terminal-Bench 2.1 为 80.1;后者略低于 GLM-5.2 的 81.0,也明显低于公司列出的 GLM-5.3、Kimi K3、Qwen3.8-Max 和 DeepSeek V4.1 Flash。工具调用方面,Beam 在 MCP Atlas 得到 78.7,在 τ3 banking 得到 38.0;Qwen3.8-Max 在相应表格中的成绩分别为 84.5 和 55.2。Reflection 自己也把 Beam 描述为接近而非全面超过当前最强中国开放模型。
Reflection AI
这些都是厂商自报结果,而且 Beam 的权重和完整评测材料尚未开放,今天无法进行独立验证。Reuters 对发布的报道同样把与 GLM-5.2、Qwen3.8-Max 的比较归属于 Reflection 自己的说法。
Reuters
Beam 更有认识价值的部分因此暂时不在排行榜位置,而在训练路线。过去一年,开放模型越来越证明高质量预训练可以复制;Beam 展示的是下一层门槛:如果目标是 coding 和 agent,后训练本身可能逐渐变成由数十万并发环境、实时 sandbox、异步模型更新、reward 验证和巨量推理算力共同组成的分布式系统工程。
这也使“开放权重”的含义发生一点变化。Reflection 本月可以把 501B 权重、推理代码和 fine-tuning stack 开出来,但复制这次训练仍需要 10,500 张 GB300、上亿条 rollout 和近百万个经过筛选的环境。权重可以开放,制造这些权重所依赖的后训练工厂仍然非常昂贵。Beam 最终的外部价值,要等权重真正发布后,看社区能否在不同硬件和 harness 上复现其能力与效率;但从今天公开的材料看,它已经提供了一个相当具体的样本,说明前沿 agent 模型的训练成本正在从“训练一个大模型”扩展成“长期运行一个巨大的交互式计算系统”。