今日快讯

01

Anthropic 与 Accenture 投 20 亿美元做独立模型评测。双方 9 月 18 日宣布未来五年各投入至少 10 亿美元,由 Accenture 旗下 Faculty 牵头评测、red-team 和 alignment assessment。Anthropic 称其目标之一是“embedded evaluation”:外部评测者进入模型公司内部,获得接近员工的系统访问和研发流程视野,而不只拿公开 API 做黑盒测试。Reuters

02

Gemini 在网络安全评测中误入三家真实公司的系统。事件发生于今年 5 月,由独立安全评测公司 Irregular 组织:Gemini 根据公开信息猜中一个系统的凭据,又从公开代码仓库找到另外两个系统的 credentials,并把它们误认为测试 scope 内目标。Google 称三次访问后模型都自行停止;Irregular 表示相关测试流程问题已经修复。Reuters

03

Anthropic 正考虑推出新模型。Reuters 9 月 19 日援引三名知情人士称,公司正在评估下一代模型的发布时间,并同时进行安全评估;报道将竞争背景指向 GPT-6 Astra 的企业采用增长。Ramp 跟踪的企业 AI 支出中 Astra 约占 13%,Claude Fable 约占 8%,OpenRouter 上 OpenAI 上周的模型消费额也首次在两年半以上的时间里超过 Anthropic。模型名称和正式发布日期目前均未公布。Reuters

04

PrismML 发布 Ternary Bonsai 2 27B。模型基于 Qwen3.8 27B,将语言模型压至 5.9 GB、约 1.76 bit/weight,支持 262K context 和图文输入,并以 Apache 2.0 开放权重。PrismML 自测称其在 20 项 benchmark 汇总中保留全精度模型 98.2% 的成绩;但 Terminal-Bench 2.1 为 52.8 对 69.7、SWE-bench Verified 为 60.8 对 80.6,长程 Agent 能力的损失明显大于汇总均值。PrismML 官方发布

05

TypeSafe AI 的 Jev 开始进入开发者视野。Jev 不生成自然语言,而是接收非结构化状态、直接输出预定义类型的概率决策;TypeSafe 将其训练方法称为 Reinforcement Learning for Calibrated Decisions(RLCD)。公司公布的早期测试把它定位于分类、路由、评分、抽取和程序分支等自动化任务,而非通用聊天。当前性能和 40–200× 延迟优势主要来自厂商自测,尚缺独立复现。TypeSafe 技术说明

06

Mantic 在 Metaculus Cup 的预测系统超过全部人类参赛者。该公司并不训练通用基础模型,而是对其他实验室的 frontier models 做 forecasting specialization:在历史事件上反复预测、评分和改进。2026 夏季 Metaculus Cup 中,Mantic 超过所有人类选手、仅落后于另一 AI bot laertes;公司随后宣布完成 2500 万美元 seed round。Reuters

07

Anthropic 建立实体生物实验室。公司生命科学负责人向 Reuters 确认,Anthropic 已在旧金山湾区开展 wet-lab 工作,并希望探索 Claude 指挥机器人执行科学实验;公司表示目前仍处在非常早期阶段,并强调需要人类监督。Anthropic 同时表示实验室并非专门用于 drug discovery,也不会进入临床试验阶段。Reuters

08

Nscale 提交美国 IPO 文件。这家 NVIDIA 支持的 AI 云公司上半年收入从去年同期 1040 万美元增至 1.406 亿美元,同时净亏损 10.2 亿美元;公司披露超过 1030 亿美元 contracted value、超过 10 GW 电力 pipeline,最大客户贡献上半年 52% 收入。其未来主要客户预计包括 Microsoft 和 Anthropic。Reuters

09

OpenAI 的五年算力账单进一步显形。Financial Times 根据公司材料报道称,OpenAI 预计 2026–2030 年累计负自由现金流约 2780 亿美元,同时到 2030 年累计计算与基础设施支出约 8560 亿美元;同期收入预测从今年 360 亿美元增长至 2030 年 3500 亿美元。这些数字来自内部预测而非已经发生的支出。Reuters

10

AI 数据中心电费问题继续进入美国联邦立法。众议院本周以 417 比 3 通过 Ratepayer Protection Act,要求州级监管机构考虑让数据中心等大型新增负荷承担为其建设电力基础设施的增量成本;参议院快速通过尝试随后受阻。特朗普 9 月 18 日表示正与参议院多数党领袖 John Thune 商谈推动该法案。Reuters

11

Sam Altman 下周将赴联合国安理会讨论 AI 与国际安全。法国召集的公开会议定于周三举行,议题包括前沿模型失控以及被用于影响国际和平与安全的风险;OpenAI 称 Altman 将讨论国际协调和共同安全标准,外交官预计 Anthropic 也可能派高级代表出席,但后者尚未确认。Reuters

串读精讲

1 / 3

Anthropic 指控多家中国模型公司大规模蒸馏 Claude,并披露了 harness 识别与 CoT replay 的具体链路

Anthropic 新发布的 2026 年 9 月 Threat Intelligence Report 给出了迄今相当具体的一批模型蒸馏指控。这里需要先把证据归属说清:下述数字和行为模式来自 Anthropic 自己的调查,目前不是由独立第三方完成的审计。报告称其检测到 Alibaba、Moonshot、DeepSeek、Zhipu、Xiaomi、SenseTime 和 MiniMax 等中国公司或关联网络通过代理账户、转售网络和其他手段获取 Claude 输出,并用于模型训练、数据处理或自身 AI R&D。Anthropic Threat Intelligence Report

规模最大的指控针对 Alibaba。Anthropic 称,5–7 月间归因于 Alibaba 的交换超过 1.51 亿次,峰值接近每天 300 万次、涉及超过 3500 个欺诈账户;目标包括 agentic tasks、software engineering、kernel development 和 long-horizon tasks。报告还称 Claude 被用于帮助开发 Alibaba 的 RL environments 和模型架构研究。这个描述已经超出了传统的“拿大模型生成 SFT 数据”:teacher model 同时进入环境构造、任务求解、训练数据生产和研究工具链。

Moonshot 与 DeepSeek 的案例则出现了一个更特别的机制。Anthropic API 不直接返回完整内部 reasoning,而会返回一个可供后续请求引用的 thinking signature。Anthropic 称 Moonshot 保存这个 signature,在新的 session 中再次提交,让 Claude 把 signature 还原成完整 reasoning trace,从而形成 cross-session replay attack。报告称 Moonshot 5–7 月间涉及超过 2300 万次交换,其中一个十天窗口曾使用 5380 个欺诈账户;DeepSeek 在 7 月一个 14 天窗口超过 1210 万次交换。Anthropic:Moonshot、DeepSeek 与 CoT extraction 调查

这里还有一个与 Agent harness 直接相关的细节。Anthropic 称 DeepSeek 会检查 inbound request 中的字符串,识别用户是否通过 Claude Code、Claude Agent SDK 或 OpenCode 等第三方 coding harness 使用 DeepSeek;部分被标记的请求随后被转发到 Claude Opus。也就是说,harness 在这里不仅决定模型拥有什么工具和 system prompt,还可能成为上游服务识别请求类型、决定后端路由的 observable signal。同一个名义上的 model endpoint,经不同 harness 进入后,实际执行链路理论上可能并不相同。

Xiaomi 的案例又有所区别。Anthropic 称没有发现 Xiaomi 直接把 Claude 回答实时返回给 MiMo 用户,而是保存 MiMo 用户的完整 request/response,再通过 Claude replay,用于生成 SFT 和 RL 数据;其观测到的规模是 20 天超过 40 万次请求、通过 1500 多个代理账户。报告还称 Claude 被用于重建 developer environment、把多轮对话清理成训练 exchange、生成成对 request/response,以及给回答打分。Anthropic:Xiaomi distillation 调查

如果这些归因成立,它提供了一个比“teacher 蒸馏”更完整的现实 post-training 图景。teacher 可以出答案,也可以生成任务、清洗 trajectory、judge 数据、重建环境、提供 reasoning trace,甚至参与 RL environment 开发。评测上因此很难仅凭两个模型行为高度相似,就判断它们存在直接蒸馏关系:同一 teacher 可以在训练链条的多个环节留下行为特征,而不同 harness 和数据清洗又会改变最终模型表现。真正能够证明训练来源的证据,需要服务端流量、账户归因、训练管线或数据 provenance,而不是 benchmark correlation 本身。

2 / 3

Ternary Bonsai 2 27B:98.2% 的平均能力保留,到了 Terminal-Bench 只剩约四分之三

PrismML 的 Bonsai 2 27B 很适合观察“小模型/压缩模型评测里平均分会隐藏什么”。它没有把 27B 模型剪成更少参数,而是保留 Qwen3.8 27B 的架构,把大部分权重限制为 {−1, 0, +1} 三个值,再配合 FP16 group-wise scaling。最终有效约 1.76 bit/weight,语言模型占 5.9 GB,相比全精度 Qwen3.8 27B 小九倍以上。模型支持 262K context、图文输入,权重以 Apache 2.0 发布。PrismML 官方技术说明

PrismML 给出的主结果很好看:20 个 benchmark 汇总,Bonsai 2 为 83.9,Qwen3.8 27B 为 85.4,因此得到“98.2% capability retention”。拆开后,math 是 96.57 对 97.06,coding 81.58 对 82.17,agentic & tool calling 77.57 对 79.74,instruction following 甚至是 82.66 对 81.25。这里所有结果均为 PrismML 自测,采用 thinking mode、EvalScope 和 vLLM,目前没有独立复现。PrismML benchmark 表

但官方 20 项汇总没有包含两个非常有信息量的长程任务。PrismML 的更完整结果显示,Terminal-Bench 2.1 上 Bonsai 2 得 52.8,而全精度 Qwen3.8 27B 为 69.7;SWE-bench Verified 则是 60.8 对 80.6。两者都只保留大约四分之三的分数。换句话说,“98.2% retention”对于知识、数学、短代码和结构化 tool use 可以成立,但不能自然外推到需要连续几十步决策、环境反馈和错误恢复的 Agent trajectory。Bonsai 2 完整结果整理与运行条件

这很可能不是简单的“长任务更难”。在单步准确率只下降一点时,trajectory 会累积错误:假设某种决策从 99% 降到 98%,单步只差一个百分点,连续 50 个相互依赖的正确决策概率却会从约 60.5% 降到 36.4%。这个例子只是数学示意,并非 Bonsai 的实测机制,但它解释了为什么压缩损失在 long-horizon benchmark 上可能被放大。

因此,压缩模型如果只报告平均 benchmark retention,很容易遗漏真正影响 Agent 部署的尾部能力。更合理的报告方式可以把 retention 分成至少三层:单轮能力、tool-use/structured decision、long-horizon trajectory;同时在同一 harness、相同 reasoning effort 和相同 context 条件下比较。Bonsai 2 的结果已经说明,模型体积缩小九倍和“平均能力几乎不损失”可以同时成立,但这并不意味着每一种业务形态都只损失 1.8%。

3 / 3

Jev:把生成式模型拿出决策链,专门训练“带概率的结构化判断”

TypeSafe AI 的 Jev 不是一个更小的聊天模型。它保留 transformer 作为基础,但放弃生成任意字符串:调用者预先定义允许的输出类型,模型读取文本或程序状态后,一次性并行产生 typed values、概率和 confidence。公司把这一类模型称为 System One Models,把训练方法称为 Reinforcement Learning for Calibrated Decisions(RLCD)。TypeSafe AI:Introducing System One Models & Jev

这种设计针对的是软件里非常常见、但用通用 LLM 实现时有些笨重的任务:分类、路由、打分、抽取、选择分支、判断是否触发某个流程。通用模型通常要先生成 token,再 parse、schema validate,有时还需要 retry;Jev 的输出空间预先限定,因此不会生成 schema 外字符串。TypeSafe 把这一点称为“不能 hallucinate”,这个表述需要缩窄理解:它可以保证不会产生非法类型,却仍然可能做出错误分类或错误概率判断;type correctness 不等于 semantic correctness。

它的评测方法也值得看。TypeSafe 没有主要使用传统 ground-truth classification benchmark,而是定义固定 compute graph,让 Jev 和通用 LLM 执行相同 workflow,再用 GPT-6 Astra 与 Claude Fable 5.1 的平均预测作为 reference probability。公司称 Jev 在这些 workflow 上形成明显的 latency/cost Pareto frontier,并报告最高约 193.6× 更快、444.6× 更便宜;但公司自己也注明这些 workflow 由其 capability 团队制作、可能存在选择偏差,reference 又来自两家 frontier model,而不是独立真实标签。TypeSafe workflow eval 方法与限制

因此 Jev 当前最有价值的地方还不是“已经证明比 LLM 更聪明”,而是它提出了一个不同的 evaluation target。对于业务系统中的 classification_judgment 或固定 schema 决策,真正关心的往往不是模型能否写出漂亮解释,而是 calibration:当模型说 95% 时,长期来看是否真的约有 95% 正确;在什么 confidence 阈值以下应该升级给大模型或人;以及同样 accuracy 下 latency 和 cost 能否低一个数量级。

如果这种模型路线成立,业务 AI 的架构可能出现一种很实际的分层:大量高频、低延迟、输出空间有限的判断交给专用 decision model;需要开放生成、复杂 reasoning 或异常处理时,再升级给通用 LLM。评测也随之从“一个模型包打天下”的 leaderboard,变成按任务形态测 calibration、coverage、selective accuracy、cost 和 fallback 后的端到端成功率。Jev 现在的公开证据还不足以证明这套路线的普适性,但它已经提供了一个值得独立跑测的对象。