今日快讯

01

Aleph Alpha 发布 Kolibri,一个明显围绕德语企业场景设计的开放权重 MoE 模型。10 月 3 日,德国 发布 Kolibri:总参数 78B、每次激活约 3B,支持最长 100 万 token 上下文,权重以 Apache 2.0 许可开放。模型只重点训练英语和德语,并把工具调用、结构化抽取、RAG 与多步推理列为核心场景。更值得注意的是它对“知道什么时候不回答”的专门训练,这部分在今天的精讲展开。 Aleph Alpha:Kolibri 发布说明

02

开放 AstaBrief 8B,把科学文献综述压缩成一个专用小模型任务。AstaBrief 基于 Qwen3-8B,输入研究问题和已经检索出的论文片段,一次生成带引用的报告;权重和训练材料均已开放,并成为 Asta 的 Fast mode。Ai2 报告其完整流水线平均生成时间为 51.1 秒,而 Claude 驱动的 Thinking mode 为 178.5 秒。这个比较来自 Ai2 自己的系统测试,而且大部分训练与正式评测在 2025 年完成,不宜理解为它已经优于当前前沿模型;它更有价值的地方,是展示了一个 8B 专用模型怎样替换原本昂贵的多阶段生成链。 Ai2:AstaBrief 技术说明

03

给 DGX Spark 增加了 64GB 版本。新机仍采用 GB10 Grace Blackwell、ConnectX-7 和完整 NVIDIA AI 软件栈,10 月 23 日起由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 销售,起价 4,999 美元。NVIDIA 称单机支持最高 100B 参数模型,两台可直接通过 200 GbE 连接并把可用内存扩展到 128GB;其 Qwen3.8 27B 内部测试中双机最高达到单机 1.7 倍性能。这些容量和性能数字均来自厂商测试,实际能否装入模型还取决于量化、KV cache、上下文长度以及 agent 同时运行的其他组件。 NVIDIA:DGX Spark 64GB

04

最近公布的一项机器人劳动研究给“机器人已经能做很多工作”加上了一个很有用的成本约束。研究按美国职业任务拆分后估计,现有机器人在某种环境下已经能够完成约 74% 的体力任务,相当于全部工作时间的 34%;但按照作者的成本模型,机器人目前只在约 0.3% 的工作任务上比人工更便宜。研究中的任务能力评级和部分工作时间估计使用 Claude 完成,因此这些数字是研究模型的估计结果,并非实际企业自动化率;它的价值主要在于把“技术上能做”和“经济上值得做”分开测量。 Anthropic:What work can robots do?

05

发布了 The Eternal Complement,讨论一个容易被“超级智能”叙事忽略的问题:产生更好的想法并不自动等于更快的社会进步。文章把实验设施、供应链、法规、融资、行政协调以及大量普通执行工作统称为实现创新所需要的“institutional intelligence”,认为前沿智能与这些执行能力具有互补关系。这是一篇署名作者观点文章,OpenAI 明确注明它不代表公司立场,也没有提供新的模型或实验结果;值得关注的是,它把讨论焦点从“AI 能产生多少新知识”移到了“社会有没有能力把新知识变成现实”。 OpenAI:The Eternal Complement

串读精讲

1 / 2

Kolibri 把“不会就不答”直接做进训练目标

Kolibri 最值得看的部分并不是 78B 总参数、3B 激活参数或者 1M context。这些配置让它成为一个相当紧凑的 MoE,但并没有天然形成与同规模开放模型完全不同的产品定位。真正有辨识度的是 Aleph Alpha 在训练过程中如何处理 grounding:当上下文不足以支持答案时,它希望模型主动停止猜测。

这听起来很普通,因为今天几乎所有模型的 system prompt 都可以写一句“如果不知道,请说不知道”。问题在于训练目标通常并不奖励这种行为。

假设一道题缺少必要证据。模型如果猜一个答案,至少有一定概率碰巧正确;如果明确回答“不知道”,在很多传统问答 benchmark 中则必然拿不到正确答案。长期使用这种数据和评分训练,模型自然容易形成一种策略:信息不完整时继续生成最可能的答案。

Aleph Alpha 为 Kolibri 做的一个改变,是专门加入正确答案就是“不知道”的训练样本。但狭窄专业领域恰好又缺少大量高质量负样本,因此它进一步使用自己称为 Merlin-Arthur 的训练方法自动制造这种情形。

方法可以简化成三个角色。Arthur 是最终要训练和发布的模型。Merlin 拿一份原始文档,构造仍然包含足够证据、可以正确回答问题的上下文;Morgana 则从文档里删除关键证据,同时尽量让剩余内容看起来仍然很像能够回答这个问题。

Arthur 不知道自己看到的是哪一种。

于是同一道问题出现了两种训练状态:看到 Merlin 的上下文时必须找到证据并回答;看到 Morgana 的上下文时,正确动作只能是拒绝作答。一个“幸运猜中”的答案在第二种情况下也被算错。训练目标因此开始直接区分“答案碰巧正确”和“答案能够被提供的材料支持”。

这比单纯训练 citation 格式更接近 RAG 系统真正面对的问题。要求模型附引用,并不能保证 grounding。模型完全可能先生成一个看似合理的答案,再生成一个同样看似合理的引用。真正需要学习的是另一件事:当前证据究竟有没有跨过足以作答的门槛。

Aleph Alpha 为此还构造了自己的 M/A grounding score,试图测量答案中有多少内容可以证明来自给定文档。公司公布的结果显示,Kolibri 在这一指标上得到 0.23,而其早期 Kolibri Origin 为 0;对比的 Qwen3.6-35B-A3B 为 0.12,Nemotron 3 Super 等若干模型在这一测试中为 0。这是厂商自建指标和厂商测试结果,不能把数字直接理解成模型总体 hallucination 水平。

在相对成熟的公开测试上,结果也没有显示 Kolibri 全面领先。例如 Aleph Alpha 报告,在 AA-Omniscience 中 Kolibri 的 non-hallucination rate 为 44.0%,低于 Qwen3.6-35B-A3B 的 56.7%;但在 RGB 测试中,Kolibri 的 “holds back” 为 85.6%,高于表中几个对照模型,而 “invents nothing” 为 87.3%,与最好的一组模型接近。

这些数字更适合说明训练方向,而不是建立一个新的模型排行榜。

Kolibri 的另一个特点是 Aleph Alpha 没有把“欧洲主权模型”只处理成模型部署地点问题,而是直接改了训练数据。它估计要在 20T token 的预训练中保持约 20% 德语,需要大约 4T 德语 token;清洗公开德语数据后只有约 390B,因此团队自己针对德语重新设计 Common Crawl 过滤器,获得约 1.3T organic German web tokens,又让模型对已有德语文本进行不同形式的德语重述,增加约 1T。最终构成约 2.4T unique German token pool,并通过 upsampling 让模型在训练中看到约 4.3T 德语 token。

这里有一个很具体的数据工程细节。英语网页清洗中常见的一项规则,是过滤平均单词长度异常高的文本。但德语本身大量使用复合词,德国行政文本的平均词长尤其容易越过英语数据集使用的阈值。如果直接沿用英语过滤规则,恰好会把公共行政、法规等 Aleph Alpha 最需要的德语材料大量删除。团队因此重新调了语言相关的过滤参数。

他们还专门训练了英语—德语 tokenizer UniBPE。Aleph Alpha 报告,在 FineWeb-2 德语文本上,Kolibri tokenizer 平均每 token 表示 4.90 bytes,高于其列出的 GPT-5、Gemini、DeepSeek V4、Qwen3.8 等 tokenizer;同时它会倾向按照德语复合词的形态边界拆分,例如把 “Protokolldaten” 分成 “Protokoll + daten”。这些仍是厂商自己的比较,但它说明语言本地化可以深入到模型架构外围非常基础的一层:同一段德语如果需要更少 token,长文档推理和企业推理成本都会随之变化。

Kolibri 因而提供了一个不同于“再做一个通用开放模型”的路线。Aleph Alpha 主动放弃覆盖尽可能多语言,把数据、tokenizer、负样本生成、grounding 训练和行业评测都集中到德语与英语企业工作。它最终是否比更大的通用模型更适合真实德国政府、法律和工业系统,还需要独立部署数据验证;但至少模型设计与目标工作负载之间的关系相当清楚。

2 / 2

AstaBrief 8B:把复杂 agent 流水线的一段能力蒸馏成一个小模型

Ai2 的 AstaBrief 8B 解决的是另一个越来越常见的问题:当一个复杂 AI 产品已经跑通以后,是否还需要让最贵的通用模型完成其中每一步?

Asta 是 Ai2 面向科学研究的系统。研究者给出问题以后,系统先检索论文,再根据论文生成带来源的研究报告。原有报告流水线会先处理检索片段,再做摘要、分组和章节规划,最后由 Claude 等模型逐段生成完整报告。AstaBrief 则把后半段工作重新定义成一个窄任务:输入“研究问题 + 已检索好的科学文献片段”,直接一次生成完整带引用报告。

模型本身只有 8B 参数,基于 Qwen3-8B。Ai2 先从真实研究查询中清洗出约 9 万个问题,再用既有多阶段 ScholarQA 流水线产生训练报告;经过质量过滤得到约 3.95 万条监督微调样本。随后又构造约 6000 对偏好数据,在两个 judge 模型判断一致的样本上进行 DPO。公开的 SFT checkpoint 显示,该阶段在 8 张 H100 上训练,最大 sequence length 为 32768。

这套方法的关键并不是让 8B 模型学会搜索互联网。AstaBrief 本身并不负责 retrieval,也没有凭空获得完整科研 agent 的能力。检索、论文解析和证据选择仍然发生在模型之外;它学习的是流水线中已经相对稳定、边界清楚的一段映射:

研究问题 + 一组相关证据 → 有结构、带 citation 的报告。

一旦任务被限定到这里,训练专用模型就开始有经济意义。

Ai2 报告,Asta 的 Fast mode 平均每份报告需要 51.1 秒,Claude 驱动的 Thinking mode 为 178.5 秒,大约相差 3.5 倍。Ai2 的目标还包括降低 serving cost,并让用户能够在自己的基础设施运行模型。需要保留两个比较条件:这是整个 Asta pipeline 的厂商测量,而不是裸模型 token/s;并且 Ai2 表示大部分训练和正式评测在 2025 年完成,因此没有重新与 2026 年 10 月的最新前沿模型做全面比较。

所以这项工作的意义并不是“8B 已经打败 Claude”。更有价值的观察是一个产品生命周期:最初用强通用模型和复杂 agent pipeline 探索任务;积累真实查询、成功轨迹、偏好数据和失败模式;等任务边界稳定以后,再把其中高频且规则相对固定的一段能力训练进专用小模型。

这条路线和传统知识蒸馏有一点区别。teacher 不只是一个更大的模型,teacher 实际上是整套系统:检索器、多个生成模型、分阶段 prompt、过滤器、citation 逻辑以及用户真实问题共同产生训练数据。AstaBrief 学到的是这个系统最终希望得到的输出行为。

它也解释了为什么小模型和 agent 并不一定是两条竞争路线。agent 系统在早期帮助团队发现工作流究竟应该怎样运行;稳定以后,其中一部分 agentic orchestration 可以重新被压缩进模型。剩下真正需要搜索、调用工具、动态决策和外部验证的步骤继续留在 harness 中。

如果这种开发方式逐渐成熟,未来应用模型的尺寸选择可能越来越按“工作流中的哪一段”决定,而不是为整个产品统一选一个模型。复杂任务仍然可以由强模型负责规划和处理异常;大量稳定、重复、输入输出明确的步骤则交给专用小模型。AstaBrief 8B 是目前一个相当干净的公开案例,因为 Ai2 同时开放了模型、训练数据和中间 checkpoint,使这条从复杂科研流水线到专用模型的路径能够被具体检查。