日期:2026 年 9 月 14 日,北京时间 时间范围:以过去 24 小时为主,并补入过去 7 天内此前未充分覆盖、且对理解近期技术变化有价值的工作。
今日快讯
DeepSeek V4.1 Flash 的 API 替换今天正式生效。DeepSeek 9 月 10 日发布 V4.1 Flash 时已预告,北京时间今天 12:00 起,所有 deepseek-v4-pro 请求自动路由至 V4.1 Flash,并按 Flash 价格收费,直到 V4.1 Pro 上线。V4.1 Flash 是 552B MoE,但输入阶段仅激活约 8B、输出约 16B;官方称 KV cache 的 HBM 和 SSD 占用分别降至上一代的 1/4 和 1/8。今天的新信息是流量迁移真正生效,而不是模型再次发布。原注
DeepSeek 官方说明
Microsoft 今天公布一份面向未来自研 AI 的行为准则草案。Reuters 报道,这份类似“模型宪法”的文件要求 AI 始终允许人类纠正和关闭、清楚地向人类沟通,并将违反行为准则本身视作系统失败;Microsoft 将公开征求六周意见。它与 Anthropic 近期强调外部持续评测的路径不同,更接近把“可纠正、可停止、尊重边界”直接写入模型行为规范。原注
Reuters 原始报道
EvoRS 开始让 reward system 和 policy 一起演化。开放式写作、角色扮演之类任务没有确定答案,训练往往依赖 rubric + LLM judge;但随着 policy 学会迎合当前评分器,原来有效的 reward 会逐渐丧失区分度,甚至被 reward hacking。EvoRS 把评分逻辑表示成可执行的 Reward-DAG,并依据 on-policy rollout 和 reward trace 持续修改它。作者报告,在写作和 roleplay 实验中,最终策略在三个 judge 下都有提升,同时减少 reward hacking 和 coverage failure。原注
论文
一项 LLM-as-a-Judge 研究发现,judge 的能力和偏差并不是两个独立问题。研究覆盖四个 benchmark、六个模型、36 组 judge–examinee 组合;作者观察到模型自身做题准确率与 judging accuracy 高度相关,但更强的被评模型同时更容易获得宽松判断。研究提出利用多个 judge 之间的 disagreement,在没有人工标签的情况下估计各 judge 的 false-positive / false-negative rate,再加权投票;模拟的 distribution shift 实验中,与知道真实错误率的 oracle 平均只差约 0.5 个百分点。原注
论文
本周补报一项容易被“harness 很重要”这句口号遮住的反例。Harness or Model? 在 256 个私有、控制污染的 coding tasks 上比较同一模型更换 harness 后的差异:Claude Opus 4.8 两种 harness 相差 −1.25 个百分点,GPT-5.5 相差 +1.25 个百分点,两组 95% CI 都跨过零,因此整体上并没有测出稳定的 harness 胜者;但不同任务分层出现方向相反的差异。作者还主动修正了早期版本中由于 telemetry 语义错误导致的成本结论。它提醒我们,harness effect 确实存在,但不能从几个大幅提升案例直接推出“换 harness 必然带来显著收益”。原注
论文
NVIDIA 本周发布 CUDA Toolkit 13.4 GA,版本号为 13.4.1。它首次为 RTX Spark 设备加入 Windows on Arm 支持,同时提供 Vera Rubin 的 developer preview;NVIDIA 明确注明 Rubin 支持目前不应用于 benchmarking、performance analysis 或 production。13.4 还扩展了 MPS 的容器化 GPU 共享和 cgroup 显存限制等能力,说明 GPU 软件栈仍在为更细粒度、多租户的推理基础设施继续补齐。原注
CUDA 13.4 Release Notes
串读精讲
1 / 3
评测结果的误差,越来越多来自“测量仪器”本身
今天这批工作里最值得细读的共同问题,是我们到底在测模型,还是在测 benchmark、grader 和实验流程留下的误差。物理 benchmark 的专家复核给出了一个相当极端的案例:研究人员并没有改变 GPT-5.6 Sol,而是让领域专家逐题检查原来的失败。经过审计,很多错误来自答案 key 不正确、问题有歧义、grader 无法识别等价解法,或者题目自身缺少必要条件。于是原来被解释成“模型不会高级物理”的那部分 failure,大量消失了。原注
这里尤其需要注意作者采用的修正方式。比如 CritPt 最终的 94.4% pass@4,是在专家复核后保留下来的 54 道有效题上计算;HLE-Physics、CMT 的新数字也来自修复或筛选后的评测子集。因此正确解释是:原 benchmark 对“well-posed、closed-ended physics problem solving”的能力存在明显低估;不能拿原分和修正分当作完全相同试卷上的前后性能提升。反过来说,如果题目经专家清洗后迅速接近饱和,那么这些 benchmark 本身也可能已经接近完成使命。原注
Skill Issue 展示的是另一类测量误差。我们经常看到某个 prompt、skill、memory 或 harness 修改带来 3–5 个点提升,然后立刻把它解释成系统性能力增益。但 coding agent 本身具有明显随机性:不同 rollout 会探索不同文件、走不同修复路径。Skill Issue 的 GEPA 结果平均高 4.9pp,作者却明确说,以现在的数据规模还不能把这 4.9pp 与运行方差区分开。对于 Agent eval,这比那个 4.9 本身更有价值,因为它把 experimental unit 从“task”推回到了“task × repeated trajectory”。原注
VRL-Bench 又暴露了第三种常见问题:基线定义。如果一个 Agent 第一次失败、第二次成功,我们很容易说“reflection 起作用了”;但第二次即使没有 memory,它也可能因为 sampling randomness 换了一条路径而成功。因此 VRL-Bench 把 memory-free retry 作为真正基线,再固定总 trial budget。结果一些知名 verbal-learning 方法的优势消失,甚至低于直接 retry。这里测到的不只是“有没有学到经验”,还包括一个资源分配问题:剩余尝试次数是应该沿着现有经验继续 exploit,还是保持 exploration。原注
K-Bench 则把“我们观察什么”本身变成变量。传统 unlearning benchmark 只看最终 answer;Agent 部署之后,秘密还可能存在 retrieval result、tool observation、summary 甚至中间 reasoning 中。最终答案拒绝输出,并不能证明知识已经删除。作者把这六个可观察通道同时纳入泄露定义之后,得到的结论与传统 benchmark 可以完全相反。原注
这四项工作对应四种很实用的 eval 风险:ground truth / grader 可能错,单次运行噪声可能大于 treatment effect,baseline 可能太弱,以及 observation boundary 可能过窄。它们对真实 Agent benchmark 的影响比“再找一个更强 judge”更基础。尤其当模型差距越来越缩小时,几分的榜单差异是否有意义,需要先回答题目有效性、重复运行方差、预算公平性和轨迹观测范围。
如果把这些原则用于业务型 Agent eval,一个很具体的改变是:对 leaderboard 上决定排名的临界样本做 failure audit;对高方差任务至少抽样重复运行并报告不确定性;涉及 retry、reflection、planning 等机制时固定总调用预算;涉及工具和状态的任务,则不要只根据最终自然语言答案判断成功。今天几篇论文并没有共同提出这套框架,但它们从不同方向说明了为什么这些控制会变得必要。
来源链接未随原文保留;原注可在 GPT 对话中查看。
2 / 3
小模型能不能把“请教大模型”变成自己的能力
RIVET 想解决的是一个很实际的矛盾。让 4B 模型在推理时随时调用 8B、9B 甚至 frontier model,当然可能提高准确率,但部署成本、延迟和依赖都没有真正消失。传统 distillation 则通常让强模型离线生成答案,再交给 student 模仿;student 学到的是 teacher 的输出,却不一定学到“什么时候我需要求助、怎样提问、怎样使用返回的信息”。
RIVET 的第一阶段更像真实协作。compact controller 自己决定什么时候调用哪位 expert、给它什么请求,再把 expert 返回的 reasoning 或 code 接到自己的轨迹中;整条交互最终共享 task outcome reward。实验用 Qwen 系列 1.7B / 4B controller 和三个冻结 expert。此时模型既学习问题本身,也学习“在自己的能力边界附近怎样利用外援”。原注
关键在第二阶段。研究者留下已经验证成功的完整协作轨迹,将其重新做 format-aware supervised training,然后在部署时把外部 expert 全部撤掉。RIVET-4B 在第一阶段拥有专家时数学平均准确率约 46.2%;直接拔掉专家后跌到约 37.7%;完成 internalization 后重新升至 44.16%。也就是说,在这组实验里,它重新吸收了相当一部分此前依赖 external expert 才能完成的行为。原注
这和普通知识蒸馏有一个值得区分的地方:被蒸馏的不只是“正确答案”,还有 controller 亲自经历过的求助决策、专家返回的信息和后续整合方式。可以把它理解成一种 trajectory-level distillation,只不过轨迹是在 student 与 experts 的互动中产生,而不是 teacher 单方面写好的。
对“小模型是否还能继续有价值”这个问题,这条路线比参数榜单更有解释力。未来的小模型训练可能出现一种循环:先让 compact model 在训练环境里拥有昂贵工具、大模型专家或搜索系统,让它形成成功轨迹;再把其中可内化的部分变回 weights,把无法内化或变化太快的能力继续留在工具层。这样训练期和部署期可以拥有完全不同的系统结构。
目前证据还很有限。RIVET 的主要实验仍然集中在竞赛数学,GPQA-Diamond 提供的是初步跨领域信号;真实业务 Agent 里,专家返回的信息更长、工具状态更复杂,而且很多知识会快速变化,未必适合写回模型参数。因此下一步真正值得看的,是同样的 internalization 是否能在代码、搜索和多步业务任务上保留,以及把专家拿掉后究竟保留的是领域知识、调用策略,还是某种更通用的推理结构。原注
来源链接未随原文保留;原注可在 GPT 对话中查看。
相关来源
3 / 3
Reward 也会随着模型变强而“过期”
EvoRS 讨论的是后训练中一个容易被忽视的问题:开放式任务里的 reward system 并不是固定真理。数学题可以直接验证最终答案,但写作、角色扮演、复杂 Agent 行为通常靠 rubric、LLM judge 或多个启发式信号组合。训练早期,这些规则可能足够区分好坏;policy 反复优化之后,却会逐渐找到评分器喜欢的表面模式。
这其实是一个动态博弈。假设 rubric 奖励“细节充分”和“角色一致”,policy 很快可能学会写得更长、重复人物设定,从而获得高分。此时 reward 仍然按原规则正常工作,但它对真正质量的 discrimination 已经下降。继续沿着同一个 reward 做 RL,会不断强化这种偏差。
EvoRS 因此把 reward system 表示成一个可执行 Reward-DAG:里面不只有 rubric,还包括不同评分组件及其组合关系。训练过程中,一个独立的 agentic designer 查看最新 on-policy rollouts 和 reward traces,再修改这套 DAG。作者在 writing 与 roleplay 上报告,相比固定 reward,最终 policy 在三个 judge 的评价下都有提升,分别高出 2.107 和 4.767 分,同时观察到更少的 reward hacking 和 coverage failure。原注
这个思路和 eval 的关系很直接。LLM-as-a-Judge 通常被当作“测量工具”,但在 RL 中它同时又是优化目标。一旦模型看过足够多来自同一种 judge 的信号,judge 的 weakness 就会进入训练分布。此时一个在训练初期表现良好的 judge,并不能保证在训练后期仍有相同的排序能力。
今天那篇 capability-dependent judge bias 论文从另一个方向补充了这个问题:更会做任务的 judge 通常也更会评分,但更强的 examinee 又会系统性地获得更宽松的判断。换句话说,单纯把 judge 换成最新最强模型,并不能保证评分标尺不随被评模型能力一起漂移。原注
EvoRS 目前只在有限的开放式生成任务上测试,且最终验证仍依赖其他 LLM judges,所以它并没有解决“谁来评 reward system 本身”这个递归问题。但它提出了一个值得长期追踪的实验变量:除了固定 policy、更新 policy,还可以定期重新测 reward 的区分度、偏差和可利用性。对于持续后训练的模型,reward version 很可能最终会像 dataset version 和 benchmark version 一样,成为解释训练结果时必须记录的元数据。原注
来源链接未随原文保留;原注可在 GPT 对话中查看。
部分原生引用无法独立还原;缺少独立网址的条目已标明,已有网页链接均按原稿保留。