评测动态

01

10 月 6 日,Mistral 发布 Mistral Large 4 预览版,并集中报告了一批编程、agent、视觉、专业工作与安全评测结果。其中,官方列出的成绩包括 DeepSWE v1.1 61.7%、SWE-Atlas-QnA 59.4%、Terminal-Bench 4 28.3%,以及面向 657 项应用工作流的 AutomationBench 59.9%。这些数字并非全部来自同一种运行关系:部分采用 Artificial Analysis 等第三方评测方的数据,部分来自 Mistral 委托的盲评或内部测试。公开页面尚未完整交代每项实验的采样次数、推理预算和逐题结果,因此目前更适合作为预览版的能力证据目录,而不是一张条件完全统一的模型排名表。Mistral Large 4 发布说明

02

版本条件同样重要。Mistral 表示模型权重将在月底发布,当前强化学习仍在继续,后续还会公布架构、更多 benchmark 和后训练方法。10 月 6 日页面上的成绩因此对应当时可通过 API 使用的预览系统,不能预先视为月底公开权重在任意 harness 中都能复现的固定成绩。模型正式发布后,核对模型快照、提示词、工具环境和计算预算,会比只比较发布页上的总分更有意义。Mistral 对版本与后续发布的说明

评测研读

1 / 6

两个百分点是否足以分出胜负:benchmark 分数中的抽样误差与配对比较

一套 benchmark 有 500 道题,模型甲答对 310 道,准确率为 62%;模型乙答对 300 道,准确率为 60%。排行榜会把甲排在乙前面,但“高出两个百分点”至少可能表达三件不同的事:甲在这 500 道固定题上多答对了十道;如果换一批性质相近的题,甲的平均表现可能更好;甲在实际任务中具有值得关注的优势。第一件事由结果直接给出,后两件事需要更多统计与任务证据。

benchmark 的总分通常是点估计,即用一个数概括本次观测。它没有自动告诉我们,换一批题、换一次随机采样或换一个运行环境后,数字会怎样变化。置信区间、标准误和配对检验的作用,就是把其中一部分不确定性显式化。它们不能修复错题、污染、评分器偏差或运行配置不一致,却能防止把有限样本造成的小幅波动写成确定的模型差异。

2 / 6

单个准确率的误差范围回答什么

先只考虑题目抽样,并暂时把每道题看成相互独立、只有对错两种结果的观测。若模型在 500 道题上的准确率为 60%,二项比例的近似标准误为:

\[ \sqrt{\frac{0.6(1-0.6)}{500}}\approx 0.0219 \]

也就是约 2.2 个百分点。用常见的正态近似,95% 区间大约是在点估计两侧各延伸 1.96 个标准误,即约 55.7% 至 64.3%。这是一个教学计算,不对应某项真实榜单;在样本很小或准确率接近 0、1 时,简单正态近似尤其可能不合适,应采用更适合比例数据的方法。

这个区间的含义也需要限定。它试图描述:如果当前题目可以视为从某个目标题目总体中抽来,我们用这批题估计模型对同类题目的平均准确率会有多大不确定性。它不是“模型真实准确率有 95% 概率在该区间内”的直接概率陈述,也不包括 API 波动、解码随机性、提示词变化和评分器错误。

2026 年 ICML 的一项研究专门区分了 benchmark accuracy 与 generalized accuracy:前者是模型在这份固定测试集上的测量,后者是对同类潜在测试题总体表现的推断。作者指出,一些常见计算会给出无效的不确定性估计,因而采用广义线性混合模型,同时估计模型能力、题目难度和方差来源。《Expanding the AI Evaluation Toolbox with Statistical Models》

这一区分解释了为什么“固定题集上多对十题”不等于“未来同类任务一定高两个百分点”。如果 500 道题就是唯一关心的业务清单,例如一组必须通过的合规检查,那么逐题结果本身可能比总体推断更重要;如果希望把分数推广到未来不断出现的同类任务,题目怎样抽取、是否代表目标分布,就成为结论的一部分。

3 / 6

比较两个模型时,应保留逐题配对关系

直接给两个准确率各算一个误差范围,再观察区间是否重叠,并不是利用数据最充分的比较方法。两个模型通常回答同一批题,结果天然配对。真正有助于区分模型的,是它们产生分歧的题目。

仍用 500 道教学假设题。模型甲答对 310 道,乙答对 300 道。进一步查看逐题记录,可能得到:

  • 两者都答对 285 道;
  • 只有甲答对 25 道;
  • 只有乙答对 15 道;
  • 两者都答错 175 道。

两者共同答对或共同答错的题,不会改变谁领先。甲的十题净优势来自 25 对 15 的不对称。针对这种同题、二元结果的比较,McNemar 检验关注的正是两个“仅一方答对”的格子,而不是把两个总准确率当成互不相关的数字。

这也说明为什么同样的两个百分点差距,证据强度可能不同。若甲独自答对 15 题、乙独自答对 5 题,差距仍是十题,但分歧集中为 15 对 5;若两者分别独自答对 105 题和 95 题,净差同样是十题,却发生在大量方向相反的分歧之中。前一种结果更像稳定的单向优势,后一种更像两个模型擅长不同题目后留下的微小净差。总分相同,逐题结构不同。

NLP 统计检验指南强调,当两个系统运行在同一数据集上时,应使用配对版本的检验;对准确率和精确匹配等指标,也可以使用配对 bootstrap 或置换检验。检验方法需要与指标形式、数据量和分布假设匹配,不能在所有任务上机械套用同一个公式。NLP 评测指标与检验方法对照;统计显著性检验指南

4 / 6

bootstrap 重抽样怎样模拟“换一批题”

有些指标不像准确率那样容易写出简单标准误。例如 F1、BLEU、ROUGE 或多个子任务聚合后的总分,可能由整批预测共同计算。这时常见办法是 bootstrap:从现有测试题中进行有放回抽样,每次仍抽取同样数量的题,重新计算指标;重复许多次后,观察这些模拟分数的分布。

假设原测试集只有五题,编号为 1 至 5。一次 bootstrap 样本可能是 2、2、3、5、5,另一次可能是 1、3、3、4、5。有些题会重复,有些不会出现。这样做并没有创造新题,而是利用现有题目近似估计:如果题目构成略有变化,指标可能怎样波动。EleutherAI 的 lm-evaluation-harness 就为 F1、BLEU、困惑度等一批指标实现了 bootstrap 标准误;对均值类指标则可以使用封闭形式计算。lm-evaluation-harness 的标准误实现

比较模型时,重抽样也应保留配对。一次抽到第 37 题,就同时取甲、乙在第 37 题上的结果,然后计算这次样本中的分数差;不能分别给两个模型抽两套题,否则会把题目难度构成的不同混入模型差异。最后得到的应当是“甲减乙”的差值分布,可以据此报告差值区间,而不只是各自分数的区间。

bootstrap 同样有前提。若 500 条记录其实由 50 个用户各贡献十条高度相似请求,按单条随机重抽会把相关记录当作独立观测,往往低估不确定性。更合适的做法可能是按用户、文档、对话或任务簇整体重抽。NLP 数据中的句子经常来自同一篇文档、同一作者或同一语境,独立同分布假设并不天然成立。自然语言数据依赖性的讨论

5 / 6

题目抽样与模型随机性是两层不同的不确定性

对生成模型而言,固定题目也可能在重复运行时得到不同结果。温度、随机种子、服务端模型更新、工具返回、超时和 agent 路径都可能改变成功与否。只对题目做一次 bootstrap,估计的是题目样本带来的波动;它没有测量同一道题重复运行时的波动。

因此,两类问题需要不同数据:

  • 想知道换一批相似题后总分是否稳定,需要有代表性的题目样本,并对题目层面建模或重抽样。
  • 想知道同一系统重复执行是否稳定,需要对每题进行多次运行,保留运行级结果。
  • 想比较两个系统,应尽量让它们面对相同题目和可比环境,并在分析中保留这种配对。
  • agent 任务若同时包含题目差异与运行随机性,最好把“题目之间”和“同题多次运行之间”的变异分开。

例如,两个 agent 各在 100 项任务上运行一次,得到 54% 与 50%,只反映一次任务样本和一次轨迹样本共同产生的结果。若每项任务运行五次,便可以进一步看出:甲是否在大多数任务上略微稳定地领先,还是仅在少数任务的某几次运行中取得了大量成功。相同平均分可能对应完全不同的可靠性。

6 / 6

显著性不等于差异有用

即使统计检验认为差异不太可能由当前抽样过程偶然产生,仍然需要判断差异大小和发生位置。十万道题上的 0.2 个百分点可能具有统计显著性,却未必抵得上更高的推理成本;一百道高风险任务上的两次额外失败可能不显著,却值得逐项审查。

反过来,“没有达到显著”也不等于两个模型相同。它可能表示样本太少、差异太小,或数据噪声太高,现有实验不足以区分。更有信息量的报告通常同时给出点估计、差值区间、样本量、逐题或分组结果,以及运行条件。统计检验回答证据强度,效果量回答差多少,任务分析回答差在哪里,这三者不能互相代替。

排行榜还涉及多重比较。如果同时测试二十个模型、十项 benchmark,并从许多组合中挑出最漂亮的一项,至少一次偶然“显著”的概率会增加。NLP 统计研究早已指出,多数据集、多算法比较需要处理这一问题。多重比较与可复现性分析

所以,看到 62% 对 60% 时,最先要确认的并非能否宣布胜负,而是这两个数字是否来自相同题目、相同版本和相同运行条件,是否保存了逐题结果,以及希望把结论推广到哪里。只有总分时,我们知道谁在这次汇总中领先;有了配对记录、重复运行和适合的区间估计,才开始知道这种领先有多稳、来自哪里,以及是否足以支持实际选择。