评测动态

01

截至本次检索,未发现需要单列的重要评测更新。过去 72 小时公开的新材料中,尚未找到同时具备明确事件日期、可核查方法说明和足够认识增量的 benchmark、评分机制或独立复现;因此不把只有摘要、重复榜单数字或缺少实验条件的材料包装成新动态。arXiv 计算与语言近期提交列表

评测研读

1 / 7

校准测量什么:模型说“有八成把握”时,怎样判断这句话是否可信

准确率只统计模型最终答对了多少题。如果两个模型在 100 道选择题上都答对 70 道,它们的准确率同为 70%;但第一个模型对每道题都声称有 70% 把握,第二个模型无论对错都声称有 99% 把握,两者提供给使用者的信息并不相同。校准(calibration)关注的正是概率与实际正确频率之间的对应关系。

理想情况下,在模型给出约 80% 置信度的一组预测中,长期观察应有约 80% 正确。这里的校准是分组意义上的统计性质,不保证任何一道具体题有一个可验证的“80% 正确状态”。单题最终只有答对或答错;只有把大量具有相近预测置信度的样本放在一起,才可能检查模型表达的概率是否符合经验频率。

用一个教学假设说明。某模型完成 1000 道选择题,其中有 100 道题的置信度落在 0.75 至 0.85。若这 100 道中有 79 道答对,那么这一组预测的平均置信度假设为 0.80,实际准确率为 0.79,两者相差 0.01,可以说该区间较为校准。若只答对 50 道,模型在这一组上便明显过度自信;若答对 95 道,则表现为置信不足。

准确率与校准因此不是互相替代的指标。一个始终输出“70%”的模型,在总体准确率恰好为 70% 时可能取得很好的整体校准,却没有区分简单题与困难题。另一个模型能够把容易题和困难题分开,但概率普遍偏高,也可能具有更强的排序能力和较差的校准。评价置信度是否有用,需要同时观察正确性、校准情况以及概率能否有效区分不同风险。《On Calibration of Modern Neural Networks》对校准问题的定义

2 / 7

ECE 怎样把可靠性图压缩成一个数字

可靠性图(reliability diagram)通常先把预测按置信度分箱。例如把 0 至 1 划成十个区间,再计算每个箱中的平均置信度和实际准确率。若模型校准良好,各箱结果应靠近“置信度等于准确率”的对角线。图形能够展示模型在哪些置信度区域过度自信或信心不足,也能显示样本主要集中在哪些区间。

预期校准误差(Expected Calibration Error,ECE)进一步把这些差距汇总为一个数字。常见算法对每个箱计算平均置信度与准确率之差的绝对值,再按照该箱的样本数量加权平均。HELM 的实现中便包含十箱 ECE,描述为模型平均置信度与准确率之间差异的加权汇总。HELM 的校准指标实现

假设一项测试只有两个置信度箱。第一箱包含 80 道题,平均置信度为 0.90,准确率为 0.75,差距为 0.15;第二箱包含 20 道题,平均置信度为 0.60,准确率为 0.50,差距为 0.10。ECE 为 0.8 × 0.15 + 0.2 × 0.10,即 0.14。它表示按照样本量加权后,各置信度组的平均绝对偏差为 14 个百分点,不能解释成“模型有 14% 的答案错误”;后者属于准确率问题。

ECE 易读,却依赖分箱方式。同一批预测使用五个箱、十个箱或按样本数量自适应分箱,可能得到不同结果。箱太宽时,内部不同方向的误差可能互相抵消:同一箱中,一部分预测置信度过高,另一部分过低,箱的平均值却恰好接近准确率。箱太窄时,每箱样本减少,经验准确率又会出现较大抽样波动。

这意味着 ECE 不是一个脱离实现细节的固定属性。比较两份结果时,需要确认置信度怎样取得、使用多少个箱、箱的边界如何确定,以及空箱和边界值怎样处理。只看到“ECE 为 0.03”,还不能判断它是否优于另一篇报告中的 0.04。

样本量同样重要。假设 0.9 至 1.0 的箱里只有两道题,一对一错,那么该箱准确率为 50%,看起来与高置信度严重不符;但两道样本不足以稳定估计这一范围的长期正确率。可靠性图和 ECE 都是测试集上的估计,模型在稀少区间或重要子集上的校准情况,最好配合样本数、不确定性范围或重复抽样查看。

3 / 7

Brier score 为什么不仅检查“平均上是否说得准”

ECE 主要比较分组后的置信度与正确频率。Brier score 则逐个样本计算预测概率与实际结果之间的平方误差。在二分类问题中,若事件实际发生记为 1、没有发生记为 0,预测概率为 \(p\),单个样本的损失就是 \((p-y)^2\),最后对全部样本取平均;分数越低越好。

假设两个模型都预测错误。模型 A 对错误答案给出 0.99 的正确概率,单题损失约为 0.9801;模型 B 给出 0.60,损失为 0.36。两者在准确率中都只记一次错误,Brier score 则对极度自信的错误施加更大惩罚。相反,若答案正确,0.99 的损失约为 0.0001,0.60 的损失为 0.16。

Brier score 是严格适当评分规则:在相应统计假设下,报告真实概率能够获得最低的期望损失。它减少了评测对象通过随意夸大或压低置信度来系统性获利的空间。不过,Brier score 同时受到校准、区分能力和数据本身不确定性的影响,不能把它直接称为“纯校准误差”。两个模型即使校准程度相近,能够更好地区分容易与困难样本的模型也可能得到更好的 Brier score。scikit-learn 对 Brier score 及其性质的说明

可以再次比较两个极端模型。测试集准确率为 70%,模型 A 对所有题一律输出 0.70;模型 B 对最终答对的多数题给出较高概率,对容易答错的题给出较低概率。只要 A 的测试总体频率与 0.70 对上,它的整体校准可以很好,但它没有提供题目层面的风险差异。B 的概率若略有系统偏差,ECE 可能较差,却仍能把许多高风险题排在前面。Brier score会同时反映这两种因素,而一张可靠性图更适合显示偏差发生在哪些概率区域。

因此,ECE、Brier score和可靠性图不宜互相替代。ECE便于概括分箱后的平均偏差;可靠性图保留误差方向及概率分布;Brier score评价逐题概率预测,并奖励有用的区分能力。三者一起阅读,往往比寻找唯一的“最佳校准指标”更有解释力。

4 / 7

语言模型的“置信度”从哪里来

在传统分类器中,模型通常直接输出每个类别的概率。语言模型的开放式回答则更复杂。模型可能输出一句自然语言答案、一个长篇推理过程或多种等价表述;“整份回答正确的概率”并不天然等于某个 token 的生成概率。

对于选择题,一种做法是取得各候选答案对应的模型概率并归一化。即便如此,实现仍会改变测量对象:使用选项字母的概率,可能受到字母 token、提示格式与位置偏好的影响;使用完整答案文字的序列概率,又会受到长度和分词方式影响。若模型先生成解释再输出选项,最终选项的条件概率还包含了前文推理轨迹带来的影响。

开放问答中常见的另一种方法,是要求模型直接报告“我有 80% 把握”,或让它判断自己是否知道答案。这种口头置信度是模型生成的文本,不等同于底层输出分布的原始概率。它可能受到提示措辞、数字偏好、对齐训练和示例的影响。语言模型确实可以学习提供有信息量的自我判断,但研究同时发现,这类判断迁移到新任务时可能失去良好校准。语言模型在问答中的校准研究

还可以多次采样回答,用答案的一致程度估计信心。例如十次生成中八次得到同一答案,便把一致率当作一种置信信号。但这仍不等于 80% 的正确概率:模型可能稳定地重复同一个错误,表达不同但语义相同的答案也需要先正确聚类。采样温度、次数和答案归一化方法都会改变结果。

对代码或 agent 任务,置信度的对象更难界定。是模型认为下一步工具调用正确的概率,整条轨迹成功的概率,还是在允许重试后最终完成任务的概率?一个 agent 可能非常确定地完成前九步,在最后一步失败;若只平均每步信心,便不能自然得到任务级成功概率。报告校准成绩前,需要先说明预测事件究竟是什么,以及正确性如何判定。

5 / 7

温度缩放修正了什么,又没有修正什么

温度缩放(temperature scaling)是常见的事后校准方法。它在保留模型各类别排序的情况下,用一个在验证集上学习的温度参数重新调整 logits。温度大于 1 通常使概率分布更平缓,降低过度自信;温度小于 1 则使其更尖锐。经典实验发现,这种只有一个参数的方法在多种神经网络分类任务上能够显著改善校准。温度缩放的方法与实验

它修正的是概率刻度,不会让原本排错的答案变正确。由于统一缩放通常不改变最大概率类别,分类准确率和类别排序可以保持不变,而 ECE 或负对数似然得到改善。这正好说明准确率与校准是两个可分离的问题。

温度参数必须在独立校准集或验证集上拟合。如果直接在最终测试集上选择使 ECE 最低的温度,再在同一测试集报告结果,就把测试信息用于调参,容易高估对未来数据的效果。比较校准前后的模型时,还要说明校准数据量、数据来源以及它与测试分布的关系。

分布变化也是关键限制。一个模型可能在普通问答数据上校准良好,进入医学问题、另一种语言或更困难的题集后变得过度自信。单个全局温度只能做统一调整,未必能够同时修复不同任务和子群体的误差。对跨领域部署而言,“已校准”应理解为在明确数据条件下观察到的性质,而不是永久附着在模型版本上的认证。

6 / 7

校准良好仍不等于置信度有实际价值

考虑一个准确率为 60% 的模型。如果它对所有题都报告 60%,那么在整个测试集上可能完美校准;但使用者无法依据置信度选择哪些回答可以直接采用、哪些应交给人工。它的概率真实,却不够有区分力。这种区别有时称为校准与锐度、分辨率或信息量之间的差异。

真正用于分流的置信度通常还需要支持选择性预测(selective prediction):系统只回答高信心案例,把其余案例拒答或转交人工。评测时可以逐步提高接收阈值,观察覆盖率下降后,保留下来的答案错误率是否同步降低。如果模型的高置信度案例确实更可靠,它便能够在“处理更多任务”和“降低错误率”之间提供可控的工作点。

这里不能只看高阈值下的准确率。阈值设得极高、只保留一道最简单的题,也可能取得 100% 准确率,却几乎没有处理能力。需要同时报告覆盖率,也就是系统实际接收了多少样本。不同模型只有在相同覆盖率或相同风险条件下比较,结论才较清楚。

校准指标还可能掩盖子群体问题。总体上“80% 置信度对应 80% 正确”可能由两个方向相反的群体平均而来:英语问题实际正确率 90%,低资源语言问题只有 60%。若使用者据此对所有语言采用同一自动处理阈值,局部风险会被总体平均值隐藏。按任务、难度、语言和风险类型拆分可靠性图,往往比单一全局 ECE 更接近部署问题。

7 / 7

阅读一项校准结果时,哪些条件决定它能说明什么

首先要确认被校准的事件。选择题答案正确、开放回答完全正确、某项主张有证据支持,以及 agent 最终完成任务,都是不同事件;它们需要不同的标签和概率构造方式。

其次要确认置信度来源。候选答案概率、完整序列概率、模型口头自报、多次采样一致率和额外训练的验证器不能只写成同一个“confidence”。来源不同,分数衡量的系统组件也不同。

然后要核对指标实现。ECE 需要说明箱数和分箱策略;Brier score需要说明类别编码与多分类形式;可靠性图需要展示各区间样本数。若使用温度缩放或其他再校准方法,还应说明参数在哪一批数据上拟合。

最后要把校准与正确率、区分能力和覆盖率分开报告。校准回答“概率刻度是否可信”,准确率回答“最终答对多少”,排序或分辨能力回答“能否识别更可能正确的案例”,覆盖率—风险曲线回答“允许系统拒答时,可以形成怎样的使用边界”。任何一个数字都无法替代其余问题。

模型说“我有八成把握”只有在事件定义、置信度来源、评分方法和适用数据都明确时,才成为可以检验的评测对象。良好校准并不证明回答正确,也不保证模型知道哪些题最难;它提供的是另一层信息:当系统用概率表达不确定性时,这种表达在已测条件下能否对应真实发生频率。