评测动态

01

截至本次检索,未发现需要单列的重要评测更新。部分在线榜单已经出现新的模型名称或成绩,但页面没有标注对应测试日期、版本变更和新增运行条件,无法将这些变化可靠地归入过去 24—72 小时,因此本期不把它们包装成最新进展。

评测研读

1 / 1

准确率之外,置信度校准在测什么:从 Brier 分数到 ECE

假设两个模型都答对了 80% 的题。第一个模型在每道题后都说“我有八成把握”;第二个模型无论答案对错都声称有 99% 把握。它们的准确率相同,但用于实际决策时并不等价:如果系统只在置信度较低时转交人工,第一个模型的概率至少可能成为有意义的风险信号,第二个模型则会把错误答案一并放行。

置信度校准(confidence calibration)测量的正是预测概率与实际正确频率之间的对应关系。经典定义是:在大量置信度为 80% 的预测中,约有 80% 应当正确。它不要求某一道题的“真实正确概率”能够被直接观察,而是观察一组同等置信度预测的长期频率。置信度和正确率接近的模型称为校准较好;平均置信度高于正确率是过度自信,反之则是信心不足。校准的定义与可靠性图方法

这里的“置信度”首先需要明确来源。对于能够访问内部输出的分类模型,可以从各候选类别的 logits 经过 softmax 得到概率。面对封闭的聊天模型,研究者通常拿不到完整 logits,只能在提示中要求模型直接报告一个数字。2026 年发布的 ConfidenceBench 就采用后一种方法:模型回答四选一问题,同时给出自己的置信度,因此开放模型和闭源 API 可以使用同一种接口接受测试。ConfidenceBench 论文摘要

这种口头报告的置信度并不等同于模型内部概率。提示措辞、允许的数值范围、是否要求解释,以及模型学到的表达习惯,都可能改变报告值。一个模型也可能知道自己不确定,却习惯输出整数档位,或者为了显得有帮助而系统性报高。因此,这类评测实际测量的是“在指定提示下,模型给出的置信度能否预测答案正确性”,不能直接证明数值忠实还原了模型内部的不确定性。

ConfidenceBench 使用 Brier 分数评估这一结果。在只考察“模型选中的答案最终是否正确”时,可以把正确记为 1、错误记为 0;模型报告的正确概率记为 \(p\)。每道题的损失是 \((p-y)^2\),最后取所有题目的平均值,数值越低越好。答对并报 90% 的损失是 \((0.9-1)^2=0.01\);答错却报 90%,损失变成 \((0.9-0)^2=0.81\)。它由此强烈惩罚自信的错误。ConfidenceBench 对 Brier 分数的说明

仍用一个教学假设例子:模型在十道题中答对八道,并且每题都报 80% 置信度。八道正确题各产生 0.04 的损失,两道错误题各产生 0.64,平均 Brier 分数为 0.16。如果另一个模型也答对八道,却全部报告 99%,其平均分约为 0.196。两者准确率相同,后者的 Brier 分数更差,因为它没有给错误留下与实际频率相称的概率空间。

Brier 分数同时受正确率和概率质量影响。一个模型如果答得更多,通常也有机会得到更低的 Brier 分数;所以它并不是剥离准确率后的纯校准指标。零分更是一个联合结果:模型必须全部答对并对正确答案给出完全置信。比较模型时,最好同时查看准确率和 Brier 分数,不能把最低 Brier 分数简单改写成“最了解自己何时会错”。

“适当评分规则”(proper scoring rule)是 Brier 分数的重要性质。在标准概率假设下,预测者若想最小化长期期望损失,最有利的策略是报告自己的真实概率,而不是把所有数值故意压向 50%,或只在有把握时夸大置信度。这说明评分公式具有鼓励诚实概率报告的数学结构,但它不保证语言模型真的拥有稳定、可直接表达的主观概率;后者仍取决于置信度的提取方式和运行设置。

另一种常见做法是可靠性图。评测者把预测按置信度分桶,例如分成 50%—60%、60%—70%和70%—80%等区间,再比较每个桶的平均置信度与真实正确率。如果一个桶的平均置信度为 75%,实际却只有 55% 的题答对,该区间便表现出约 20 个百分点的过度自信。理想情况下,各区间应靠近“置信度等于正确率”的对角线。可靠性图的构造方法

预期校准误差(Expected Calibration Error,ECE)进一步把可靠性图压缩成一个数字:计算每个置信度区间中正确率与平均置信度的差,再按该区间的样本数量加权平均。ECE 越低,表示分桶后观察到的平均偏差越小。不过,它依赖分桶数量和边界。同一批预测采用十个桶或十五个桶,可能得到不同结果;样本少时,一些高置信度区间只有寥寥几题,估计也会很不稳定。因此,ECE 需要与样本量、分桶方法和可靠性图一起解释。ECE 的定义与计算

校准还可以在不改变答案排序的情况下改善。温度缩放(temperature scaling)在独立验证集上学习一个参数,用它统一调整 logits 的尖锐程度。温度大于 1 时,softmax 概率通常变得平缓;由于所有类别使用同一个温度,最大 logit 对应的类别不变,准确率也不变,但报告概率可能更接近实际频率。这说明“模型会不会答”和“系统怎样解释模型分数”可以分别优化。温度缩放的机制与实验

不过,校准不是一个跨环境永久成立的模型属性。若验证集主要是常见知识题,而实际输入变成专业医学问题,原先校准过的 80% 未必仍对应八成正确;提示模板、采样设置和模型版本变化也可能重新改变置信度。Stanford HELM 的实验曾发现,提示适配方式甚至会改变准确率与校准之间的关系,这也是比较结果时需要固定运行方法的原因。HELM 对准确率、校准与提示方法的讨论

ConfidenceBench 提供了一个更细的版本核查案例。其论文摘要称 benchmark 包含 200 道私有题目,而当前项目首页正文写的是 100 道;首页榜单又列出了论文发表后出现的更多模型,但没有在可见页面中交代数据版本和各次测试日期。论文记录与项目当前页面之间的这些差异,使公开读者无法仅凭模型名称和分数确认各行是否来自完全相同的题集与运行协议。私有题集有助于降低数据泄漏,却也让版本记录、重复运行和方法说明变得更加重要。

因此,置信度评测回答的并非泛泛的“模型是否值得信任”,而是更窄的问题:在指定题目分布和置信度提取方法下,模型报告的概率能否预示答案的正确频率。Brier 分数适合联合评价正确性与概率质量,可靠性图和 ECE 更直接地展示置信度与正确率的对应偏差。若要根据置信度设置人工复核阈值,还需要在接近真实任务的数据上重新评测,并观察阈值两侧分别保留了多少正确答案和错误答案。