评测动态

01

9 月 30 日,JuryFlow 论文提交至 arXiv,提出一种由评审分歧引导的人机协同评测方法。它先把候选回答拆成原子主张,让多个不同的模型评审器逐项判断,再用评审结果的熵识别争议较大的主张。人类的工作不是重新标注整份回答,而是选择并解决一个关键争议;系统随后重新评审相关主张,把修正传播给结构相近的案例,并将其沉淀为后续评审器共用的评分规则。作者在 MT-Bench 和 LLMBar 上报告,该方法与金标的一致性高于单一评审器和多数票评审组。不过,当前公开页面只足以核实论文摘要所述的方法与作者报告的总体结果;完整实验条件、成本和增益幅度仍需结合论文正文判断,尚无独立复现。JuryFlow 论文页面

评测研读

1 / 5

Cohen’s kappa 为什么会在“九成一致”时仍给出不高的分数

评测团队经常要回答一个看似简单的问题:两名人工评审员,或者人工与模型评审器,对同一批回答的判断有多一致。最直观的办法是计算一致率。例如两位评审对 100 条回答分别标注“通过”或“不通过”,其中 90 条给出相同结论,观察一致率就是 90%。

问题在于,一部分一致可能来自标签分布本身。假如绝大多数样本都很容易被判为“通过”,两名评审即使没有真正掌握同一套边界,只要都倾向于选择多数标签,也能取得很高的一致率。Cohen’s kappa 试图扣除这部分按双方各自标签比例推算的偶然一致,因此常被称为经机会校正的一致性指标。它适用于两名评审对同一组对象进行分类的情形;计算式为 κ = (pₒ − pₑ) / (1 − pₑ),其中 pₒ 是实际观察到的一致率,pₑ 是根据两名评审各自的标签分布估计的期望一致率。scikit-learn 对 Cohen’s kappa 的定义与实现

假设评审 A 在 100 条样本中给出 80 个“通过”和 20 个“不通过”,评审 B 给出 70 个“通过”和 30 个“不通过”。如果只按双方的标签比例随机配对,两人在“通过”上预计有 0.8 × 0.7 = 56% 的一致,在“不通过”上预计有 0.2 × 0.3 = 6% 的一致,合计 pₑ = 62%。若实际一致率 pₒ 为 90%,则 κ = (0.90 − 0.62) / (1 − 0.62),约为 0.737。这个数字表达的不是“双方只在 73.7% 的样本上意见相同”,而是:实际一致超出期望一致的部分,占理论上仍可改善空间的约 73.7%。

这一校正让 kappa 比裸一致率多回答了一个问题:评审之间是否形成了超出各自标签偏好的共同判断。但它也引入了一个重要后果——相同的一致率,在不同标签分布下可能对应不同的 kappa。因而,两组项目即使都报告 90% 一致,也不能据此断定评审稳定性相同;反过来,两组 kappa 不同,也未必完全来自评审质量的变化。

2 / 5

当多数标签压倒性占优时,kappa 会发生什么

用一个教学假设观察极端情况。100 条样本中,真正需要仔细识别的“不通过”案例很少。评审 A 把 95 条判为通过、5 条判为不通过;评审 B 把 97 条判为通过、3 条判为不通过。两人对 94 条“通过”和2条“不通过”意见一致,总观察一致率达到 96%。

根据边际标签比例,期望一致率为 0.95 × 0.97 + 0.05 × 0.03 = 92.3%。代入公式,kappa 约为 0.48。于是,同一份结果同时可以诚实地描述为“一致率 96%”和“kappa 约 0.48”。前者说明绝大部分样本得到了相同标签,后者提醒我们:由于双方本来就几乎总在选择“通过”,96% 中有很大一部分并不能证明他们对少数困难案例拥有一致边界。

这类现象通常被称为 kappa 的流行率问题或高一致、低 kappa 悖论。这里的“流行率”指某个标签在样本中的占比,不是业务对象在现实世界中的真实发生率。相关研究指出,类别极度不平衡时,kappa 会受到边际分布显著影响;因此跨数据集比较 kappa 尤其困难,因为差异可能同时来自评审一致性和样本标签构成。关于高一致、低 kappa 现象的研究综述

这并不意味着 kappa 算错了。它准确执行了自己的定义:如果两名评审几乎总选同一个标签,按各自标签倾向计算出来的期望一致就会很高,留给“超出机会的一致”的空间自然较小。真正需要判断的是,这个机会模型是否适合当前用途。

例如,在一个上线前安全评测中,95% 的回答确实应该通过,剩余 5% 才是关键风险。高裸一致率能够说明大部分常规样本处理一致,却不能说明双方能够稳定识别风险样本;较低的 kappa 发出了有用警告。但若测试集是团队有意构造的高质量模型输出集合,“通过”占绝大多数并不意外,此时仅用 kappa 给整套评审规则贴上“不可靠”的标签,也会忽略数据构成。

3 / 5

一致性、正确性和可替代性是三个问题

kappa 衡量两名评审是否以相似方式分类,不判断他们是否正确。两名评审完全一致地误解评分规则,可以得到 κ = 1;一名严格遵循金标、另一名边界模糊的评审,kappa 则会下降。若研究问题是“模型评审器能否代替专家”,只计算模型与专家的一致性也不够:专家标签本身是否可靠、分歧样本如何裁决,以及哪些错误后果更严重,都需要独立说明。

这一区分也影响人工一致率的用途。标注项目在正式生产前计算两名标注员的 kappa,主要是在检查规则能否让不同的人形成一致判断;拿模型评审器与最终金标计算准确率,则是在检查模型能否复现被指定为正确的结果。两者可以使用相同的二分类表,却回答不同问题。计算模型与某一位标注员的 kappa,并不会自动把该标注员变成正确答案。

在模型评测中,还常见“人工与模型一致率高于人工之间一致率”的表述。这个结果可能有价值,但不能单独证明模型优于人工。模型可能更接近某一位标注员的标签偏好,也可能总是选择多数标签;不同人工配对面对的样本还可能不完全相同。需要在同一批样本上报告完整的配对结果,才能把差异归因于评审器,而不是题目或标签比例。

计算语言学关于标注一致性的系统综述还强调,不同一致性系数包含不同的机会模型和数据假设。Cohen’s kappa 面向两名评审;当评审人数更多、存在缺失标签,或标签具有顺序和距离时,Krippendorff’s alpha 等指标往往更便于表达相应结构。选择指标不能只看行业惯例,还要看标注设计实际产生了什么数据。计算语言学中的标注一致性综述

4 / 5

有序评分为什么需要加权 kappa

如果标签是“差、一般、好”三个等级,把所有分歧都当成同样严重可能不合适。一名评审给“差”、另一名给“一般”,与一人给“差”、另一人给“好”,都属于不一致,但后者通常意味着更大的规则分歧。加权 kappa 允许按等级距离给予不同惩罚;常见实现包括线性权重和二次权重。scikit-learn 的实现也把不加权、线性加权和二次加权列为不同设置。加权选项的实现说明

权重会改变被测对象。未经加权的 kappa 关注标签是否完全相同;加权 kappa 还承认“相邻等级的分歧小于跨级分歧”。因此,不能把两种结果放在同一列直接排名,也不能在看到更高的加权 kappa 后说评审员“更一致”而不说明权重。它可能只是说明多数分歧发生在相邻等级。

对于 1—5 分的主观评分,还需先判断这些数字是否真有稳定的顺序含义,以及相邻间隔能否视为相同。若“1 到 2”的差异与“4 到 5”的差异在评分规范中并不等价,二次权重只是方便的数学选择,未必对应业务后果。更稳妥的做法是先定义哪些错判可以容忍,再据此选择或构造权重。

5 / 5

一份可解释的一致性报告至少应同时展示什么

只报告一个 kappa,会把许多具有诊断价值的信息压成单一数字。对于二分类或少量类别,至少应同时给出样本量、混淆矩阵或交叉表、观察一致率、双方各自的标签分布以及 kappa。交叉表可以直接显示分歧方向:是评审 A 更容易判通过,还是双方都难以识别某一类样本。标签比例则解释期望一致率为何高或低。

还应按重要子集拆分结果。整体 kappa 可能很高,但在安全拒答、复杂工具调用或少数语言样本上很低;也可能因为某个大类别占据多数而掩盖其他问题。子集拆分不是为了寻找更漂亮的数字,而是为了定位规则在哪些边界上失效。样本较少时,相应结果的不确定性也更大,需要结合置信区间或重复抽样,而不宜把微小差异排成精确名次。

最后,应直接检查分歧样本。kappa 能提示“共同判断超出机会的程度”,不能解释分歧为什么发生。分歧可能来自评分规则含糊、证据不足、题目本身多解、评审注意力下降,也可能来自模型评审器的长度偏好、位置偏好或措辞敏感性。若只调整提示词直到 kappa 上升,却不阅读分歧案例,团队可能只是让两个评审更像,而没有让判断更接近任务真正需要的标准。

因此,kappa 最适合放在一组证据中使用:观察一致率说明实际相同标签的比例,标签分布说明任务构成,kappa说明扣除特定机会模型后的共同判断,分歧分析则说明规则和评审器需要如何改进。它不是人工评审质量的总分,也不是模型评审器可以替代人的单一门槛。