评测动态

01

10 月 6 日,OpenAI 公开了一批由内部模型生成的数学研究成果。配套仓库目前包含 722 篇手稿,归入 372 个结果族;同一结果族可能包括主要结论、辅助论证、推论或不同证明,因此手稿数不能直接理解成彼此独立的 722 次成功。OpenAI 表示,模型在评测期间收到约 4000 个问题,多数结果采用同一流程,每项结果平均使用约三小时 ChatGPT Pro thinking 等效计算量,随后经过汇总和重要性筛选才进入公开目录。OpenAI 的发布说明;成果仓库及生成流程

02

这批材料提供的是经过筛选的研究产物,并非具有固定分母、统一成功条件和完整失败记录的标准 benchmark。因而不能用 372 除以 4000 得到模型的“开放数学问题解决率”:问题难度并不一致,一个问题可能产生多个相关手稿,而“达到适当重要性”的入选条件也不是单纯的正确或错误判定。仓库明确说明,不同成果处于不同验证阶段,许多但并非全部手稿已有 Lean 形式化;尚未形式化的结果仍可能存在问题。Lean 文件可以提高部分证明在指定形式系统内的可检查性,但并不自动验证研究结论的新颖性、重要性或全部自然语言论述。这次公开更适合看作一种带真实研究产物的能力证据,以及对未来开放式科研评测应披露哪些材料的实例,而不是一项可以与竞赛数学准确率直接比较的分数。

评测研读

1 / 5

LLM-as-a-judge:裁判模型给出的分数究竟测到了什么

开放式回答往往没有唯一参考答案。假设两个模型都在解释一次软件故障:一个回答简短,准确指出根因和修复步骤;另一个包含同样的有效信息,却扩写成十段,并加入大量背景。字符串匹配无法判断哪一个更有帮助,人工逐条评阅又很昂贵,因此不少评测把问题、候选回答和评分规则交给另一个语言模型,让它选择较好的回答或给出分数。这就是通常所说的 LLM-as-a-judge。

裁判模型并不是摆在 benchmark 之外的辅助工具。它接收什么内容、按什么规则判断、使用哪个模型版本,以及如何把输出转换成结果,共同构成了测量方法。如果这些条件发生变化,即使被测模型生成了完全相同的回答,最终得分也可能改变。

2 / 5

成对比较、单答评分和参考答案引导测量的对象不同

较早系统研究这一方法的 MT-bench 工作区分了三种基本协议。成对比较把同一个问题及答案 A、答案 B 交给裁判,要求它选出较好的一方或判为平局;单答评分只展示一个答案,要求给出数值分数;参考答案引导则额外提供标准解答或裁判预先独立完成的解答。MT-bench 与 LLM-as-a-judge 论文

这三种结果不能简单互换。成对比较回答的是“A 和 B 在当前规则下谁更好”,不保证得到一个跨模型、跨时间稳定的绝对尺度。若有十个候选模型,完整比较的配对数量会快速增加。单答评分更容易扩展,但“7 分”取决于裁判如何理解量表;更换裁判模型或提示词后,分数基准可能整体移动。参考答案可以帮助裁判核查数学、代码或事实问题,却也可能把评测限制在参考解答覆盖的思路内。

以一道开放式编程解释题为教学假设例子:评分规则要求判断回答是否正确解释竞态条件、是否提出可行修复、是否引入新的安全风险。单答评分可以让每个答案分别获得 1—10 分,但两个都是 8 分的回答未必具有相同优缺点;成对比较更容易发现其中一个修复方案会降低吞吐量,却无法说明胜者离理想答案还有多远。若参考答案只描述加锁方案,裁判还可能低估使用消息队列重新设计流程的有效回答。这个例子不是 MT-bench 的真实题目,它说明的是协议如何改变裁判可以利用的证据。

3 / 5

位置与篇幅会进入分数,即使它们不是评测目标

理想的成对裁判在交换 A、B 的展示顺序后应作出相反位置、相同对象的选择。MT-bench 论文却发现,早期测试的多种裁判会偏向排在前面的回答。研究者采用的保守缓解方法是评判两次:第二次交换答案顺序,只有同一答案在两个顺序中都胜出时才判胜,否则记为平局。这个办法减少了由单一展示顺序造成的假胜负,但会增加调用成本,并把一部分真正细微的差异归入平局。

位置交换检验测到的是裁判的一致性,不是真实准确性。一个裁判完全可能在两个顺序下都稳定地选错。原论文中的少样本示例把 GPT-4 裁判的顺序一致性从 65.0%提高到 77.5%,作者同时明确指出,更高的一致性未必意味着更准确,而且更长提示使该实验的调用成本增加约四倍。后来针对位置偏差的系统研究也发现,偏差程度会随裁判、任务和候选答案质量差距变化,两个回答越接近,展示顺序越可能影响结果。位置偏差系统研究

篇幅同样可能被误当成质量。MT-bench 研究构造过一种“重复列表”测试:将原答案中的列表换一种说法重复一遍,不增加新信息,只让文本变长。如果裁判认为扩写后的版本更好,就说明它把冗长表象当成了价值。测试中的 GPT-4 比另外两个早期裁判稳健,但仍出现失败。这类实验的重要之处不在于得到一个永久有效的偏差比例,而在于展示了一种反事实检查:保持核心信息不变,只改变长度、顺序或署名,再看评分是否发生了不应有的变化。

因此,一条“由 GPT-4 评分”的说明远远不足以复现实验。至少还需要知道裁判的具体版本、系统提示与评分规则、答案顺序是否随机或交换、是否提供参考答案、温度与重复次数,以及无效格式和平局如何处理。这里的裁判模型、提示模板和结果解析程序合在一起,才是完整的评分器。

4 / 5

与人工一致不等于判定了客观正确性

MT-bench 论文报告,在其专家票和众包偏好数据上,经过相应处理的 GPT-4 裁判与人工判断的一致率超过 80%,接近该实验中的人际一致水平。这个数字支持的结论是:在那组问题、候选回答、提示和人工偏好定义下,裁判经常能够复现人类选择。它并不意味着裁判对任意任务都有 80%以上的事实判定准确率,也不意味着其余分歧一定是裁判错误。

人工偏好本身可能存在合理分歧。例如,一位评审重视简洁,另一位更看重背景解释;两人选择不同答案,不必有一人犯错。相反,在具有可验证答案的数学题中,人类和裁判也可能一致接受一段看似流畅却含有关键计算错误的推导。评测设计必须先说明目标究竟是预测用户偏好、检查事实正确性、核对约束,还是衡量某种写作品质,随后才能选择适当的人工验证标准。

原论文还在一个规模很小的数学判分实验中比较了不同提示:默认裁判把错误答案判为正确的情况为 14/20;要求裁判先推理后评判降至 6/20;提供独立参考解答后降至 3/20。这个结果说明参考信息在该实验中确实有帮助,同时也显示“裁判本身会做这道题”并不足以保证它能正确审查别人的推理。候选答案可能把裁判带入同一条错误路径,而参考答案的质量又会成为新的依赖条件。

5 / 5

裁判分数是复合测量结果

使用裁判模型时,被测对象不再只是候选模型。观察到的结果同时包含候选回答的质量、裁判模型的能力与偏好、评分规则对“好”的定义、输入排列方式,以及参考资料和解析程序的影响。两个榜单即使使用同一批问题,只要裁判版本或协议不同,其分数也不天然处于同一尺度。

较可靠的做法是让验证方法与评测目标对应。事实或代码任务可以引入可执行测试、检索证据或经过核验的参考答案;主观写作任务可以用有明确边界的评分规则,并抽取有代表性的样本与多名人工评审比较;成对评测可以交换顺序,检查结论是否稳定;预计存在篇幅偏好时,可以加入信息不变、长度变化的反事实样本。人工审查还应覆盖裁判最不确定、顺序不一致或不同裁判互相冲突的案例,而不只随机查看容易判断的回答。

裁判解释也不能自动当成评分正确的证据。语言模型可以为受位置或篇幅影响的选择生成一段连贯理由。解释的价值在于帮助研究者定位评分规则和具体分歧,真正验证裁判仍需要独立证据:可执行结果、可靠参考答案、人工复核,或针对可疑偏差设计的对照实验。

所以,LLM-as-a-judge 最适合被理解为一种可扩展的测量仪器。它能降低开放式评测的边际成本,并把难以字符串匹配的质量差异转化为可分析结果;但仪器需要校准,输出也必须连同使用条件解释。单独公布一个裁判分数,无法区分模型质量提高、裁判尺度改变,还是提示与排列方式带来的变化。