评测动态

01

9 月 28 日,SecondState 公开 FAB(Finance Agents Benchmark),把财务尽职调查设计成一项端到端 agent 评测。当前版本围绕一家虚构公司建立数据室,包含 50 项任务、160 份文档和 231 条评分标准,同时提供执行 harness。首批实验让四个模型各运行三次,共产生 600 条完整轨迹。一次任务只有在全部评分标准都通过时才算成功,因此各模型 76.2%—83.4% 的标准通过率,最终只对应 47.3%—60.0% 的任务通过率。这个差距展示了“多数步骤正确”和“完整交付可靠结果”是两种不同测量对象。公开结果由 gpt-6-luna 担任模型裁判,且任务目前只覆盖一个合成公司;模型排名仍受裁判、任务构成和运行框架限制。FAB 项目仓库与首批结果

02

北京时间 9 月 26 日,Kaggle 与 Google DeepMind 团队提交了 Game Arena 技术报告,将此前开展的国际象棋、双人无限注德州扑克和狼人杀实验整理为统一的竞争式评测框架。三个环境分别代表完全信息、不完全信息和多人非对称信息;模型接收文本化的游戏状态与历史,输出受规则约束的行动,环境负责验证动作、推进状态并判定胜负。这里的评分不需要另一模型判断回答“听起来是否更好”,但也并非天然客观:提示格式、非法动作处理、扑克发牌与复赛设计、狼人杀角色和平衡规则,都会改变被测系统实际面对的任务。技术报告由项目团队自行发布,其可复现性和跨游戏解释尚不能视为独立验证结果。Game Arena 技术报告

评测研读

1 / 1

MT-Bench 的模型裁判究竟在测什么:从开放式回答到可比较分数

选择题有预先确定的正确选项,代码可以运行测试,游戏可以按照规则产生胜负。开放式对话的判分更困难。面对“解释失业率与通胀的关系”“把这段说明改写给五岁儿童”或“写一篇有吸引力的旅行文章”,合理回答不止一种,文字与参考答案不相似也可能完全正确。BLEU、ROUGE 一类文本重合指标难以同时判断事实准确性、指令遵循、内容深度和表达质量。

MT-Bench 是早期系统化使用“模型裁判”(LLM-as-a-judge)的代表性工作。它包含 80 道人工设计的双轮对话题,分为写作、角色扮演、信息提取、推理、数学、编程、理工知识及人文社会知识八类,每类十题。第二轮通常建立在第一轮回答之上,例如先要求撰写旅行文章,再要求把前文改成每句以同一个字母开头。这使评测既观察单次生成,也检查模型是否保留上下文并执行后续修改要求。MT-Bench 论文中的任务设计

被测模型先完成全部对话。默认判分方式随后把问题、对话历史和模型回答交给 GPT-4,由裁判针对每一轮给出 1—10 分,最终对 80 道题的 160 个轮次取平均。判分提示要求考虑帮助性、相关性、准确性、深度、创造性和细节;数学题可另外向裁判提供参考解答。项目也支持成对比较:裁判同时看到两个模型的回答,选择 A、B 或平局;还可以让所有模型两两比较,或者只和一个基线模型比较。FastChat 的 MT-Bench 运行与评分说明 实际裁判提示模板

假设有一道教学用例:“用三句话向非专业读者解释量化误差,并给出一个生活类比。”回答甲准确完成三句话,但较简洁;回答乙写了八段,包含更多背景,却违反长度要求,并有一个技术错误。单答案评分要求裁判把不同质量维度压缩成一个数字。成对比较只需判断哪份回答更好,通常更容易识别细微差异,却产生另一项代价:模型数量增加时,可能的配对数按平方增长。如果只与固定基线比较,结果又会依赖基线的强弱和风格。

因此,MT-Bench 的 8 分不能解释成“答对了 80%”。它表示特定裁判模型按照特定提示,对这一组回答给出的平均等级。裁判版本、提示模板、参考答案、对话模板和被测模型的生成设置发生变化,数字的刻度都可能漂移。两个模型只有在题集、生成条件和裁判配置一致时,其分差才具有较清楚的比较意义;跨榜单看到相同的“MT-Bench 分数”,仍需确认这些条件。

模型裁判的吸引力在于成本和速度。开放式回答原本需要大量人工阅读,模型却可以自动处理数百或数千条结果,并同时输出判分理由。原论文使用六个被测模型,在 MT-Bench 上收集约 3000 份专家投票;另从 Chatbot Arena 的约 3 万条记录中抽取 3000 票进行比较。在剔除平局的设置中,GPT-4 与人类专家在 MT-Bench 上的选择一致率为 85%,人类之间为 81%;在抽取的 Arena 数据上,GPT-4 与人类的一致率为 87%。这些数字支持“当时的 GPT-4 经常能近似这批标注者的偏好”,但不证明它拥有独立于人的正确性标准,也不保证同样结果适用于新的领域、语言或更接近的模型。论文的人工一致性实验

“一致率”本身也带有条件。论文的较高数字只计算双方均给出明确胜负的样本;若把平局和交换位置后结论不一致的情况纳入,数值明显降低。模型差距越大,裁判与人越容易达成一致;两个回答质量接近时,位置、篇幅和措辞更可能左右结果。因而,高总体一致率可能同时包含大量容易判断的样本,不能直接说明裁判足以可靠区分榜单上只差零点几分的模型。

位置偏差是成对判分的具体风险。原研究把两个相似回答交换先后次序后,GPT-4 裁判仅在约 65% 的案例中保持相同结论,并明显更常选择放在第一位的答案。论文采用的保守处理是判两次:先按 A、B 顺序,再交换为 B、A;只有同一个回答在两种顺序下都获胜时才记为胜出,否则视为平局。这能减少位置影响,但会增加一倍判分调用,也会增加平局。位置偏差实验与交换顺序方法

冗长偏差则说明“更详细”可能被误当成“更好”。研究者从 23 个带编号列表的回答出发,在不增加新信息的情况下重复改写原有条目,制造内容更长但没有更高信息量的版本。GPT-4 在其中 8.7% 的案例里错误偏好重复版本;较弱的两种裁判在这项攻击中的失败率都超过 90%。这项小实验不能给出现代裁判的通用偏差率,却清楚说明:裁判提示中即使写着“不要受长度影响”,也不代表影响已经消失。冗长偏差实验

裁判还必须具备它要检验的能力。原论文让 GPT-4 判断十道数学题中的两组回答,并交换答案位置,共形成 20 次判断。普通提示下,裁判有 14 次把错误答案判为正确;要求它先自行推理后,失败降至 6 次;提供独立参考答案后降至 3 次。样本规模很小,不能据此估计普遍错误率,但机制值得注意:裁判如果自己不会解题,流畅的错误回答就可能影响其判断;参考解答可以提供锚点,却又把参考解答的错误带入最终评分。参考引导判分实验

这也解释了人工偏好评测与模型裁判之间的边界。Chatbot Arena 让用户同时与两个匿名模型交互,再选择更喜欢的一方;它测量的是特定用户、问题分布和界面条件下的相对偏好。MT-Bench 用固定题目和固定裁判提高重复性,测量的是裁判准则下的表现。前者更接近真实使用中的选择,但样本构成会随参与者变化;后者便于快速回归测试,却可能把裁判的风格偏好固化为分数。二者都不等同于事实正确率,也不能独自覆盖安全性、稳定性和业务完成质量。

阅读模型裁判产生的榜单时,最关键的信息不是“裁判是不是 AI”,而是判分协议:裁判看到了哪些上下文和参考材料,采用单答案分数还是成对比较,是否交换答案位置,如何处理平局与格式错误,使用哪个裁判版本,以及是否用独立人工样本验证过一致性。模型裁判把难以自动处理的开放式回答转化成可重复实验,但它本身也是一套需要评测的测量系统。