评测动态

01

截至本次检索,未发现需要单列的重要评测更新。过去几天能够核实的公开材料主要仍是已有 benchmark 的榜单增补和模型成绩更新,但缺少明确的运行日期、版本变更或方法说明,本期不将其包装成新事件。

评测研读

1 / 1

MMLU-Pro 如何改造 MMLU:十个选项只是变化的一部分

MMLU 是模型评测中最常见的综合知识 benchmark 之一。它包含数学、美国历史、计算机科学、法律、医学、哲学等57个科目,题目难度从基础教育延伸至专业考试。每道题提供四个选项和一个标准答案,评测模型能否在广泛学科中调取知识并完成必要的问题求解。MMLU 原始论文

原始论文评测 GPT-3 时,会在提示开头说明当前科目,并在 few-shot 设置中提供最多五道带答案的示例。模型不需要写解释;harness 读取 A、B、C、D 四个答案字母的 token 概率,概率最高者作为预测,最终指标是答对题目的比例。随机选择四个选项的期望准确率为25%。MMLU 的提示与判分方法

例如,一道教学假设题询问:“某公司收入增加10%,成本增加20%,原本收入和成本相等,利润率如何变化?”模型收到题目和四个候选结论,从中选择一个字母。只要字母与标签一致便得一分,理由是否正确、有没有通过错误推导碰巧选中答案,都不影响分数。这个例子并非 MMLU 的实际样本,但反映了多项选择评测的基本信息边界:准确率记录选择结果,不直接验证推理过程。

MMLU-Pro 于2024年提出,目标是缓解 MMLU 逐渐饱和、题目偏简单以及模型分数容易受提示措辞影响的问题。它将57个原始科目合并为14个较宽的学科类别,共收录12,032道题。约56.6%的题目来自经过处理的 MMLU,其余主要来自 STEM 网站、TheoremQA 和 SciBench。因此,MMLU-Pro 不是给原有 MMLU 题目统一增加六个选项;它同时改变了题目集合、学科权重和问题来源。MMLU-Pro 的构成与来源

构造团队首先用八个当时的模型筛选原始 MMLU,包括 Llama 2 的7B和13B基础及聊天版本、Mistral-7B、Gemma-7B、Yi-6B及其聊天版本。一道题如果被其中超过四个模型答对,就被视为过于简单;这一过程共移除5,886道题。这样的筛选提高了剩余集合对当时模型的难度,但“难题”由一组特定模型的表现定义。后来的模型如果采用不同训练数据或推理方法,题目难度结构可能随之变化。论文的初始筛选方法

新增题目原本也不一定是多项选择格式。对于只提供问题和解答的材料,团队使用 GPT-4-Turbo 提取简短答案并生成干扰项,再由人工检查提取结果。随后,GPT-4-Turbo 又被用于把四个选项扩展到十个。十选一使纯随机命中的期望值从25%降至约10%,而更多相近选项也可能要求模型进行更细的概念区分。

不过,最终数据并非每道题都有十个选项。专家审查发现,一些生成的干扰项其实也是正确答案,即论文所说的“假阴性选项”;删除这些选项后,83%的题目保留十个选项,17%的题目少于十个,平均每题9.47个。专家还移除了答案错误、信息不足、依赖图片或表格,以及不适合改造成选择题的问题。选项扩充与专家审查

这项处理说明,干扰项并非无关紧要的装饰。同一个问题如果只有一个明显正确答案和三个荒谬选项,模型可能靠排除法作答;增加六个合理但错误的选项后,题目测量的能力就发生了变化。模型需要区分更接近的概念、数值或推导结果。与此同时,干扰项由特定模型生成,也可能携带该模型偏好的措辞和错误模式,人工核验主要保证选项确实错误,不能保证所有错误选项具有完全相同的迷惑性。

MMLU-Pro 的官方实验使用五样本思维链提示:每个学科先提供五个带推理过程的示例,再要求模型逐步思考,并以指定格式输出最终字母。论文报告,GPT-4o 在 MMLU 上采用思维链相较直接回答只提高1.5个百分点,在 MMLU-Pro 上则提高19.1个百分点;GPT-4-Turbo 在两套数据上的变化分别为下降0.2和提高15.3个百分点。作者把这种差异作为 MMLU-Pro 更依赖推理的证据。思维链与直接回答的实验比较

这一结果可以说明思维链提示在 MMLU-Pro 的题目上更有帮助,但不能据此逐题证明模型执行了忠实推理。更难的计算题通常能从额外生成空间中受益;提示中的示范答案也可能帮助模型熟悉输出协议。比较成绩时需要确认使用直接回答还是思维链、提供几个示例、最大生成长度多大,以及推理模型是否使用了额外计算预算。一个“67分的 MMLU-Pro”若缺少这些条件,还不足以和另一张榜单上的67分直接对齐。

论文主表本身也包含一项可比性例外:多数模型使用五样本提示,Gemini 1.5 Pro 和 Gemini 1.5 Flash 因实验条件限制使用零样本。表中的模型名称和总分排列在一起,但输入条件并未完全统一。它们仍可作为当时的实验记录,若要精确解释模型差距,就需要把示例数量差异纳入考虑。论文的模型成绩与运行说明

生成式评测还需要从整段输出中提取答案。MMLU-Pro 论文先用正则表达式寻找类似“answer is (A)”的格式,再尝试第二种表达;两次均提取失败时,官方实验会从候选项中随机选择一个答案。对十选一题目而言,这使格式完全失败的输出仍有约十分之一概率偶然得分。若另一个 harness 把解析失败直接记为错误,两个实现即使使用同一模型和题集,也可能产生不同结果。官方答案抽取和回退规则

研究团队还使用24种合理的提示措辞测试稳定性。论文报告,各模型在 MMLU 上的成绩范围通常相差4—5个百分点,最高达到10.98个百分点;在 MMLU-Pro 上通常约为2个百分点,最高为3.74个百分点。这个结果支持 MMLU-Pro 在所测模型和提示集合中对措辞变化更稳定,但不能自动推广到所有聊天模板、语言或推理设置。提示变化实验

MMLU 与 MMLU-Pro 的分数不能理解为同一把尺子上的简单升级。前者覆盖57个较细科目,以四选一和短输出衡量广泛的学术与专业知识;后者重新筛选和补充题目,合并为14类,使用更多干扰项,并在官方设置中加入五样本思维链。MMLU-Pro 得分下降,既可能来自题目更难,也受到选项数量、学科构成、提示和答案抽取方式的共同影响。

因此,MMLU-Pro 更适合观察模型在广泛学科选择题上的知识运用和多步求解能力,并为高分模型保留更大的区分空间。它仍然受多项选择格式限制:模型可以依靠排除法,推理文本的存在不保证推理忠实,成绩也不能代表开放式研究、真实专业执业或持续完成复杂工作的能力。阅读具体结果时,题集版本、提示方式、示例数量、生成预算和解析规则都属于分数定义的一部分。项目代码与运行说明