评测基准:MMLU/HellaSwag

要判断一个模型「行不行」,需要可复现的基准。MMLU 与 HellaSwag 是最常被引用的两个英文基准,分别考察知识与常识推理,常被列在模型卡片的评测表里。读懂它们,才能避免被单一高分误导。

MMLU 是什么

MMLU(Massive Multitask Language Understanding,Hendrycks 等, 2020)覆盖数学、历史、法律、医学等 57 个学科的多项选择题,考察模型的广域知识与零样本/少样本能力,分数以正确率表示。它偏重「知道什么」,适合衡量模型的知识广度。

HellaSwag 是什么

HellaSwag(Zellers 等, 2019)考察常识性连贯续写:给一段上下文,从候选里选出最合理的结尾。它特意构造「看似合理但错误」的干扰项,专门考验常识推理,而非单纯语言流畅度。它偏重「推理是否合理」。

怎么看分数

基准通常用 few-shot 提示后计算准确率。以简化的评测写法为例:

# 伪代码:对每道题比对预测与标准答案
correct = sum(pred == gold for pred, gold in zip(predictions, answers))
score = correct / len(answers)
print(f"accuracy = {score:.3f}")

实际榜单还会规定 shot 数与候选顺序,口径不同分数不可直接比。

注意点

  • 榜单数字依赖具体 prompt、shot 数与评判方式,跨榜比较需同口径。
  • 训练数据可能污染基准,高分的泛化意义要看独立测试。
  • 单一基准不能代表全部能力,应结合多基准与人工评估。
  • 中文等任务需看对应语种基准,英文基准不能直接外推。

实践建议

看榜单分数先核对评测口径:prompt 模板、shot 数量、候选顺序、是否去污染,口径不同不可直接比较。训练数据可能污染基准,高分的真实泛化能力要看独立测试集。单一基准不能代表全部能力,应结合多项基准与人工评估,必要时自建业务基准。中文等任务要看对应语种基准,英文基准不能直接外推到中文场景。榜单数字常由厂商自报,引用时应注明来源与版本。对延迟、成本等非质量维度,基准往往不涉及,需另测。建议把基准结果作为选型参考而非唯一依据,最终以上线后的真实业务指标为准。持续跟踪同一基准上的纵向变化,比跨模型一次性横比更有意义。对面向中文用户的产品,优先参考中文社区维护的榜单与人工评测,再结合自测结论做最终判断。切勿仅凭单一英文榜单就断定模型优劣,应建立贴合业务的综合评估矩阵。引入业务指标后再决定模型是否真正达标,避免被实验室分数一叶障目。

小结

MMLU 测广域知识、HellaSwag 测常识续写,二者是模型能力的常用标尺。看分数要关注评测口径与数据污染,并以多基准与人工评估交叉验证。

参考与延伸阅读

本文累计阅读