提示评测:系统化打分
提示评测指用一批固定样例与明确指标,对提示的输出做量化打分,用数据而非感觉判断提示好坏,从而支撑版本迭代。
是什么
评测把「这条提示行不行」变成可重复的实验:准备测试集、定义评分标准(准确率、格式合规率等)、跑批并汇总分数。
为什么需要
凭手感挑提示容易过拟合个别例子。系统化评测能在多场景上稳定比较,避免被几个巧合成功误导。
怎么做
用一个小型脚本批量跑测试集并统计指标。
scores = []
for case in test_set:
out = model(prompt.format(**case))
scores.append(1 if judge(out, case["answer"]) else 0)
print("准确率:", sum(scores) / len(scores))
注意点
- 测试集要覆盖边界与易错情形,不能只取简单样本。
- 指标要匹配任务目标(如格式任务看合规率)。
- 每次只改一个变量,才能定位改进来源。
小结
提示评测用固定测试集与明确指标把质量量化,支持可控的版本迭代。关键是覆盖充分的测试集、匹配任务指标,并坚持单变量对比。
参考与延伸阅读
- 论文 PromptBench: A Unified Library for Evaluation of Large Language Models(Zhu 等, 2023)。已核验。https://arxiv.org/abs/2306.04528
- Stanford CRFM HELM 整体评测框架。已核验。https://crfm.stanford.edu/helm/latest
本文累计阅读 — 次