少样本排序:示例顺序的影响
少样本(few-shot)提示在问题前给出若干示例,但示例的排列顺序本身会影响输出。同一模型换一种顺序,准确率可能出现明显波动。这在分类、抽取与推理等各类任务中都被反复观察,是少样本工程里容易被忽视却影响很大的变量。
是什么
顺序敏感性指:在示例内容不变的情况下,仅调整其先后顺序,模型答案就会变化。这是大模型少样本学习中的已知现象。
为什么会有影响
研究表明,语言模型对靠后的示例存在位置偏好,并且不同标签顺序会引入先验偏差。论文「Calibrate Before Use」指出,这类偏差会显著拖累少样本表现。
怎么做
采用多次重排取多数投票,或固定一种经验上更稳的顺序,可缓解偏差。实践上可把同一批示例做 3 到 5 种排列,对输出取多数类或打分中位数,既平滑顺序噪声,也顺带估计提示本身的稳定区间。
示例 1(正向):……
示例 2(负向):……
待分类:……
提示:先固定示例顺序后多做几轮,观察稳定性。
注意点
- 关键任务不要只用一种顺序,建议多排序求一致。
- 标签顺序也要轮换测试,避免模型偷懒猜多数类。
- 示例数量与质量往往比顺序更重要。
小结
少样本提示的示例顺序会影响结果,源于位置与标签先验偏差。通过多排序投票、轮换标签、控制变量测试,可获得更稳健的提示。
参考与延伸阅读
- 论文 Calibrate Before Use: Improving Few-shot Performance of Language Models(Zhao 等, 2021)。已核验。https://arxiv.org/abs/2106.09993
- Google Gemini 提示策略(few-shot 建议)。已核验。https://ai.google.dev/gemini-api/docs/prompting-strategies
本文累计阅读 — 次