偏见与公平:度量与缓解
偏见与公平(Bias and Fairness)关注模型是否对特定群体产生系统性不公。由于训练数据反映现实社会的不平等,模型可能继承甚至放大性别、种族、年龄等方面的偏见,因此公平性成为可信人工智能的硬指标。
公平并非要求模型对所有群体给出完全相同的结果,而是避免基于无关属性施加系统性不利。换句话说,差异应来自真实相关的特征,而非性别、肤色等不应影响的属性。明确这一边界,才能选择合适的度量与缓解手段,避免陷入「平等」与「公平」的语义混淆。
偏见从哪里来
偏见主要来自数据:历史不平衡的标签、被低估的少数群体样本,以及互联网语料中的刻板印象。即使训练目标中立,模型也会学到这些关联。例如职业词与性别在语料中高度相关,模型便可能默认关联。
为什么需要度量
公平不能靠感觉判断,必须用可量化指标暴露差距。只有先度量,才能设定改进目标并验证缓解是否有效。NIST 在人工智能风险管理框架中把公平列为持续开展的活动。
怎么做:度量与缓解
常用做法包括:
- 群体度量:比较不同群体在准确率、错误率上的差异。
- 去偏训练:重采样、重加权或在损失中加入公平约束。
- 事后审计:用标准化的偏见基准集定期评测。
# 群体错误率差异(示意)
diff = abs(error_rate(group_a) - error_rate(group_b))
print("公平性差距:", diff)
注意点
不同公平定义可能彼此冲突,需在具体场景权衡。缓解要防止「表面去偏」掩盖实质问题,并用多基准交叉验证。建议公开审计方法,接受外部复核。
实践建议
缓解偏见应从数据阶段开始:审查训练语料的群体覆盖,对欠代表群体做加权或增强。上线前用标准化的偏见基准评估不同群体的错误率差异,并设定可接受的差距阈值。不同场景对公平的定义不同,医疗与招聘要更严格,应让受影响群体参与定义指标。避免用单一分数掩盖问题,建议多维度报告。定期复评,因为模型迭代后偏见可能回潮,公平应作为长期指标跟踪而非一次性任务。
小结
模型偏见源于数据中的社会不平等,需用量化指标度量并以重采样、公平约束与审计持续缓解。公平是多目标权衡,应作为长期工程而非一次性修正。让受影响群体参与指标定义与样本标注,是把抽象公平落到实处的起点,也能避免由单一团队凭直觉决定何为「公正」的偏差。
参考与延伸阅读
- NIST 人工智能风险管理框架(公平维度)。已核验。https://www.nist.gov/itl/ai-risk-management-framework
- Google PAIR 公平性资源。已核验。https://pair.withgoogle.com/
- OWASP 大模型应用十大风险。已核验。https://owasp.org/www-project-top-10-for-large-language-model-applications/