幻觉安全:误信息风险

幻觉(Hallucination)指大模型生成流畅、自信却与事实不符的内容。它可能编造文献、人物、数据与事件。在医疗、法律、新闻等场景,幻觉会直接转化为误信息与决策风险,因此被列为重点安全问题。

幻觉的危害程度取决于场景:在闲聊中尚可容忍,在医疗、法律或新闻中却可能直接造成人身或声誉损害。更隐蔽的是「自信的半真」——模型把真实信息与编造细节混在一起,让人难以察觉。因此评估幻觉不能只看完全虚构的比例,还要关注部分失实的误导程度,这正是安全评测的难点。

幻觉从哪里来

模型学习的是训练语料中的统计规律,而非可核验的事实库。当知识边界外、问题模糊或上下文缺失时,模型倾向于按「像真的」方式补全,而非承认不知道。解码时的随机性与对齐压力也会鼓励其给出确定答案。

为什么是安全风险

用户常高估模型可信度,把幻觉当作事实引用,造成传播误导。OWASP 将输出不实信息列入大模型风险。对依赖外部检索的智能体,幻觉还可能串联错误动作,放大后果。

怎么做:缓解手段

工程上常用组合拳:

  • 检索增强生成(RAG):先取可信资料再作答,并附引用。
  • 置信表达:模型在不确定时显式说明「无法确认」。
  • 事实校验:对关键声明做二次检索比对。
# 检索增强示意
context = retrieve(query, docs)         # 取可信片段
answer = llm(f"{context}\n基于上文回答:{query}")

注意点

检索不保证无误,需校验来源质量与时效性。不要默认「有引用即正确」。对高风险领域应要求人工确认,并把幻觉率纳入上线评测。

实践建议

降低幻觉风险,首选检索增强生成并强制模型给出可点击的引用,让用户能核对原文。对训练与对齐数据,可增加事实性偏好的标注,引导模型在不确定时明确说明而非编造。上线前用事实性基准评测幻觉率,并把「是否附引用」「是否承认未知」纳入质量指标。医疗、法律、金融等高风险领域必须加入人工复核环节,不能把模型输出直接当作结论。同时向用户提示模型可能出错,培养合理的信任预期。

小结

幻觉源于模型对统计规律的依赖而非事实库,会在敏感场景造成误信息。缓解靠检索增强、引用与事实校验,并在高风险领域辅以人工确认。

参考与延伸阅读

本文累计阅读