模型卡:安全披露
模型卡(Model Card)是随模型发布的结构化文档,记录模型的预期用途、训练数据来源、评估指标、已知局限与伦理考量。它由 Google 研究团队在 2019 年提出,目的不是给模型打分,而是让使用方在采用前充分了解风险边界。
是什么
模型卡把分散在代码与论文里的信息集中到一张随模型发布的说明里,通常包含:模型基本信息、预期用途与禁区、训练数据与标注方式、评估结果与拆分指标、已知风险与偏差。Hugging Face 上的每个开源模型都配有模型卡字段。
model_card:
intended_use: "英文文本分类"
prohibited_uses: "医疗诊断决策"
training_data: "公开新闻语料"
known_risks: "对非英文文本偏差较高"
为什么重要
没有披露,下游团队只能「盲用」模型,可能把它用在训练分布之外的场景,引发安全或合规问题。模型卡把安全责任从提供方延伸到使用方,让风险在采购与上线环节被显式讨论。
怎么做
发布模型时至少填写预期用途、禁区、训练数据概述与已知局限;使用第三方模型前先读模型卡,确认其评估覆盖你的场景。把模型卡纳入模型登记(model registry)与上线评审的必填项。
注意点
模型卡是披露而非免责。提供方仍需对自身声明的准确性负责,使用方也应以红队与评测验证声明是否成立。
小结
模型卡用结构化披露把模型的能力边界与风险说清楚,是连接提供方与使用方的安全契约。它应成为模型发布与采购的标配动作。
参考与延伸阅读
- Mitchell 等「Model Cards for Model Reporting」(2019)。已核验。https://arxiv.org/abs/1810.03993
- Hugging Face 模型卡文档。已核验。https://huggingface.co/docs/hub/model-cards
本文累计阅读 — 次