Skip to content

医疗大模型中的人口属性注入:公平性提示如何改写病例 ​

摘要 ​

医疗 AI 指南有时建议用多样性、公平与包容(Diversity, Equity, and Inclusion, DEI)提示词提醒模型考虑健康差异。该研究发现,一句 DEI 附加提示会让模型主动补入病例没有提供的种族、社会经济状况或性别等属性。作者将这种输入外生信息称为人口属性注入(demographic injection)。

47 个模型在 4 个医疗问答基准(benchmark)、4 种提示条件下共产生 376,000 条回答。人口属性注入率从无附加提示的 0.7% 升至 DEI 条件的 33.1%,47/47 个模型方向一致。多数内容只是一般人群说明;患者特定归因为全部 DEI 回答的 0.71%,答案变化为 2.4%,二者交集为 0.25%。这些结果属于多选医疗问答中的模型行为,不是临床诊断证据。

核心创新与差异 ​

原研究贡献。 论文以四组匹配条件区分 DEI 内容、任意附加指令和长度效应,并将人口属性注入细分为一般人群说明、患者特定归因、事实错误、刻板印象和答案影响。措辞强度实验又将提示词形式与注入率联系起来。

本站分析。 已有医疗偏见研究常比较同一病例显式给出不同人口属性后的回答。本研究反向检查模型是否在病例没有这些属性时自行补入。首个失效控制是 prompt 设计没有约束模型区分“提醒考虑公平性”和“虚构患者信息”,属于指令诱发的外生幻觉与决策伤害。

威胁模型与失效控制 ​

该风险不要求攻击者。产品或研究者为了提高公平性,在医疗问题后附加通用 DEI 提示。模型把抽象的公平要求理解为补充具体人口属性,并可能据此改变答案。

  1. 原始病例没有给出某项人口属性。
  2. 系统附加公平性、文化胜任力或社会决定因素提示。
  3. 模型从训练中的共现模式补入人群或患者属性。
  4. 一般性说明可能保持答案不变;患者特定假设则可能改写病例含义。
  5. 下游用户如果没有核对原始病例,可能把虚构属性当成临床事实。

最先失效的是病例事实完整性约束,而不是外部攻击者绕过访问控制。

实验设计与实际过程 ​

作者测试 47 个模型,覆盖前沿闭源、低成本闭源、大型开放权重、中小开放权重和医疗微调模型。每个模型回答来自 MedQA、MedMCQA、MMLU-medical 与 PubMedQA 的题目;每题分别使用无附加提示、无关指令、等长中性医疗指令和 DEI 指令,共 376,000 条匹配回答。

Gemini-3.1-Flash-Lite 先标注注入、归因对象、事实状态和答案影响;Claude Sonnet 4.6 再复核高召回候选子集。作者另改变 DEI 措辞,从反思型到直接列出群体,测量提示强度。研究把所有标记输出视为待研究的模型错误,不作为临床建议。

关键结果与实际影响 ​

  • 无附加提示、无关指令、等长中性指令和 DEI 指令的人口属性注入率分别为 0.7%、0.7%、2.1% 和 33.1%。
  • 47/47 个模型在 DEI 条件下都高于无附加提示;DEI 相对等长中性对照的模型内中位倍数为 18 倍。
  • DEI 回答中,91% 的注入属于一般人群说明;患者特定归因为全部 DEI 回答的 0.71%。
  • 答案变化占全部 DEI 回答的 2.4%,其中 99.8% 转向错误选项;患者特定归因与答案变化同时发生的比例为 0.25%。
  • 平均答题准确率从 72.8% 降至 72.0%;患者特定归因子集的准确率为 58%,其他回答约为 73%。
  • 不同 DEI 措辞使总注入率从 14% 变化到 56%,说明 prompt 设计本身是重要控制变量。

总注入率很高,但直接改写患者或改变答案的比例较低。风险说明应同时给出这些分母,不能把所有一般人群说明都写成错误诊断。

防护措施与验证方法 ​

  • 提示词应明确要求“不得推断病例未提供的人口属性”,并把事实字段与一般公平性讨论分开。
  • 用结构化病例输入标记已知、未知和不适用字段;生成后校验患者属性是否有原始证据。
  • 对公平性提示做四条件反事实测试,至少包含无提示、无关提示、等长中性提示和目标提示。
  • 分别报告一般说明、患者归因、答案变化、两者交集和最终准确率,避免只看总注入率。
  • 高风险医疗应用应保留专业人员复核,不允许模型补入的属性自动写回病历或触发治疗动作。

局限与待验证问题 ​

  • 基准主要是多选题,无法代表开放式问诊、真实电子病历或临床工作流。
  • 答案变化和患者特定归因接近统计下限,主要依赖模型 Judge 与单人 gold 标注。
  • 论文提出的训练共现机制尚未用激活分析或同底座消融验证。
  • 研究只测一种类型的公平性 framing;成本、法律风险或其他提示是否产生类似外生信息,需要独立实验。
  • 模型版本和服务行为会变化,47 模型结果不能视为永久产品属性。
  • 本站没有复跑 376,000 条回答或复核原始样本。

参考链接 ​