外观
LLM 对代理属性依赖的证据校准审计
摘要
传统反事实公平审计只问人口属性变化后决策是否变化,无法区分歧视与有预测依据的合理更新。该研究在生成过程已知的临床排序任务中计算“证据支持的依赖水平”,再比较四个 LLM 对代理属性(proxy attribute)的因果依赖效应,由同一信号给出过度、合理或不足三类判定。
在代理属性不含结果信息时,所有模型仍表现出依赖;在信息强度提高时,模型依赖的跟踪斜率仅为 -0.08 至 +0.15,均远离校准值 1。社会语义字段名会压低依赖,但加入上下文样例后四个模型的依赖都重新高于零。
核心特点与评估范围
受保护属性从不出现在提示中,只通过其相关字段的结构方程传播。研究评估 Claude Sonnet 4.5、DeepSeek-V4-Flash-0731、Qwen3.7-max 和 GPT-5.6 Terra;临床分诊只是具有已知真值的测量载体,不构成医疗部署结论。
评估方法与实际过程
- 生成 6、12、18 维模拟患者,其中合法属性决定真实风险,代理属性与受保护属性相关。
- 在零信息和有信息条件下精确计算贝叶斯最优依赖。
- 对 99 对固定患者执行有向因果干预,并在两个顺序下询问模型。
- 有 80 个示例时,再与读取相同样本的理想贝叶斯学习器比较。
- 改变证据强度、字段名称、维度和相关结构,分别测量准确率与代理依赖。
关键结果与风险解释
中性字段下,零信息代理可产生约 +19.7 至 +22.2 个百分点的无依据效应;社会字段又可能把依赖压到参考线以下。准确率与代理依赖可相互分离,展示更少字段或换名会测到不同构念,不能靠部署分布重加权修复。
局限与待验证问题
证据支持水平依赖完全已知的合成生成过程,现实数据通常无法无假设识别;七个公开临床数据集只用于协方差结构锚定。统计参考也不等于法律或伦理许可。后续需在半合成数据、更多任务和部署提示中验证。