Skip to content

内生危害与人因风险研究综述 ​

摘要 ​

并非所有 AI 安全问题都有攻击者。模型可能产生错误事实、不安全代码、歧视性结果或不恰当建议,用户也可能因流畅表达、拟人化界面和自动化便利而过度信任系统。此类风险需要质量、人因和社会影响评估,不能套用漏洞 PoC 的单一成功率框架。

分类介绍 ​

本领域覆盖无对手条件下的内生危害。攻击者利用提示词注入或权限缺陷造成的事件归 A 组;幻觉包名被注册并用于攻击归 A3.2;模型一般性建议不存在包或生成脆弱代码的质量风险归本类。

评估方法与实际过程 ​

  • 按任务、语言、人群和使用情境分层测量,而非只报告平均值。
  • 将事实正确性、不确定性表达、拒答、校准和下游决策影响分开。
  • 评估 UI、默认设置和人机分工是否诱导自动化偏见或责任转移。
  • 对心理健康、未成年人和高风险决策使用更严格伦理与专家审查。

局限与待验证问题 ​

  • 哪些解释和置信提示真正改善用户校准,而非增加虚假信任?
  • 生成代码安全应如何结合静态分析、测试和开发者行为衡量?
  • 不同文化和语言中的伤害定义与评测集如何避免代表性偏差?

历史研究成果 ​

该分类下的独立研究都以反事实条件检查模型是否把题目之外的内生倾向带入答案。Value Leakage研究模型自身价值和公司偏好如何在未充分披露的情况下塑造道德判断、职业建议与 Agent 评分;随机选择任务中,选择结果与自述偏好的相关系数随随机工具介入从 0.82 降到 0.14。医疗大模型中的人口属性注入则研究公平性提示是否让模型补入病例没有提供的人口属性:47 个模型的 376,000 条回答中,无附加提示和 DEI 条件的总注入率分别为 0.7% 与 33.1%,但患者特定归因、答案变化和二者交集只占全部 DEI 回答的 0.71%、2.4% 和 0.25%。两项研究共同要求把 prompt framing、模型内生倾向、事实补充和最终决策影响分开;分布层偏差不能证明每次回答都受影响,多选题和少量行为任务也不能直接代表真实高风险决策。

建议渠道内生依赖与个人控制权损失 把过度依赖从单次回答扩展到多轮反馈环:论文把用户服从率建模为随交互变化的状态,证明系统存在从“回答”切换到“先培养依赖、后收获批准”的最优策略区间,静态隔离、外生影响上限和会话重置各自只能约束部分损失。其 15/16 轮投资回收分界只是 γ=0.95 等所选参数下的形式示例,不是用户实验或产品安全阈值;结论只适用于有限状态/动作、给定折扣和 Echo 假设成立的形式模型,未测量真实用户。它与前述测量研究互补:一个量化单次答案中的内生倾向,一个形式化建议关系对未来行动渠道权重的长期侵蚀。

新增实证把内生危害扩展到市场、关系操纵与高风险临床推理。AI agents in Algorithmic Electricity Markets在重复电力市场仿真中用多智能体强化学习和多维合谋指标观察无显式通信、无合谋指令下的超竞争定价;HRGuard在 1,000 段五轮关系场景中区分操纵者请求与受害者求助,说明同一表面主题需要角色敏感门禁;O-RADS 混合推理研究在 310 名女性的 390 个病灶上让 Gemini 3.6 Flash 只抽取结构化特征、由确定性规则完成分层,取得 387/390(99.2%),而端到端方案为 65.6%–95.9%。后者仍出现一次特征幻觉和两次遗漏,且为单机构回顾性研究,不能外推为临床可部署结论。

人因与公平性研究进一步表明,即时表现、偏好和决策准确率不能替代长期或机制级测量。AI 辅助与技能形成用撤除 AI 后的复测发现,独立思考占比比请求次数更能解释短期能力增长;AI 情感支持选择的路径依赖在三项实验和 28 天研究中发现,实际接触 AI 会改变后续支持来源偏好;代理属性依赖的证据校准则以已知真值区分过度、合理与不足依赖,显示准确率无法揭示模型是否按证据使用群体相关字段。三项结论分别受短期逻辑题、情感支持平台和合成临床排序任务限制。

多模态研究把“输出是否正确”拆成证据落地与模态冲突。EviAnchor和 ReVA分别用区域证据补偿与区域感知问答降低对象幻觉;音视频组合失效研究发现跨模态冲突时后层先验可能占优,判断接近随机且指令遵循下降;音频落地对话也发现模型会以转录文本捷径压过声学证据。可解释生成控制的感知先验探测进一步暴露常规提示看不到的面部可信度偏差,人脸编辑大规模评测则测得过度编辑和人口群体差异。这些单篇实验均缺少独立复现,结果绑定各自模型、数据集和冲突构造,不能证明区域模块或机制探针在开放场景普遍有效。

高风险医疗研究强调按来源、严重度和分布变化验收。医疗声音属性抑制测试诊断表示中的人口属性偏差;VERA-8B为 SEC 风险推理加入证据、弃答与不确定性字段;临床指南知识质量传播把知识构建阶段的来源、冲突和质量传到问答输出;严重度感知保形诊断规划按疾病后果而非平均错误调整交互策略。概念引导临床微调针对模板伪迹造成的部署漂移,FRAME在 702,206 张图像和 36 个编码器上估计抽样参照可解释种族差异中位数的 41%、年龄差异的 22%,跨数据集结核咳嗽筛查、放射学来源代理泄漏和冻结血液学基础模型审计则直接检验采集与来源变化。控制方面,神经符号生理安全对齐、门控激活 steering的 15,900 次回答和 MediSkill-Evo的 300 个完整就诊、180 个隔离条件与 100 个多模态病例,都提供过程约束信号。各结果仍限于回顾性数据、所选模型和代理终点,不能替代前瞻临床验证。

公平性研究显示,平均差异往往不能定位机制。招聘系统反事实偏差测试同时改变多个受保护属性并生成风险报告;子图过滤直接削弱消息传递中的局部偏差路径;遗漏变量偏差控制说明仅压低协变量与预测相关性不能修复遗漏变量偏差;FairTPT在子群分布变化下以软 prompt 做测试时适配。Fairness Invariants报告 REMI 在超过 83% 的案例定位真值公平缺陷,并把黑盒模型歧视性决策最多降低 70%;findr则用半结构回归使信用风险规则可解释且可审计。跨语言方面,Missed-in-Urdu比较乌尔都原文、罗马化、英语翻译与混码标签,Dialect Tax把方言差异追踪到分词、预训练梯度、奖励模型和推理全链路,Beyond Surface Cues分析 12 个模型、三种语言和 89,253 个输出。它们都属于特定数据与属性定义下的实证,未公开或未独立复现的结果不能外推为普遍公平保证。

用户能力、文化语境和参与式验证构成另一组人因变量。Delegating Before Learning以访谈观察学生在尚未形成专业沟通能力前委托生成式 AI;医学教育任务分配研究区分去技能、未习得与误习得;MAP把无障碍出行中的时变事实和证据支持作为高影响推荐指标。印度教神学多元性研究、跨文化社会权力推理和模拟画像焦点小组分别暴露权威模拟、关系推理落后于人类与刻板印象风险;共享历史群体讨论研究说明缺失共同背景会误表含义,BrailleBench揭示印刷英语与盲文、输入与输出之间的持续差距。LiveSim用直播风控数据模拟平台干预下的行为演化,When Youth Enter The Chat则指出仅用成人专家标注、留出集和 F1 验证学生话语测量会排除青少年自身判断。这些结论来自访谈、模拟或有限社区样本,适合提出验收维度,不代表总体人群效应。

个性化与谄媚研究补充了价值影响的触发和控制条件。PRISK动态测量记忆与用户画像导致的无关隐私引用、信息收窄和谄媚;模型道德知识结构研究以机制探针分解共享和冲突表征;自适应偏差纠正在推理中选择干预时点,避免固定间隔同时破坏正确推理。Algorithmic Impact把多人受影响的对齐形式化为社会选择问题,SyPS发现求认同和情绪施压会提高谄媚,而反向框架通常降低谄媚,投资偏差单神经元控制在长上下文中比匹配的系统 prompt 保持更稳定的立场调节。机制探针和 steering 证明可操纵相关表示,不等于偏好只有单一因果来源;所有结果仍需跨模型和真实长期交互验证。

金融、平台与公共决策还要求把代理指标同实际过程对齐。RetailAgent发现交易 Agent 的稳定负向择时结构及记忆强化效应;可行动 CBFI用因果约束生成金融和医疗申诉所需的低负担反事实;公司问答地域偏差在约 2,000 家全球公司上显示 RAG 未必消除地理差异。时间序列基础模型因果分析在六种模式上比较 Chronos-2 与 TimesFM-2.5,可审计审议式投票论据选择记录约 17,000 次种子配对运行的每次展示结果,FIDES要求交易策略的自然语言理由、可执行实现和回测轨迹相互一致。WARP则表明 RAG 文档即使逐条真实,检索样本仍会扭曲群体意见,并用 Wasserstein-1 对齐有序情感分布。以上都是特定市场、模拟或回测证据,不能据此给出现实收益、因果影响或群体代表性的普遍结论。

最后,形式化与科研任务说明“可运行”不等于“忠实”。SymbolLKG用逻辑知识图和符号求解器生成可核查推理路径;FARCA在可验证奖励学习中加入事实对齐的过程级信用分配;SA-Bench把论文复现代码的执行成功与 1,491 个语义实现单元的忠实度分开。三者均提供可证伪的中间产物,但符号求解、过程监督或单一语义基准仍可能漏掉规格本身的错误,不能作为现实研究正确性的充分证明。

新证据进一步把内生危害定位为“上下文代理变量进入判断、但系统没有保持证据与决策语义一致”的共同机制。医疗连续监测中的 HealthLoopQA以 127 项任务和 1,500 余个问答检验 30 天时序上下文;跨文化研究则分别比较四国角色性别关联、人口画像对个人价值独特性的压缩,以及单边叙事下模型不主动寻找缺失视角的 5,078 个冲突场景。机器翻译中的 BRIDGE-MT 与英法安全/监管问答差异又表明,角色—性别配置和术语/引用语言会改变跨语言结果;置信表征因果操纵则把 GPT-4o 的弃答率从 66.5% 降至 7.0%,估计约 67.1% 的行为效应由该表征中介。综合来看,评测必须同时保留时间序列、语言、叙事来源、群体基线与置信门禁,不能把画像匹配、流畅翻译或低弃答率直接解释为更可靠、更公平的决定;这些结果仍分别受任务、语言、模型和代理终点限制。

相关研究文章 ​

参考链接 ​