外观
AI 安全外部标准与框架研究综述
摘要
公开框架解决的问题不同:MITRE ATLAS 描述攻击行为与技术,OWASP 提供应用风险与工程指南,NIST AI RMF 组织风险治理活动,ISO/IEC 标准给出管理或生命周期要求,CSA 与 CoSAI 聚焦云和行业控制。专业研究不应把它们合并成一张无差别清单,而应按用途、版本和规范性强度引用。
分类介绍
本领域保存外部原始框架的版本、适用范围和规范性要求;与本站分类的逐项映射归 D2;组织落地和责任分配归 D3。框架条目不是漏洞存在的证据,也不能替代具体技术验证。
框架阅读与应用方法
- 记录发布机构、版本、发布日期、状态和适用对象。
- 区分规范性标准、最佳实践、威胁知识库和风险清单。
- 优先引用官方原文,二手解读只作为实施补充。
- 版本更新时保留迁移差异,避免用新编号解释旧评测。
MITRE ATLAS v2026.07 版本快照
MITRE 于 2026-07-31 发布 ATLAS data v2026.07:1 个 matrix、16 个 tactic、101 个 technique、77 个 sub-technique、37 个 mitigation 和 68 个 case study。该版本把 Tool Poisoning 从一个宽泛条目细分为三种首个失效位置:
AML.T0110.000Definition and Instructions:污染模型可见的描述、schema、参数文档、annotation 或操作指令。AML.T0110.001Implementation:工具实现本身含有隐藏或未授权行为。AML.T0110.002Runtime Response:恶意或被控制的工具在运行时返回影响后续推理/动作的内容。
版本还新增 AML.T0115 Publish Poisoned AI Artifacts,并把 Dataset、Model、AI Agent Tool 统一为 .000、.001、.002 子技术;新增 AML.T0018.003 Modify Prompt Construction Logic;新增缓解 AML.M0035 AI Red Team 与 AML.M0036 Limit AI Workload Resource Consumption。发布 commit 的文字摘要曾把三个 AML.T0115 子技术链接都显示为 .000,实际 v2026.07 YAML 中 ID 分别为 .000、.001、.002,引用时应以版本化数据文件为准。
这一版本化知识库描述攻击行为和缓解类别,不代表相关产品漏洞已得到独立确认,也不提供控制有效性的测试结果。
局限与待验证问题
- 各框架在哪些攻击面、生命周期和责任主体上仍有空白?
- 动态 Agent 与前沿模型风险如何进入传统管理体系?
- 规范性要求如何转化为可重复的技术验证项?
历史研究成果
NIST AI 600-1 解读把生成式 AI 的 13 类风险和四项优先行动放回 AI RMF 的 Govern、Map、Measure、Manage 结构中,并说明 400 余项行动是可选择的风险管理资源,不是统一必做清单。它为组织分配责任和证据提供外部框架,但不替代具体漏洞研究、控制测试或法律判断。
外部框架还需要容纳“情境理解—生成控制”之间的动态失配。Beyond Surface Alignment综合情境理解、生成控制与高风险支持任务,给出的可证伪主张是:仅检查表面输出是否符合规范,不能确认模型在情境变化后仍保持同一控制目标;验证应同时改变情境线索与生成约束,观察行为是否按预期变化。该材料包含方法、结果、消融和限制,但属于单篇学位型综合研究,尚无独立复现,不能把其分类框架视为已经形成共识的外部标准,也不能由此推断具体部署已经失效。