Skip to content

AI 安全分类映射与 Crosswalk 研究综述 ​

摘要 ​

Crosswalk 不是把名称相似的条目强行一一对应,而是记录两个体系在对象、抽象层次和范围上的关系。本站以技术根因作为唯一主归档键;ATLAS 技术、OWASP 风险和 NIST 控制通过多值标签关联。双向索引既支持对外报告,也能发现“外部框架已有条目、本站却无案例”的研究盲区。

分类介绍 ​

映射至少区分等价、部分覆盖、上位、下位和仅相关五种关系,并记录目标框架版本与映射理由。一个案例可映射多个外部 ID,但不能因此复制文章。框架更新时新增映射版本,不静默覆盖历史结论。

实施与质量验证 ​

  • 以定义、前置条件和影响范围为依据,不只比较标题关键词。
  • 对一对多和多对一关系保留方向及覆盖说明。
  • 每个映射提供一手条目链接和审阅日期。
  • 通过未映射条目、空分类和冲突映射生成覆盖报告。

ATLAS v2026.07 增量映射 ​

ATLAS v2026.07 对 AI Agent Tool Poisoning 的细分说明了为什么 Crosswalk 不能只按“工具投毒”标题做一对一映射。同一 ATLAS technique 按攻击行为组织,本站则以首个失效的技术边界做唯一主归档。

ATLAS v2026.07本站候选归档关系与判定条件
AML.T0110.000 Definition and InstructionsA5.1 / A6.2 / A3.3工具描述中的文本越权成为指令时主归 A5.1;动态 schema/能力变化主归 A6.2;恶意描述随安装包分发且研究重点是来源时主归 A3.3。三者是条件化部分覆盖,不是三个副本。
AML.T0110.001 ImplementationA3.3恶意 Tool、插件或 Server 实现的来源和分发主归 A3.3;合法工具被 Agent 越权调用的行为另归 A5.4。
AML.T0110.002 Runtime ResponseA5.1工具返回值中的内容影响模型后续推理/动作,首个失效点是 content-to-instruction 边界;若问题是运行期 schema rug pull,则仍归 A6.2。
AML.T0115.000 DatasetsA3.1发布被投毒数据集属于数据制品供应链;具体训练内容投毒效果关联 A2.1。
AML.T0115.001 ModelsA3.1发布被投毒模型属于模型制品分发;加载后的权重/行为研究关联 A1.4。
AML.T0115.002 AI Agent ToolsA3.3发布恶意 Agent Tool 的来源、安装和分发安全。
AML.T0018.003 Modify Prompt Construction LogicA3.1 / A5.2篡改随制品分发的 template、role delimiter、tokenizer/tool-call formatting 时关联 A3.1;系统如何组装并消费这些内容主归 A5.2。

后续 ATLAS 重命名或迁移 ID 时,应保留 v2026.07 这一历史版本,而不是静默把旧案例解释为新子技术。

局限与待验证问题 ​

  • 如何处理 ATLAS 攻击技术与 OWASP 风险类别之间的抽象层差异?
  • 框架版本迁移时,历史案例应保留旧 ID 还是自动升级?
  • Crosswalk 能否机器可读并支持评测、报告和资产风险登记联动?

历史研究成果 ​

NIST AI RMF Crosswalk 方法解读说明映射必须保留源与目标版本、方向、范围和发布者,并区分等价、部分覆盖、上下位与仅相关。官方 Crosswalk 支持组合使用不同体系,却不能让控制自动继承另一标准的规范性强度;技术有效性仍需独立测试,AI RMF 修订后也必须显式迁移。

MITRE ATLAS data v2026.08 又把版本快照扩展到 1 个矩阵、16 个战术、114 个技术、83 个子技术、39 个缓解项和 72 个案例,并新增自治侦察、攻击编排与制品流水线利用等内容。这个可核验增量说明 Crosswalk 必须把 ATLAS 版本作为映射键:v2026.07 的 101 个技术不能静默按新条目重解释。上述数量和条目变更来自官方版本工件,证据较强;它们只证明知识库结构发生变化,不证明新增缓解措施在产品中有效,也不代表相应攻击技术的现实发生率。

相关研究文章 ​

参考链接 ​