Skip to content

威胁建模与分类体系研究综述 ​

摘要 ​

本分类研究如何用稳定、可复核的维度描述 AI 攻击者、资产、入口、最先失效的安全控制、攻击技术和影响。分类体系的价值在于支持样本标注、覆盖比较和修复责任分配,而不是为同一现象增加更多近义名称。

分类介绍 ​

现有研究通常从攻击投递渠道、提示操纵手法、攻击目标、能力面、生命周期和安全影响等维度建模。单一树状分类难以同时表达这些正交关系,因此本站采用唯一主分类配合交叉链接和元数据,并以首个失效控制确定归档位置。

评价分类体系时应检查定义是否互斥、边界是否可重复判断、是否能映射真实样本、是否保留未知项,以及不同标注者能否达到稳定一致性。仅重新命名既有类别、缺少样本验证或把产品名称当作机制的框架不构成独立增量。

历史研究成果 ​

本分类下的独立研究解决同一个方法论问题:Prompt Injection 无法用单一标签完整描述。

研究对象是提示词注入的分类维度本身:综合分类框架 提出投递向量、操纵手法、攻击目标三个正交维度,CrowdStrike 分类法解析 聚焦“投递路径 + 操纵技术”两轴,攻击目标与能力面分类 则补齐“攻击者最终想控制什么”一轴。

研究方法是把厂商分类法、公开扫描器与 Agent Benchmark 的任务设计归纳为可组合的正交坐标轴,使同一案例能同时表达“恶意内容如何进入上下文、如何影响模型、最终劫持了什么能力”,并与 Jailbreak 和具体 Agent 漏洞保持清晰边界。

研究成果的共同结论是:单轴分类会把“载荷从哪进入”“如何绕过指令边界”“劫持了什么能力”混为一谈;只有投递×操纵×目标的多轴组织,才能既做攻击技术索引,又对齐修复责任与主分类。这些坐标轴是对现有材料的综合归纳,其中攻击目标轴不是独立公开标准。

相关研究文章 ​

参考链接 ​