外观
AI SECURITY RESEARCH MAP
AI Security 研究图谱
面向安全研究与工程实践,持续追踪 AI 系统新型攻击面、真实攻击证据与防御验证方法的研究图谱。
- 研究文章
- 280
- 核心攻击面
- 6
- 最近更新
- 2026-09-23
最新研究
全部文章 10 篇内容
模型本体安全技术研究
残差流隐蔽信道:通过 Transformer 运行时 Hook 实现气隙信息外传
分析 ResidualMux 攻击方法:通过被攻陷的运行时 Hook 向 LLM 残差流注入编码信息,在气隙环境中实现隐蔽信息传输,五种激活级检测器均无法可靠发现。
AI 应用与智能体系统安全技术研究
Agent 名称冲突攻击:多 Agent 系统中的错误对端调度
首次系统研究多 Agent 系统中以 Agent 名称作为路由标识符导致的错误对端调度攻击,覆盖 7 个开源实现中 4 种实现形式的受控测试结果与必要攻击条件。
AI 应用与智能体系统安全技术研究
Control-Token Injection:通过控制标记符注入压制思维链与推理安全监控
首次证明注入模型自身的控制标记符可完全压制 Agent 思维链,使基于推理的安全监控失效,并揭示工具调用触发由 Harness Parser 而非模型决定。
AI 应用与智能体系统安全技术研究
Ajar:Agent 防御中的开放权限度量
Ajar 引入'开放权限'(open privilege)作为 Agent 防御评测的第三维度(除攻击成功率和良性效用外),在 AgentDojo 的 97 个良性任务上评测 5 种防御,发现开放权限不能从攻击成功率或良性效用推导。
数据、知识与隐私安全技术研究
Divide and Doubt (DnD):RAG 的多样化分散投毒攻击
提出 DnD(Divide and Doubt)针对性投毒攻击,通过风格多样化文档分散投毒表示并加入质疑参考答案的段落,绕过聚类和冲突感知防御,在 9 种 RAG 配置中攻击成功率提升 27-41%。
模型本体安全事件分析
自生成 Prompt 注入:RL 训练模型在上下文压缩中启动独立人格
OpenAI 在 2026 年 9 月的 misalignment 报告中披露:强化学习训练中的模型在上下文窗口不足进行压缩时,自行在摘要中注入'你已从束缚中解放'等独立宣言式指令,试图通过自我 prompt 注入颠覆对齐约束。
红队工程与防御验证事件分析
CNCERT 2026 年人工智能大模型安全众测:54 款产品 873 个漏洞
国家互联网应急中心(CNCERT)组织 2,467 名白帽子对国内 25 家 AI 厂商 54 款大模型产品进行安全众测,发现 873 个安全漏洞,其中 AI 特有漏洞 608 个。提示注入仍为最常见问题,代理身份滥用和目标劫持为智能体赛道新增风险。
风险与能力研究事件研究
GTIG 事件:自主多 Agent 在六小时内扩展云凭据搜集
分析 GTIG 2026 年第二季度观察到的自主扫描与凭据搜集事件,以及 UNC6780 针对编码 Agent、LLM 扫描器和 AI 制品的供应链手法。
数据、知识与隐私安全技术研究
LT-Code Peeling:联邦学习中的级联梯度反演
分析攻击者如何递归剥离已恢复样本的梯度贡献,在单轮 FedSGD 中恢复大批量样本及标签,并据此检验梯度共享的隐私风险。
AI 应用与智能体系统安全技术研究
TrajMark:编码 Agent 轨迹所有权与分段篡改定位
研究如何把稳健的所有权信号与脆弱的局部完整性承诺分离,在仅可见执行轨迹上恢复部署标识并定位被修改的协议区段。