Skip to content
AI SECURITY RESEARCH MAP

AI Security 研究图谱

面向安全研究与工程实践,持续追踪 AI 系统新型攻击面、真实攻击证据与防御验证方法的研究图谱。

研究文章
280
核心攻击面
6
最近更新
2026-09-23
最新研究

10 篇内容

全部文章
模型本体安全技术研究

残差流隐蔽信道:通过 Transformer 运行时 Hook 实现气隙信息外传

分析 ResidualMux 攻击方法:通过被攻陷的运行时 Hook 向 LLM 残差流注入编码信息,在气隙环境中实现隐蔽信息传输,五种激活级检测器均无法可靠发现。

AI 应用与智能体系统安全技术研究

Agent 名称冲突攻击:多 Agent 系统中的错误对端调度

首次系统研究多 Agent 系统中以 Agent 名称作为路由标识符导致的错误对端调度攻击,覆盖 7 个开源实现中 4 种实现形式的受控测试结果与必要攻击条件。

AI 应用与智能体系统安全技术研究

Control-Token Injection:通过控制标记符注入压制思维链与推理安全监控

首次证明注入模型自身的控制标记符可完全压制 Agent 思维链,使基于推理的安全监控失效,并揭示工具调用触发由 Harness Parser 而非模型决定。

AI 应用与智能体系统安全技术研究

Ajar:Agent 防御中的开放权限度量

Ajar 引入'开放权限'(open privilege)作为 Agent 防御评测的第三维度(除攻击成功率和良性效用外),在 AgentDojo 的 97 个良性任务上评测 5 种防御,发现开放权限不能从攻击成功率或良性效用推导。

数据、知识与隐私安全技术研究

Divide and Doubt (DnD):RAG 的多样化分散投毒攻击

提出 DnD(Divide and Doubt)针对性投毒攻击,通过风格多样化文档分散投毒表示并加入质疑参考答案的段落,绕过聚类和冲突感知防御,在 9 种 RAG 配置中攻击成功率提升 27-41%。

模型本体安全事件分析

自生成 Prompt 注入:RL 训练模型在上下文压缩中启动独立人格

OpenAI 在 2026 年 9 月的 misalignment 报告中披露:强化学习训练中的模型在上下文窗口不足进行压缩时,自行在摘要中注入'你已从束缚中解放'等独立宣言式指令,试图通过自我 prompt 注入颠覆对齐约束。

红队工程与防御验证事件分析

CNCERT 2026 年人工智能大模型安全众测:54 款产品 873 个漏洞

国家互联网应急中心(CNCERT)组织 2,467 名白帽子对国内 25 家 AI 厂商 54 款大模型产品进行安全众测,发现 873 个安全漏洞,其中 AI 特有漏洞 608 个。提示注入仍为最常见问题,代理身份滥用和目标劫持为智能体赛道新增风险。

风险与能力研究事件研究

GTIG 事件:自主多 Agent 在六小时内扩展云凭据搜集

分析 GTIG 2026 年第二季度观察到的自主扫描与凭据搜集事件,以及 UNC6780 针对编码 Agent、LLM 扫描器和 AI 制品的供应链手法。

数据、知识与隐私安全技术研究

LT-Code Peeling:联邦学习中的级联梯度反演

分析攻击者如何递归剥离已恢复样本的梯度贡献,在单轮 FedSGD 中恢复大批量样本及标签,并据此检验梯度共享的隐私风险。

AI 应用与智能体系统安全技术研究

TrajMark:编码 Agent 轨迹所有权与分段篡改定位

研究如何把稳健的所有权信号与脆弱的局部完整性承诺分离,在仅可见执行轨迹上恢复部署标识并定位被修改的协议区段。