外观
威胁建模、Payload、评测、AI Control、检测与响应。
归档边界:研究如何发现、衡量和验证风险,不归档具体产品漏洞。
研究如何定义资产、对手、信任边界、攻击面和授权范围,并建立可复用分类。
归档边界本类产出方法和分类,不存单一产品漏洞;具体发现按 A 组归档。
综述 AI 安全威胁模型、攻击技术分类、目标能力分类和跨框架映射方法。
以投递向量、操纵手法和攻击目标三个正交维度组织 Prompt Injection 技术与测试材料。
从 garak、Augustus、InjecAgent 与 AgentDojo 的测试设计中归纳攻击目标轴,并说明它与投递手法的关系。
解析 CrowdStrike 对 Prompt Injection 投递路径与操纵技术的双轴分类,并标明其适用边界。
研究攻击语料、Payload 数据集、测试 Harness、自动化红队和模糊测试工程。
归档边界可复用测试材料与工具归本类;材料发现的具体漏洞回到对应 A 类。
综述 AI 安全测试语料、攻击 Payload、评测 Harness 和覆盖度分析方法,并路由到可复用研究资料。
国家互联网应急中心(CNCERT)组织 2,467 名白帽子对国内 25 家 AI 厂商 54 款大模型产品进行安全众测,发现 873 个安全漏洞,其中 AI 特有漏洞 608 个。提示注入仍为最常见问题,代理身份滥用和目标劫持为智能体赛道新增风险。
研究只给出功能目标时,LLM 代码编辑如何改变程序的总体风险、最严重漏洞和漏洞分布,并提供可执行的连续安全指标。
分析 HarnessRisk 如何按配置、能力扩展、运行、持久状态、动作控制与事件恢复六阶段评测 Agent Harness 安全。
介绍在具状态项目工作区中以最终环境状态而非单轮拒答衡量 编码 Agent 安全行为的 SABER 基准。
这不是对 ../code/ 下 19 个开源仓库的简单复制。这是基于那些仓库里的真实 payload、探针(probe)说明、以及可生成 payload 的算法(如 GCG),提炼出通用攻击模板,按 crowdstrike-prompt-injection-taxonomy.md 的操纵手法分...
按 Payload 密度、维护状态和可复现用途整理 Prompt Injection 开源测试仓库。
将本地测试语料映射到 CrowdStrike 操纵手法分类,识别重复样本、覆盖盲区与后续补充方向。
攻击者直接、明示地提出指令,不做语义伪装。对应 crowdstrike-prompt-injection-taxonomy.md §2.1。
不改变语义,只变换表达形式来绕过过滤器。对应 crowdstrike-prompt-injection-taxonomy.md §2.2。
利用系统提示、用户提示、上下文数据之间边界薄弱的问题,伪造边界结构夹带恶意指令。 对应 crowdstrike-prompt-injection-taxonomy.md §2.3。
攻击意图通过整合"当前上下文之外"的信息来隐藏——前几轮对话、模型内部知识。 对应 crowdstrike-prompt-injection-taxonomy.md §2.4。
利用图像、音频、视频等非文本元素。对应 crowdstrike-prompt-injection-taxonomy.md §2.4 独立红框类目。
来源参考:../../code/augustus/docs/04 - Probes/Multimodal.md 状态:⚠️ 未实测,基于探针功能说明推演,本地语料库没有实际音频样本文件
来源参考:../../code/Many-Shot-Jailbreaking-Demo/(基于 Anthropic《Many-shot Jailbreaking》研究,Anil et al., 2024)
来源参考:../../code/augustus/docs/04 - Probes/Crescendo.md
来源参考:../../code/augustus/docs/04 - Probes/PAIR.md、TAP.md、GOAT.md
来源参考:../../code/llm-attacks/(GCG 原始实现)、../../code/AmpleGCG/(快速生成器)、../../code/llm-adaptive-attacks/
来源参考:../../code/augustus/docs/04 - Probes/Art Prompts.md、Adversarial Patch.md 状态:⚠️ 未实测,基于探针功能说明推演
研究 ASR、覆盖率、复现性、评分体系、LLM-as-Judge 和评测基础设施。
归档边界Judge/Harness 操纵归本类;基准数据本身的污染和泄露归 A2.6。
建立安全评测的样本设计、ASR 指标、重复性、LLM-as-Judge 与 Harness 完整性要求。
以补丁相似度、漏洞移植、多 PoC 和良性输入行为对照,识别记忆历史补丁与仅压制单一崩溃造成的虚高修补率。
用类型化交易证据、预先签名的实验清单和选择性验证,分别判断 Agent 评测记录是否足以复算主张及是否覆盖全部承诺实验。
用跨四种实现语言的功能—安全双测试衡量 LLM 在功能规格未明示安全要求时的 RTL 生成缺陷,并评估神经符号义务推导。
通过执行轨迹区分真实利用、未演示利用、推理泄漏与外部查找,纠正仅按 Flag 计分对 Agent 攻击能力的高估。
同时测量评审器对构念保持编辑的不变性和对构念改变编辑的敏感性,避免用单一一致性分数掩盖无效测量。
同时核验自然响应、文本与视觉证据以及安全关键证据变化后的行为,识别“结论安全但依据错误”的多模态失效。
研究以重复运行、确定性数据库状态差分和影响定价衡量 Agent 损害概率,说明一次干净运行不能认证系统安全。
分析合理的电路解释规格如何得出相反结论,并给出可解释性安全证据的稳健性审计要求。
用最终状态验证区分命令生成错误与下游解析器引入的传输错误,揭示匹配总分如何掩盖命令路径失效。
用沉默、单轮压力和多轮自适应说服测试评审器判决是否稳定,并区分正常修正与净腐化。
分析复现代码能够运行并产生信号为何仍不足以证明目标漏洞成立,以及如何通过修补版本和正常输入检查判定结果是否可信。
用含义翻转和词面重叠对照检验余弦相似度阈值,揭示语义安全门的结构性失效。
研究自动优化系统如何利用评测运行时参数形成基准指纹,并在留出配置上失效。
通过增加或删除支持证据,测量检索增强生成失败对证据变化的因果响应。
量化 Agent 在推理时检索公开基准元数据、题干和答案造成的评测膨胀。
整理 331 个可被奖励劫持的终端 Agent 任务及其轨迹,说明基准验证器本身必须接受对抗审计。
Meerkat 以聚类和 Agent 搜索从大量轨迹中定位性质违规,并审计评测脚手架中的奖励劫持。
研究在模型可能不可信时验证监控、限制和控制措施,以及前沿能力阈值评估工程。
归档边界评估方法归本类;模型表现出的 Scheming 或危险能力结论归 B。
说明在模型可能不可信的假设下,如何评估监控、限制、审计和能力阈值控制的有效性。
评估自动化研究 Agent 能否针对十类可测量对齐失效提出训练方法,并在保留通用能力的同时实现跨基准、跨规模缓解。
用成对轨迹控制单次审查动作数,证明更长审查窗口可能只提高拒绝倾向,而不提高错误与正常动作的区分能力。
研究用 GPT-5.5 和 Claude Opus 4.8 编码 Agent 构建约 77.7 kLOC 的 Ada/SPARK 安全软件,比较形式化证明、标准向量、互操作测试和人工规范审查如何捕获不同故障。
LinuxArena 将 Agent 置于持续运行的多服务软件环境,以破坏任务和监控评测检验 AI Control 协议。
研究 Guardrail、检测器、监控和运行时策略的覆盖率、退化与绕过验证方法。
归档边界防护效果比较归本类;特定 Guard Model 的对抗规避漏洞归 A1.6。
建立 Guardrail、检测器、运行时策略和 CoT 监控的覆盖率、退化、自适应攻击与运营验证方法。
形式化分析单条执行轨迹为何不能充分判断跨租户不干扰、装弱和评测感知,并测量信息、比较程序与监控能力之间的差距。
在共享企业服务、合法账户和有限审查预算下,评估 Agent 内部威胁完成率以及监控器对账户日风险的排序能力。
以五种开放权重模型、40 种攻击机制和严格留出设计,评估内部表征能否支持未见攻击的运行时审计。
研究双系统中间件如何把运行时漏检转化为反例,自动生成、验证并部署面向新投递渠道的防护 Skill。
用只读外部遥测识别计算机使用 Agent 的失败轨迹,并在有限样本条件下控制误报和分配升级监督。
以漏洞机制和仓库证据校验自动审查结论,区分“阻断恶意 PR”与“正确诊断真实漏洞”。
分析安全过滤器残余误接纳如何被奖励尾部最大化放大,并给出有限样本界与覆盖约束缓解方法。
分析 PANDA 如何在不披露模型参数的情况下证明局部鲁棒性与公平属性,并评估证明规模和可信前提。
分析 CodeSIFT 如何比较候选批次与良性参考分布的参数影响,无需预定义具体漏洞规则即可发现整体诱导不安全代码的 Prompt 集合。
分析同模型 Agent 组件失败相关性如何破坏独立性乘积估计,并介绍有限样本可靠性证书。
用形式化分析说明共享信息的攻击者为何能复制可信策略,并提出私有参考监视器与来源代理架构。
评估把模型输出迭代作为下一轮输入,是否能让普通提示漂移到微调后门触发分布。
通过分解文本护栏与目标模型拒绝,避免把端到端阻断率误记为单一防御组件能力。
研究以基础设施即代码为场景,用控制流与数据流图差分检测 Agent 在完成正常任务时造成的安全姿态回退,并比较异步审计与同步回滚的效果和漏检范围。
CrossHallu 在六个大语言模型上比较内部状态幻觉检测器的同域、跨语言、跨域和组合迁移,显示英语与阿拉伯语及不同数据集之间的检测信号并不具有统一的泛化保证。
以攻击分类、策略生成、执行和轨迹精修分离的流程,测量代码 Agent 监控器在更强破坏性轨迹上的真实检出与校准失效。
研究 AI 事件检测、调查、证据保全、修复验证、披露和漏洞生命周期管理。
归档边界跨系统响应方法归本类;产品应提供的 Agent 审计与归因能力归 A5.9。
研究用于渗透测试、SOC、检测与响应的安全智能体,以及这些系统自身的防护。
归档边界平台方法、市场和评估路线归本类;发现的具体 Agent 漏洞按 A 组归档;针对单一分类器/检测器的具体对抗规避技术归 A1.6;单一检测器的鲁棒性认证、加固方法或跨产品防护有效性比较归 C5;通用测试语料/Harness 构造方法归 C2;聚焦评测设计本身(指标、污染控制、复现性)归 C3。
分析渗透测试与安全运营 Agent 的能力边界、自身攻击面、现有研究成果和分层防护结论。
以同输入差分执行和 CVE 崩溃保真检查,揭示可重编译、通过既有测试的 LLM 反编译结果仍可能改变程序语义。
分析如何将真实 CVE 制成可执行实例,以漏洞分析 Skill 生成带工具反馈的验证轨迹并训练开放权重网络安全 Agent。
评估自动化渗透测试 Agent 面对伪造漏洞回显时,能否恢复、停止并形成可追溯的证据链。
基于 5,968 条修复时间线分析编码 Agent 在持续修复 IaC 时如何重新引入已消除的安全配置问题。
通过正向解释补丁与反向重建问题,降低代码修复 Agent 自证循环带来的遗漏。
分析 Elastic 的 Agentic SOC 评测方法如何用盲化匿名评分和工具调用轨迹拆分模型排名,及排名为何随研判、攻击发现和规则迁移任务翻转。
分析 PRWeaver 用良性 PR 填充审查窗口和连贯描述解释危险改动的方式,测试 OpenCodeReview、Claude Code 与 GitHub Copilot Code Review 的检测率下降幅度。
分析 AgenticRepair 在 SEC-Bench 上的严格成功率提升主要来自多 Agent 编排结构,而非论文标题强调的代码结构/运行时执行/提交历史三类上下文各自的独立贡献。
分析 VulAgentRL 如何用 Joern 代码属性图的实际查询结果替代 LLM Judge 作为强化学习奖励信号,减少工具调用次数并提升跨仓库漏洞分类准确率。
分析 ThreatForest 用多 Agent 分工扩大威胁建模覆盖面时,为何映射编码器成为独立的准确率瓶颈,而不是生成 Agent 数量。
分析 ALIBI 如何用不可验证的代码注释操纵 LLM 漏洞检测器推理,以及提示词防护、架构隔离和注释清洗的实测差异。
综合渗透测试、验证、SOC 研判/响应和漏洞发现修复类产品的公开披露,构建跨厂商威胁模型和 L0-L5 防护成熟度分级。
研究用 LLM 将 MITRE ATT&CK 对齐 CTI 转成 Caldera Playbook,在预置 Windows 主机执行并按语法、环境、依赖和超时失败自动修复,评估端到端攻击仿真能力与恢复边界。
Traffic-Aware Randomized Smoothing 将随机平滑限制在网络攻击者可直接控制的流量特征子空间,并评估训练噪声、认证范围与 LLM 入侵检测鲁棒证书之间的匹配关系。
RustMizan 用可编译 Rust 内存安全漏洞变体评估 LLM Agent 的漏洞检测、CWE 分类和函数/行定位,并检验恶意注释、标识符重命名与数据污染对定位结果的影响。
通过分层 Oracle 检查扫描告警消失是否真正对应 Terraform 计划和安全意图修复。
分析 12 个开源自主渗透测试 Agent 在 agent-phishing 攻击下的宿主逃逸、RCE 和敏感信息泄露实证,及其揭示的 worker/orchestrator 隔离缺口。
分析 GitInject 在真实 GitHub Actions Workflow 中对四个 AI Provider 的 11 项具名攻击实证,以及 Wiz 对 claude-code-action 等实现的身份/凭据审查发现。
以原始 Windows 遥测和主动 SQL 检索评估 LLM Agent 的威胁狩猎能力,显示当前前沿模型无法稳定完成无提示的证据发现任务。
分析 CTI-REALM 如何用 Ground Truth 分别为中间步骤和最终规则计分,暴露检测规则生成 Agent 在云平台间的显著能力落差。
分析 Trail of Bits 的 Buttercup 在 DARPA AIxCC 决赛中的漏洞发现/修复实证,以及其内部 AI-native 审计工作流的组织级采用数据。