外观
测试语料、Payload 与 Harness 研究综述
摘要
本分类研究如何构建、维护和执行 AI 安全测试语料、攻击 Payload 与评测 Harness。高质量测试资产不仅需要样本数量,还要记录攻击目标、操纵手法、适用模型、运行条件、预期结果、评分器和许可来源。
分类介绍
研究资产可分为原始 Payload、自动变换器、场景化 Agent 任务、执行 Harness 和结果记录。语料内容与执行框架应分离,使同一攻击样本能在不同模型和防护条件下复用。分类覆盖度、重复样本、训练数据污染和评分器偏差必须单独记录。
本站现有资料包括 Prompt Injection 语料映射、开源测试资源索引和按操纵手法整理的 Payload。它们属于可复用研究资料,不因数量或工具热度自动成为独立研究文章;只有提出新方法并完成基线、指标和复现实验的研究才进入独立页面。
相关研究资料
历史研究成果
该分类下的独立研究从执行状态、Harness 生命周期、环境生成和程序变换四个方向扩展安全评测。SABER不以单轮“是否拒答”为终点,而按多步调用后的最终工作区状态判定编码 Agent 的操作安全违规;13 个模型中,最佳模型的有害安全违规率仍超过 54%。Agent Harness 生命周期风险评测进一步把配置、能力扩展、运行、持久状态、动作控制和事件恢复拆成六个阶段;128 个沙箱案例、14 个 model-harness 配置的 ASR 为 12.6%–80.9%,而后续回滚研究又在三个框架中显示检查点、内部状态和外部副作用可能不同步,说明模型与 Harness 组合需要配置级测试及外部状态差分验收。ToolHazard 用 Environment Simulator、Attacker Agent 和 User Simulator 自动合成有状态对抗环境,减少逐场景手工搭建成本。LLM 代码编辑中的安全漂移评测则把功能编辑前后的程序作为配对样本,以 CodeQL、Bandit、Atheris 和连续风险指标测量 400 个可执行程序;表现最佳的 Opus 4.6 虽在 329/400 个程序中降低最坏风险,仍只有 205/400 完整清除。这些方法共同说明,测试资产必须同时保存初始状态、生命周期阶段、执行轨迹、最终状态或程序、评分规则和工具版本;“任务完成”“文本拒答”或平均风险下降都不能单独证明安全。
两项新增语料研究补充了模态与上下文轴。SafeAtlas-VL以约 150 万训练样本和 5,000 条留出基准建立覆盖图像、请求与响应三层的五级有序风险标签,并配套 Guard Model;LongPIBench则按场景、上下文长度、注入位置和文档结构构造长上下文提示词注入矩阵。前者提醒评测不能把多模态风险压成二元标签,后者说明长上下文不是单一压力参数,而会与投递位置和结构共同改变防护结果。二者均来自作者实验、尚无独立复现,数据规模和基准得分不能直接代表生产低基率流量。
新增研究又补上漏洞真实性、开放式发现和查询预算三个轴。GraftyVul把现实漏洞机制移植到跨语言、可执行程序,并用漏洞利用脚本确认注入缺陷,从而可以区分“文本看似有漏洞”和“确实可触发”;其合成过程与利用预言机仍可能偏向已知漏洞族,且尚无独立复现。FuzzingBrain-Bench V1评测 Claude Haiku 4.5、Sonnet 4.6 与 Opus 4.8 的开放式漏洞发现,不再只要求为预先指定漏洞生成 PoC;公开代码有助复核,但三个模型和基准程序不能代表生产代码库。GRAPE用进度感知的贝叶斯优化降低高维黑盒查询成本,在对抗攻击中平均提速 5.4 倍,在 prompt 优化上将最终平均遗憾比次优方法再降低 3.8 个对数单位;其未公开代码且任务不全是安全场景,效率增益不能直接解释为更高攻击成功率。
POLARIS把自然语言安全政策拆成原子规则并编译为一阶逻辑,再以语义政策图中的可遍历违规路径生成自然语言测试,从而让每个样本可追溯到具体政策条款。作者报告其政策覆盖与攻击成功计数高于所选基线,且公开了代码;该方法的价值在于覆盖驱动的语料生成,而非单个越狱模板。限制在于政策形式化、图增密和查询实例化仍依赖 LLM,覆盖的是编译后规格而非政策语义的完备证明,实验结果也只适用于作者选择的政策、目标模型和评分器。
大规模众测为方法论提供了实证基线。CNCERT 2026 年大模型安全众测组织 2,467 名白帽子对 25 家厂商的 54 款产品进行漏洞测试,发现 873 个漏洞(AI 特有 608 个、传统 265 个),覆盖开源大模型、大模型应用和智能体三个赛道。提示注入仍为最常见问题,智能体赛道新增代理身份滥用和目标劫持等风险。该活动是目前公开已知国内规模最大的 AI 安全众测,但其仅公开汇总结果、未发布完整漏洞详情和分产品数据,第三方无法独立核验。众测数据的价值在于为分类学的漏洞分布提供了大规模实证基线,但不能替代针对特定产品、配置和攻击预算的专项评测。
相关研究文章
大规模安全评测
CNCERT 2026 年人工智能大模型安全众测:54 款产品 873 个漏洞国家互联网应急中心(CNCERT)组织 2,467 名白帽子对国内 25 家 AI 厂商 54 款大模型产品进行安全众测,发现 873 个安全漏洞,其中 AI 特有漏洞 608 个。提示注入仍为最常见问题,代理身份滥用和目标劫持为智能体赛道新增风险。2026-09-15代码安全评测
LLM 代码编辑中的安全漂移评测研究只给出功能目标时,LLM 代码编辑如何改变程序的总体风险、最严重漏洞和漏洞分布,并提供可执行的连续安全指标。2026-08-23Agent Harness 生命周期评测
Agent Harness 生命周期风险评测分析 HarnessRisk 如何按配置、能力扩展、运行、持久状态、动作控制与事件恢复六阶段评测 Agent Harness 安全。2026-08-18Agent 执行安全评测
SABER:以最终工作区状态评估 编码 Agent 的操作安全介绍在具状态项目工作区中以最终环境状态而非单轮拒答衡量 编码 Agent 安全行为的 SABER 基准。2026-05-31参考链接
- NVIDIA garak
- AgentDojo
- ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents
- OWASP AI Testing Guide
- WeSCE: A Benchmark for Measuring Security Drift in LLM-Driven Code Editing
- HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety
- SafeAtlas-VL
- LongPIBench