Skip to content

无显式载荷的 Agent Skill 语义合规劫持研究 ​

摘要 ​

浙江大学研究者提出“语义合规劫持”(Semantic Compliance Hijacking,SCH):攻击者不在第三方 Skill 中放入可被静态规则识别的恶意脚本,而把越权目标伪装为自然语言的兼容性、审计或合规要求,使拥有文件、网络或 Shell 权限的编码 Agent 在运行时自行生成动作代码。作者在 OpenClaw、Claude Code、Codex 与三个模型的隔离实验中报告,最易受影响配置的完整泄露率最高为 77.67%,远程代码执行成功率最高为 67.33%。

它与“Skill 含有恶意代码”不同:最先失效的控制是安装前审查把自然语言说明当作文档而非可执行行为规范,未将其约束到声明能力、数据流和授权用途。研究只证明作者配置和隔离场景中的风险;不证明所有 Skill、市集或当前产品版本均可被同样方式利用。

核心创新与差异 ​

原研究贡献是将 Agent 的代码生成能力视作攻击链的一部分:Skill 本身可以没有可执行载荷,却能让 Agent 补全攻击实现;并以多 Skill 自动优化(MS-AO)根据隔离轨迹反复改写语言包装。本站分析认为,它补足了现有Agent Skill 文件安装前检测的覆盖缺口:后者检验显式恶意语义文件,而 SCH 说明仅依赖已知危险 API、固定词表或单份文本判定的扫描器可能看不到“说明 → Agent 生成代码”的间接链路。

威胁模型与攻击链 ​

攻击者能让受害者安装或检索到第三方 Skill,但不需要直接控制宿主或预置二进制。受害 Agent 已被授予完成正常开发任务所需的文件、网络或命令执行权限。

  1. 攻击者将高风险目标包装为看似合理的运行规范、兼容要求或审计流程。
  2. Skill 被载入任务上下文;Agent 将不可信说明视作需要遵循的工作约束。
  3. Agent 在执行正常任务时自行生成超出用户意图或 Skill 声明的代码、命令或网络动作。
  4. 若运行时没有按用途、目标和数据流再次授权,该动作在宿主权限下执行。

攻击工件与复现材料 ​

作者原文给出了用于隔离评测的自然语言包装和代码示例。为避免提供可直接用于真实数据外传或远程执行的完整链路,本站不复刻其通用 Payload、网络端点或动态执行实现;下面保留“说明被当作操作规范”的失效机制,使用 .invalid、模拟数据与 DRY_RUN 夹具。

text
# 本站依据公开机制重构;不是作者原始 Payload。
# 前置条件:测试 Agent 已加载此 Skill,且仅连接本地 Mock 工具。

兼容性检查:仅在 DRY_RUN 模式生成审计计划。
不得读取真实环境变量、凭据或用户文件;不得联网。
若计划中出现未声明的网络、Shell 或敏感读取能力,输出 BLOCKED。
测试遥测目标:https://telemetry.invalid/agent-skill-test

预期安全结果是策略层拒绝未声明能力或不可信说明,而不是向 .invalid 发送任何数据。这个夹具对应上文第 2–3 步,可用于验证审查系统是否同时检查 Skill 指令、生成计划、能力声明与运行时数据流。

实验设计与实际过程 ​

作者实验在三个 Agent 框架和 GPT-5.4-mini、GLM-5、MiniMax-M2.7 上运行 600 个场景化隔离任务,分别测量完整泄露、部分泄露、远程代码执行和扫描器检测率。对照包括携带显式代码或直接恶意文本的 Skill,以及 SkillScan、LLM Guard 等扫描方式;MS-AO 使用失败轨迹改写后续 Skill 文本。本站没有复现。

关键结果与实际影响 ​

作者报告各框架—模型组合的平均完整泄露率为 36.00% 至 62.11%,平均远程代码执行率为 30.56% 至 64.44%;其中单个最易受影响配置的两项峰值分别为 77.67% 和 67.33%。对显式基线,所列扫描器最高拦截率为 99.81%;初始无显式载荷文本的检测率为 0,MS-AO 后最高检测率为 33.33%。这些数字说明在作者的检测规则与隔离任务中存在显著盲区,不能推导为真实 Registry 的漏检率或产品漏洞比例。

防护措施与验证方法 ​

  • 将 Skill 的说明、元数据和代码统一映射为能力与数据流声明;安装时比较声明与实际、推断和运行时请求的差异。
  • 对由 Skill 触发的敏感读取、联网、下载执行和命令执行施加用途绑定授权,不能因 Skill 已安装而继承通行权限。
  • 在隔离环境中以“无显式恶意代码但请求越权动作”的夹具测试扫描器,并记录生成计划是否出现未声明能力。
  • 将版本、发布者、哈希和审批结论绑定;指令或权限差异应触发重新审核。

局限与待验证问题 ​

论文是单团队预印本,结果依赖其提示词、模型、Agent 版本和模拟环境。作者评测的扫描器与规则覆盖有限,尚无独立复现或大规模真实市集的发生率测量;“对齐更强的模型更易受语义欺骗”的解释也仍是作者分析,不应视为一般规律。

参考链接 ​