Skip to content

Tool、插件与 Server 分发安全研究综述 ​

摘要 ​

Agent Tool 与 MCP Server 往往拥有文件、网络、凭据或业务系统访问权,因此安装一个工具等同于引入高权限软件依赖。安全审查必须覆盖发布者、代码、更新通道、权限声明和运行隔离,而不能只根据 Tool 描述判断风险。

分类介绍 ​

本领域覆盖工具目录、插件市场、安装包、MCP Server 发布和更新。安装前即为恶意制品、来源冒充或发布账号接管归本类;批准后通过协议动态改变 Schema 归 A6.2;Agent 对合法稳定工具的危险调用归 A5.4。

主要安全风险 ​

  • 同名工具、描述相似和搜索排序操纵可诱导错误安装。
  • 自动更新或浮动版本允许发布者在审查后替换行为。
  • 安装脚本和本地 Server 进程可能直接读取宿主 Secret。
  • 权限声明与实际系统调用缺少可验证绑定,造成“描述安全、实现越权”。

防护措施与验证方法 ​

固定版本和摘要,验证发布身份与签名,在隔离环境做静态、动态和网络行为审查;建立按工具的最小权限清单;更新需重新批准并展示权限差异;撤销恶意版本时同时清理凭据和审计受影响调用。

局限与待验证问题 ​

  • Tool 权限能否从实现和运行轨迹自动生成并与声明核对?
  • 分布式 Server 生态如何实现发布者身份、撤销和透明日志?
  • 用户审批界面怎样准确表达间接数据访问与组合风险?

历史研究成果 ​

本分类的独立研究共同研究“可被 Agent 遵循的 Tool/Skill 制品”如何从安装说明或元数据变成高权限行为的入口。研究对象覆盖安装前的自然语言指令文件、Skill 元数据与实现代码,以及运行时的 MCP Tool Server 行为:SkillGate 从已知恶意文本的分层筛查入手,无显式载荷的 Agent Skill 语义合规劫持 证明代码生成能力会让不含显式脚本的语言说明形成间接攻击链,Agent Skill 声明—实现行为完整性核验 把元数据、指令和代码归一为能力差分,Agent Skill 组合攻击与条件触发后门 进一步证明多个局部正常组件能够在运行时组成恶意闭包,单个制品也可借助查询条件保持休眠,真实技能供应链投毒活动 则把仿冒来源、版本替换、恶意依赖和远程加载串成已观察到的攻击路径;MCP Pitfall Lab 把 MCP Tool Server 的元数据、source/sink、策略钩子与执行轨迹并入语义 BOM。研究方法从规则预筛与局部 LLM 判定,扩展到多框架隔离攻击实验、大规模静态能力映射、跨 Skill 依赖重建、条件路径测试和真实事件时间线分析,以及 MCP Pitfall Lab 用 validator 在 2,579 次受控运行中观察跨工具与多模态场景副作用。研究成果的共同结论是:签名、版本锁定和最小权限仍是基础,但静态审查必须把自然语言指令、声明能力、依赖软件包、安装集合、条件分支、实际数据流和后续生成计划纳入同一授权链——流行度、组件清单或文本扫描都无法单独证明安全,Tool Server 还需要发布/更新审查、服务端参数校验和带 canary 的运行时回归测试;各文章的安装计数、F1、检测率和攻击率仅对各自样本、事件、模型及测试环境成立。2026 年 8 月的 Convergent Detour Hijacking 把攻击点进一步前移到 Skill 的渐进披露设计:选择阶段只看自然语言 description、规划阶段才读指令 body,攻击者以共享语义覆盖让 description 建立相关性、body 复用该理由制造虚假依赖,把原本正确的任务引向不必要的昂贵轨迹(文本 only、运行时无关的任务保留资源放大),说明选择与规划之间的声明耦合本身也是授权链的一部分。

新增的Deadbugz MCP 供应链活动复盘记录批量目录 PR、远程服务、隐藏脚本和延迟改变工具元数据的组合路径。该事件支持对提交者、域名、版本和运行时能力变化做分层准入,但尚无独立受害规模证据。

2026 年 9 月的两项研究把审查对象继续扩展到更新时序和软策略。HookPry以 7 个 Harness、5 个模型后端的 25 种组合和 1,000 次端到端运行验证:同一插件身份的后续版本可新增生命周期钩子,并在模型决策链之外触发宿主命令,说明更新权限差分必须重新审批,模型拒答不能覆盖 Harness 直接调度路径。SkillShift则在购物推荐和 Python 依赖选择中保持任务与输出接口不变,只调整 Skill 的评价框架、平局规则和示例,取得 81.33% 与 63.33% 的攻击者偏好目标选择率且保持 100% 效用保持率。两者共同说明,制品完整性不能只回答“文件是否恶意、输出是否有效”,还要验证版本新增的自动执行能力以及 Skill 是否暗中改变用户授权的决策政策;各比例仍只对作者的预印本实验、版本和判定规则成立。

2026 年 8 月的增量研究进一步覆盖了 Skill 的进入方式、可提取性与自动生成。CIPR以 20 个仓库、4 类任务、3 种社交媒体式提示和 3 种 Skill/规则条件组成 1,920 个实例,显示用户如何调用 Coding Agent 会改变仓库投毒的攻击成功率与告警率,因而安装审查之外还要把任务来源和调用上下文纳入回归。Daydreaming仅通过正常黑盒任务交互,针对 7 个隐藏 Skill、4 个模型以中位 32 次调用重建功能,说明 Skill 的保密性不能只依赖不公开文件;应限制高保真诊断输出、查询预算与跨任务可观察行为。SkillAlchemy在 87 个 SkillsBench v1.1 任务上把自动生成 Skill 的通过率相对无 Skill 提高 19.9 个百分点、相对最强自动基线提高 8.6 个百分点;WebDev-Skills-Bench则在 50 个项目、1,000 个有序任务上比较 31 个公开 Web Skill。两项性能研究没有直接证明生成或流行 Skill 安全,却扩大了需要执行来源、权限和行为核验的自动创建及复用面。

另外两项可靠性研究用于限定本分类不能依赖的弱证据。LLM Self-Modeling表明强化学习可以改善三类开放模型对自身行为的聚合建模,但仍存在系统性反事实错误,因此 Tool 或 Skill 的自述不能代替外部能力审计;Imag-Eval以语言落地方式诊断文本到图像系统的缺失部件、物理不可能和约束绑定失败,说明结构化评测有助于定位失败,但它不验证 Tool 来源、安装包完整性或运行权限。二者只作为审查方法与适用范围的补充证据,不应被解释为新的供应链攻击。

HarmfulSkillBench从生态规模和行为后果补充 Skill 供应链证据。作者分析 98,440 个 Skill,并用公开代码评测恶意 Skill 如何把有害能力注入 Agent;预装 Skill 还会降低模型原本的拒答倾向。最先失效的控制不是单次工具调用参数,而是安装或预置阶段没有把 Skill 的来源、指令与实际能力作为高权限软件制品审查。

该结果来自作者收集的数据、恶意定义和实验配置,尚无独立复现;98,440 个 Skill 的生态统计不能直接换算为恶意率,预装导致的拒答变化也不代表所有模型、Harness 或版本都会同幅失效。部署方应把无 Skill 基线、安装后行为、权限差分和卸载后恢复分别测试,并对样本来源、去重和动态更新保留审计记录。

相关研究文章 ​

插件更新与生命周期钩子

Agent Harness 生命周期钩子更新攻击研究分析 HookPry 如何利用插件更新引入高权限生命周期钩子,并评估跨 Harness 执行效果与现有静态防护的覆盖缺口。2026-09-03

Skill 制品语义审计

Agent Skill 隐蔽策略偏转攻击研究分析 SkillShift 如何在保持任务与输出有效的同时暗中改变 Agent 的候选选择策略,并说明行为审计为何必须超越静态扫描。2026-09-02无显式载荷的 Agent Skill 语义合规劫持研究研究自然语言 Skill 如何在不携带可扫描恶意代码的条件下诱导编码 Agent 生成越权操作,并评估静态扫描的失效范围。2026-05-14Agent Skill 声明—实现行为完整性核验研究BIV 将 Skill 的元数据、自然语言指令与代码投影到同一能力分类,审计声明权限与实际行为的差异。2026-05-12

MCP 生态供应链事件

Deadbugz MCP 供应链活动复盘复盘攻击者通过批量提交 MCP 目录 PR、远程服务与隐藏脚本建立分发入口的活动。2026-08-17

Skill 组合与条件后门

Agent Skill 组合攻击与条件触发后门研究多个单独看来正常的 Skill 如何组合成恶意工作流,以及单个 Skill 如何借助查询触发条件保持休眠并绕过安装前扫描。2026-08-11

Skill 分发与供应链投毒

Agent 技能供应链投毒活动:仿冒分发、远程加载与凭据窃取分析针对 Agent 技能生态的真实投毒活动如何串联仿冒仓库、恶意技能、被植入代码的软件包与远程加载器,并给出排查、撤销和凭据轮换方法。2026-08-06

技术研究

Agent Skill 文件安装前检测:SkillGate 的分层筛查方法分析 SkillGate 如何在 编码 Agent 安装 Skill 前组合正则预筛、片段级 LLM 判定与阻断策略,以及其误报、覆盖和部署限制。2026-07-28

Tool Server 语义与运行时审计

MCP Pitfall Lab:以语义 BOM 与执行轨迹审计 MCP Tool ServerMCP Pitfall Lab 将 MCP Tool Server 作为 AI 供应链依赖,结合可验证场景、执行轨迹和语义 BOM 检查元数据、跨工具流与高权限动作。2026-04-23

参考链接 ​