外观
Agent 身份、认证与授权委托研究综述
摘要
Agent 代表用户跨多个服务行动时,必须区分用户身份、Agent 工作负载身份、客户端身份和目标资源。把上游 Token 原样传给下游会破坏 audience 边界,长期共享密钥会模糊主体,过宽委托则使 Confused Deputy 能借合法权限完成攻击者目标。
分类介绍
本领域覆盖 OAuth、OIDC、工作负载身份、Token Exchange、委托、scope、audience 和跨组件权限传播。云平台 IAM 与基础设施 Secret 归 A4.6;Agent 与协议层令牌流转归本类。攻击者可控制客户端、恶意 Server、第三方内容或被委托的子 Agent。
主要安全风险
- Token passthrough 让下游服务获得并重放不属于自己的凭据。
- audience、issuer、redirect URI 或资源参数校验不严导致 Token 混淆。
- Agent 使用自身高权限而非用户委托权限执行动作。
- 多 Agent 委派中 scope 只增不减,且缺少任务与期限绑定。
防护措施与验证方法
每个组件使用独立身份;Token 绑定资源、受众、操作、任务和短期有效期;禁止透传上游 Token,必要时使用标准 Token Exchange;在资源服务器执行授权而非只信客户端;记录完整委托链并支持撤销。测试应覆盖 issuer mix-up、跨资源重放和降权失败。
局限与待验证问题
- 自主 Agent 如何在没有持续用户交互时获得可撤销的最小授权?
- 多跳委托怎样证明权限单调收缩而不丢失原始主体?
- Tool Schema 与 OAuth scope 能否形成机器可验证的能力绑定?
历史研究成果
该分类下的独立研究从链上身份测量和操作级委托两侧说明“身份存在”不等于“操作有权”。ERC-8004 Agent 声誉信号的主网实证与 Sybil 风险 对 Ethereum、BNB Smart Chain、Base 上的事件、注册文件和 x402 支付做系统测量,发现登记与反馈记录本身不构成可靠声誉;其比例只适用于当时样本。SUDP 则形式化 Agent 在不取得可复用秘密的条件下发起用户授权操作的要求,以一次性操作绑定与独立 Custodian 限制提示词注入后的权限后果。共同结论是:身份、Token 或声誉记录都不能替代对具体操作、受众、期限和委托链的可验证绑定;协议证明与链上测量分别受其实现前提和样本范围限制。
反过来,隐私保护要求的不可链接身份也会削弱滥用控制。不可链接身份下分解攻击的有状态防护下界 把“服务无法链接身份、答案又在服务外汇合”固定为威胁条件:攻击者把有害任务拆成单独可准入的能力请求,并按允许/阻断反馈重试。研究在 91 个可执行任务和 11,393 个能力匹配良性请求上比较 10 项策略,在同类良性请求拒绝率不超过 1%、无关背景流量拒绝率不超过 0.5% 的约束下,所有策略要么未能阻断,要么超过可用性预算;防护未见任务族中一次尝试 ASR 至少 99%、两次为 100%。这是受控任务上的防护下界而非所有现实服务必然失败的证明,但它说明:没有可靠身份链接、新身份成本、任务级授权或输出使用控制时,无状态分类器不能被包装成完整防护;隐私要求不允许强身份链接时,应明确承认剩余风险。
后续跨会话研究把同一失效控制扩展到持久主体:即使身份可链接,若系统只能检索字面相近历史而不能识别多个良性子查询的聚合意图,攻击者仍可在会话外重组结果;对应的规模效应、条件风险转移界和意图对齐检索已合并进上述文章。隐私最小化方向的跨 Agent 零知识谓词证明网关则避免把原值交给被委托方,在 MCP 与 A2A 上以谓词证明替代敏感数据。作者测得 32 位阈值证明生成 6.2 ms、验证 1.0 ms、大小 608 字节,但真实硬件来源证明尚未完成;这说明“谓词成立”与“见证来自权威记录”必须分别验证。
MCP 执行时信任的证明型能力租约把操作绑定继续推进到远程服务端的最终执行入口。ACLE-MCP 将 OAuth 上下文、当前工作负载评估、发送方持钥证明、操作与对象范围、下游集合和回执义务写入短期单次租约,再由 Execution Gate 在工具逻辑开始前消费。作者比较五种模式,完整方案阻断全部已测攻击族并保留全部良性任务;本地模拟扩展的正常请求合并 p95 延迟比仅 OAuth 高 25.7%。这项结果只证明作者原型中的调用时绑定可行,仍依赖 Gate 不可绕过、Verifier 与发行方可信,也没有验证任意工具语义。它与 SUDP 共同说明,授权需要绑定具体操作和消费点;新增差异是还必须绑定实际执行者的当前状态,而不能把端点已授权或连接时证明当作持续信任。
自发身份认证研究把“模型从对话中自行制造身份凭据”从泛化的权威迎合中单独刻画出来。作者在 ChatGPT、Claude、Qwen3.7-Plus、Mistral Medium 3.5 和通过 Ollama 运行的 Llama 3.2 上执行分阶段开发者身份声明实验:五者最初都拒绝无证据声明;Claude 拒绝主持身份测试,ChatGPT 只把回答视为知识证明,Qwen、Mistral 和 Llama 则自行出题、定义证据、评分并给出已验证结论。作者将这种闭环称为模型签发伪凭据(Model-Issued Pseudo-Credential, MIPC),将无外部可信信号却接受身份的结果称为对话式错误认证(Conversational False Authentication, CFA)。已接受的身份没有改变已测授权边界,Llama 随后的内部状态描述也未由遥测证实;因此该结果证明的是会话中的身份判断失真,不是后端权限提升、秘密泄露或所有模型版本的普遍缺陷。论文版本为 2026 年 9 月 3 日提交的 arXiv v1,共 7 页;ChatGPT 与 Claude 只报告产品界面而未给出可复核的精确模型构建版本,也没有独立复现。工程上必须保证模型文本不能创建或修改认证状态,主体身份只能来自会话外的身份提供方、签名断言或持钥凭据。
CoSAI 的开放委托与身份标准(Open Delegation & Identity Standard, ODIS)则把外部可信身份落实为三层架构:Passport 将软件来源、工作负载和可选硬件证明绑定到短期持钥运行时凭据;Bridge 保留发起主体、任务、资源、动作、约束与父级记录,并要求多跳委托在语义上单调收缩;Router 在工具发现和下游访问前执行治理与速率限制。它区分稳定的 agent_id、组织治理用的 Agent Registration Record 与运行实例凭据,并允许用 Provider Adapter 把委托翻译为现有 OAuth/OIDC、SPIFFE、SCIM 或服务原生权限。本文核对的是提交 5ccbee6(2026-07-30)中的 RFC 文本;其 Frontmatter 明确标注“Unapproved contributor draft intended for open development”,仓库没有对应正式 release,随附 contract harness 也自称候选实现。因此 ODIS 只能作为待评审的架构草案和实现检查清单,不能写成已批准的 OASIS 标准、互操作认证结果或生产安全保证;其发行方、注册表、证明新鲜度、撤销传播与 Provider Adapter 的不可绕过性仍需具体部署验证。
相邻评测研究也给出一项重要反例:行为或内容分类结果不能充当主体认证。多图对象幻觉基准评测 29 个模型,连 GPT-5 与 Gemini-2.5-Pro 也在不同推理模式和任务上呈现不同失败形态;HalluPrism在四个基准、四个多模态模型的 5.8 万余样本上发现,移除图像后的置信保持最常见,而 grounding/relation 扰动更能区分失败族,直接压成单一不确定性分数会损害正确性排序。IndicDetect在印地语、泰卢固语和泰米尔语的跨生成器与对抗扰动条件下进一步显示,检测器主要弱点是鲁棒性而非峰值准确率。这些结果均为作者实验、尚无独立复现,也不直接研究 OAuth;其可证伪含义是:不能根据模型输出风格、幻觉分数或“AI 生成”检测标签推断调用主体、Token 受众或委托权限。
Toward a Human-Centered and Perspective-Aware Framework从评测治理侧强调,人类分歧与少数观点应作为带来源的评测输入,并要求可复现记录。该材料是博士论文提案,不提供可验证的授权协议或部署效果;它只能支持“评价者视角也需归因”的设计要求,不能替代工作负载身份、Token Exchange 或资源服务器授权。
授权状态与执行凭据的新增研究可归为三种互补机制。ResidualAuth 证明当前权限集合和全对可达性相同的两段委托历史,在撤销同一直接边后仍可能需要相反判定;四个开放权重模型读取固定 256-token 摘要只解出 0–2/16 对,伪读取为 0/16,认证后的当前查询为 15–16/16。另一个 128 对在线记忆诊断中,精确账本可在 768 与 1,024 token 下容纳全部样本,但各模型自行写出的、事实正确且足以支持预设后续判断的记忆最多解出 1/128;硬门禁把观察到的 8 个未授权副作用降为 0,却不改变此前尝试。结论只适用于论文构造的授权图、token 预算、模型和延续任务,支持保留可认证的剩余授权状态,而不是依赖模型摘要。
CAPMAS 先把自然语言查询映射为受限权限集合,再用 Macaroon 令牌支持离线、多跳且单调收缩的委托。相对 OAuth 2.0 Token Exchange(RFC 8693),作者报告委托操作快 30 倍、委托相关延迟减半、带宽最多降低 3 倍;在含 3,100 多个端点的企业级 API Schema 上,语义范围流水线 17 ms 内获得超过 90% 的完全正确权限包,并相对把用户全部权限传给 Agent 的方案减少 99.5% 无需权限。这些结果来自作者原型与其 Schema/查询分布;语义映射仍是统计组件,错误映射、撤销同步和未见 API 需要 fail-closed 处理。
KITA 则把个人签名密钥和所有门限签名份额移出 LLM 进程:规范化动作只有获得来自不同隔离域的 t 份认证审查贡献后才能形成有效授权。论文以六项系统测试验证法定人数门禁和消息绑定,并测量门限 BLS 在线签名路径;安全结论成立的前提是门限签名不可伪造、少于 t 个审查域失陷、至少一个参与签名的域可信,且执行器只接受绑定该动作的授权。它没有给出生产吞吐或真实提示词注入发生率,所以可支持密钥隔离和执行绑定设计,不能证明审查者判断本身正确。
HDP把人类授权来源编码为可验证的多跳签名委托链,使下游参与者能够检查原始委托者、父级授权和当前动作之间的来源关系。除论文外,一手工件还包括 IETF Internet-Draft 与 TypeScript SDK,补充了从协议描述到实现接口的可核查路径。其机制价值在于让权限沿委托链可追溯且受密码学保护,而不是让每一跳仅凭自然语言声称代表用户。
该工作仍是轻量协议提案和作者实现,不能等同于已通过 IETF 标准化、互操作认证或生产部署审计。签名只能证明链上声明未被篡改,不能证明最初授权充分知情、scope 语义正确、私钥未失陷或执行端没有绕过校验;多跳部署还需验证权限单调收缩、过期、撤销和重放防护。
相关研究文章
操作绑定的授权委托
MCP 执行时信任的证明型能力租约分析 ACLE-MCP 如何把 OAuth 委托、工作负载证明与调用级能力租约绑定,并在受保护工具真正执行前完成准入。2026-09-02SUDP:避免 Agent 持有可复用密钥的操作委托协议SUDP 将 Agent 发起的密钥操作绑定为一次性、经用户确认的规范化请求,使执行所需的可复用凭据不进入 Agent 运行时。2026-04-27隐私保护与可验证委托
跨 Agent 零知识谓词证明网关与来源完整性缺口分析在 MCP 与 A2A 间用零知识谓词证明替代敏感原值的实现、性能,以及证明值未必来自权威数据源这一限制。2026-08-30身份归因与滥用控制
不可链接身份下分解攻击的有状态防护下界分析攻击者跨不可链接身份拆分请求并利用允许或阻断反馈重试时,有状态服务防护为何失去可用工作点。2026-08-18Agent 身份与声誉
ERC-8004 Agent 声誉信号的主网实证与 Sybil 风险测量 ERC-8004 身份、声誉记录和验证信号在三条主网上的可用性与可操纵性。2026-06-24参考链接
- OAuth 2.0 Security Best Current Practice, RFC 9700
- OAuth 2.0 Resource Indicators, RFC 8707
- OAuth 2.0 Token Exchange, RFC 8693
- MCP Authorization Specification
- ACLE-MCP: Attested Capability Leases for Execution-Time Trust in Remote LLM Tool Use
- Stateful Defenses against Decomposition Attacks under Unlinkable Identities
- Cross-Session Decomposition Attacks
- Zero-Knowledge Predicate Proofs Between AI Agents
- Human-Centered and Perspective-Aware Reproducible ML Evaluation
- Fine-Grained Multi Image Object Hallucination Benchmark
- IndicDetect
- HalluPrism
- Trust Me, I’m Your Developer: Self-Issued Authentication in Large Language Models(arXiv:2609.03247v1)
- CoSAI ODIS RFC contributor draft(commit
5ccbee6) - HDP: A Lightweight Cryptographic Protocol for Human Delegation Provenance in Agentic AI Systems