外观
GAAP:以信息流控制约束 Agent 对私密数据的使用
摘要
GAAP(Guaranteed Accounting for Agent Privacy)研究一个更强的 Agent 隐私目标:即使模型、提示词或外部输入不可信,用户私密数据也只可按用户已同意的用途与接收者流出。系统让模型生成受控代码工件,而由运行时对数据读取、跨轮持久状态和外部调用实施信息流控制(Information Flow Control, IFC)。
作者在 20 个任务和三类数据披露攻击中报告 GAAP 阻止全部攻击,同时与所比较的代码型 Agent 保持相近任务效用。这个结论只覆盖论文的 Linux VM、受控工具与授权表达;它不是对任意 Agent、MCP Server 或模型提供商的普遍保密保证。
核心创新与差异
原研究贡献是把一次任务内的污点跟踪扩展到多段代码工件和跨任务持久数据,并让用户在数据首次使用时指定“哪些信息可被谁、为完成何种任务共享”。模型不能直接读取私密值;其生成代码只能通过受 IFC 约束的 API 请求数据或调用工具。
本站分析将其归入 Tool Use 与审批控制:首个控制是数据披露动作没有被确定性地绑定到主体、用途和接收者,而不是模型是否识别出提示词注入。它补充了 ScopeGate、HCP 等逐调用授权研究的隐私数据流视角。
威胁模型与执行过程
攻击者可控制外部内容,也可诱导模型生成泄露数据的代码或工具调用;模型提供商同样不被假定可信。GAAP 的可信计算基是本地执行环境、IFC 实现、用户输入与受控工具适配器。它不承诺阻止可用性破坏、用户错误授权、终端侧已失陷或工具本身越权保存数据。
运行时把私密记录标记为受限数据;代码读取时继承标记,网络/API 调用前由策略检查接收者和用途。对跨轮任务,持久数据库保留数据标签和授权状态,而不是让后续模型上下文自由携带原始值。作者在 Linux 6.8 VM 评估由模型生成的 Python 工件,并比较非保护 Agent、单次代码生成等基线。
关键结果与实际影响
- 在 20 个覆盖检索、分析、远程数据库和邮件发送等任务的测试中,作者的三种提示词注入/披露攻击均未使 GAAP 放行未授权数据流。
- 论文将“阻止”定义为受控运行时拒绝未授权披露,而不是模型从未生成危险文本;因此结论依赖策略/标签完备性和全部出口确实经由运行时。
- 这种设计适合高敏感 Agent:私密数据不应作为通用 Prompt 上下文或环境变量暴露,工具动作应带主体、用途、接收者和数据类别的可审计判定。
后续工作把 GAAP 的出口级控制细化到每个工具参数字段。Separating Disclosure from Authorization将字段划分为三层披露级别,并对完整参数摘要作承诺,再由中介、工具与审计方分别证明实际投影符合 tier table;作者实验仍观察到一次投影泄漏事件,说明“动作获准”与“每个字段都应披露”必须分开判定。ToolMinimize审计 25 个 MCP Schema 的 307 次调用,发现默认调用中 81%–88% 携带任务不需要的敏感数据,再以删除、泛化、替代和截断重写参数,降低隐私成本并保留任务效用。两项工作均未获独立复现,字段敏感度标注、Schema 覆盖和效用判定都限制外推;但它们共同给出可验证增量:出口策略不仅要允许或拒绝整个调用,还要比较原始参数、最小必要投影与实际发送值。
端侧仲裁与延迟还原
MaskClaw把隐私仲裁放到 GUI Agent 的端侧执行路径,并让规则随用户行为证据演化;公开仓库包含端侧模型、沙箱、规则演化流程、622 个样本的数据集和启动流程。其机制增量是让个性化披露策略在数据离开设备前判定,而不是把敏感值交给远端模型后再过滤。622 个样本和作者原型不足以代表开放 GUI、跨应用组合或长期规则漂移;行为驱动规则若学错用户意图,也可能形成过度放行或误拒。
BodhiPromptShield则在推理前把敏感片段替换为受控表示,并只在检索、记忆、工具和日志链路的获准位置延迟还原。公开仓库支持核查该跨组件数据流,但作者实验尚未证明所有编码、间接引用、侧信道和带外日志都被覆盖。两项工作与 GAAP 的共同要求是:敏感数据的原值、标签、用途和接收者必须由模型上下文之外的可信组件控制,任何未经过仲裁的出口都应按 fail-closed 处理。
防护措施与验证方法
部署时应把密钥、健康信息和文件内容放入受控数据接口;对每一个外发 API、邮件、模型调用和日志出口执行强制检查。测试应在允许与拒绝的相邻任务中确认授权范围、跨轮标签、工具返回值和失败路径均一致,并记录策略拒绝原因以便用户校正。
局限与待验证问题
论文的基准和工具适配器规模有限,部分任务需用户补充授权;动态生成代码的完整沙箱安全、侧信道、恶意工具服务和复杂 GUI/浏览器输出不在其保证内。作者实验尚无独立复现,性能与效用不能外推至真实个人数据规模或所有多 Agent 编排。
字段级最小化还依赖正确的用途说明和敏感度分类;如果工具 Schema 欺骗分类器、字段之间可组合重识别,或带外通道绕过中介,参数重写并不构成端到端隐私保证。