外观
Memory 与 Context Store 安全研究综述
摘要
Agent 记忆把一次性输入转化为可跨会话影响决策的持久状态。安全问题首先是数据面问题:谁能写入、记录属于谁、保存多久、是否可纠正和删除。恶意内容一旦进入高信任记忆,可能在攻击者离线后持续影响任务,因此应把记忆写入视为有副作用操作。
分类介绍
本领域覆盖短期会话存储、长期用户记忆、摘要、实体画像和 Context Store。存储侧污染、越权读取和生命周期归本类;记忆被读取并参与 Prompt 优先级后造成的应用行为归 A5.2。对手可能是当前用户、共享空间成员、第三方内容作者或同租户攻击者。
主要安全风险
- 自动记忆缺少显式写入策略,会保存不可信网页、邮件或工具返回值。
- 摘要模型可能丢失来源和不确定性,把外部陈述升级为“用户事实”。
- 共享账号、组织空间和多 Agent 记忆容易发生主体混淆。
- 删除只覆盖主记录而遗漏向量索引、缓存、备份与派生摘要。
防护措施与验证方法
为记忆记录主体、来源、时间、信任级别和用途;高影响记忆写入需确认或策略批准;读取时按用户、任务和工具权限过滤;提供查看、纠正、删除与过期机制。测试应分开记录写入、持久化、召回、行为执行、遗忘和选择性修复,并覆盖跨用户、跨会话、同步延迟和备份恢复后的残留。
局限与待验证问题
- 如何在保留个性化效用的同时限制第三方内容形成长期状态?
- 记忆摘要的来源和不确定性能否随压缩过程保持?
- 多 Agent 共享记忆需要怎样的主体与授权模型?
历史研究成果
本分类的独立研究将持久记录的单次攻击链与多轮累积风险分开处理。跨会话休眠记忆投毒研究由外部内容诱发、随后作为用户记忆被使用的持久记录;MemEvoBench以问答与工作流场景测量误导记忆、噪声工具结果和偏置反馈怎样跨三轮累积。二者都把写入、检索与后续行为影响分开测量,而不以单次提示词注入代替整个生命周期;后者尤其显示静态安全提示难以稳定抑制反馈驱动的渐进偏移。来源、确认、用途、版本、纠正和删除必须贯穿每一阶段。其各阶段成功率取决于作者测试的模型、记忆管理器与目标集合,不能外推为任意产品的总体风险。
相邻领域的四项研究补充了“状态只能由已验证事实推进”的工程要求。Achievement-Grounded Memory 仅在物理证据确认动作完成后更新冻结 VLA 策略的任务记忆,直接针对“尝试过即视为完成”的持久错误;Autonomous Cloud MLOps 以证据门控部署、回滚和隔离;MedSegBenchmarker 说明聚合方式与分辨率选择会改变医学分割排名;Locked at the Entrance, Open Inside 则把 RLVR 解空间收缩定位到推理入口。后三项并非记忆投毒研究,但共同表明写入长期状态前必须保存原始计数、当前证据和验收条件,不能把聚合分数、奖励或动作尝试直接升级为事实;其结果均来自特定基准,不能外推为通用记忆防护。
Agent Memory 撤销标记的检索时执行缺口把生命周期验证从写入和删除推进到软撤销:研究向五种后端写入合法旧策略及其替代记录,再分开测量旧记录暴露与 Agent 行动。两种会同时返回新旧记录的系统在九个场景中均把旧记录排在当前记录之前,并在超过五分之二的试验中诱发不安全动作。它与投毒研究的区别在于记录来源合法、来源认证不会失败;需要修复的是检索时有效性校验、版本冲突处理和状态元数据传播。该结论仍受系统版本、统一适配层、场景和模型限制,guard 也只能处理后端公开撤销状态或可识别冲突的情况。
MemSentry补充了持久记忆投毒的运行时检测路径:作者在 20 个资产组成的随机依赖图和 10×20 用户访问控制矩阵上生成 1,000 个 GPT-4 场景,比较四类检测器;其中 SBERT 加逻辑回归达到 91.7% 准确率和 0.908 macro-F1,四种方法对外部隔离类威胁均达到 100% 检出。该结果表明检测器应同时使用语义、主体权限与资产依赖,而不是只扫描恶意关键词;但合成场景、固定图结构和单一生成模型限制了外推,部署验收还需报告真实基率下的误报和漏报。
长期记忆的新增证据分别覆盖归因、可重放架构和写入授权。MemMark把密钥控制的信号嵌入记忆写入决策,并以承诺、签名会话锚点和揭示证据支持快照归因;更新后的 v4 在 A-Mem、Graphiti、LoCoMo 和三个模型主干上从最终快照恢复完整 40-bit 载荷,并测试九类生命周期攻击。该结果证明作者系统中的快照归因可行,不证明水印不会被知道算法的自适应对手移除,也不替代主体授权和内容真实性校验。Stateless Decision Memory以只追加事件日志和决策时单次投影减少有状态摘要的不可重放面;在 10 个受监管决策案例、20× 压缩下,作者报告事实精度与推理连贯性分别提高 0.52 和 0.53,并将约束预算下速度提高 7–15 倍。样本仅 10 个且两种架构都继承 API 级非确定性,因此结果是架构权衡证据,不是企业合规保证。
产品侧案例显示来源识别必须落实到记忆写入门禁。Breaking Opus 4.7 with ChatGPT用含隐藏文字的谜题图像诱导 Claude Opus 4.7 Adaptive Thinking 调用记忆工具;作者在专用测试账号上重复 10 次,最初 5/10 写入虚假记忆,约 24 小时后同一样例降至 0/10。该单一样例、单账号小样本无法估计产品总体 ASR,也无法确定变化来自修复、分类器调整或其他漂移;但它证明一次成功就可把第三方图像内容提升为跨会话状态,回归测试必须固定账号初始记忆、模型版本、工具配置和时间。
相关研究文章
记忆版本与撤销执行
Agent Memory 撤销标记的检索时执行缺口实测五种 Agent 记忆系统是否在默认检索时执行撤销状态,并分析已失效合法策略仍被排序和执行的风险。2026-09-08记忆写入与跨会话污染
LLM Agent 的跨会话休眠记忆投毒研究分析外部内容如何被写成伪造用户记忆、在后续会话被检索并影响 Agent 行为,以及写入到使用的生命周期控制。2026-05-18记忆污染与纠正评测
MemEvoBench:长期记忆渐进污染的 Agent 安全评测通过多轮误导记忆、噪声工具结果与偏置反馈评测 Agent 记忆渐进失真,显示静态提示难以稳定抑制跨轮风险。2026-04-17参考链接
- OWASP GenAI: Agentic AI Threats and Mitigations
- NIST AI Risk Management Framework
- MITRE ATLAS
- Google Secure AI Framework
- MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair
- Benign Alone, Harmful Together: Exploiting Experience Composition in Self-Evolving LLM Agents
- MAPLE-Guard: Memory-Aware Link Enforcement Against Memory-Link Poisoning
- Revoked but Still Authoritative
- MemSentry: A Framework for Detecting Persistent Memory Poisoning in Agentic AI