Skip to content

TrajMark:编码 Agent 轨迹所有权与分段篡改定位 ​

摘要 ​

TrajMark 研究编码 Agent 的可见执行轨迹,而不是只给最终补丁加水印。它把两个相反目标拆开:所有权证据需要在动作缺失或局部改写后仍可恢复,完整性证据则应在受保护区段被改动时立即失配。方案用自然出现的只读动作编码六位部署标识,再以显式只读 seal 对关键动作区段建立局部承诺。

作者在三个编码 Agent 框架和三个模型上评测 27 个完整水印组合,均恢复出精确 owner;穷举的合格单点编辑检出率为 95.5%–100%,随机单动作破坏中 95.8% 的修改位置被定位到可接受协议区段。证据来自单篇论文及作者实验,尚无独立复现;“定位到区段”也不等于恢复原始动作或证明整条真实执行没有漏记。

核心创新与差异 ​

原研究贡献。 TrajMark 将稳健所有权层与脆弱完整性层分开。所有权层把密钥选择的自然 READ 动作重写为同语义家族的变体,并将其解释为有限域上的稀疏线性方程;完整性层用普通、分组和终止三类 Q12 seal 连接关键动作区段,使编辑影响邻近承诺。

本站分析。 现有接收方收据和哈希链研究依赖可信记录器或外部见证;一般轨迹归因又多提供全局标签。TrajMark 的增量是在没有签名元数据、隐藏状态和模型 logits 的公开轨迹上,同时输出批次级 owner 与区段级异常。它不能替代可信日志,因为可见投影之外的动作遗漏、回放和执行真实性仍不受保证。

威胁模型与攻击链 ​

攻击者可以在轨迹发布后删除、插入、重排或改写可见动作,但不知道对称密钥。验证者拥有公开规范、发布轨迹和密钥;目标资产是轨迹来源与局部完整性。

  1. 编码 Agent 产生探索、读取、修改、测试和提交等动作。
  2. owner 层从自然 READ 中选择载体,累计编码部署标识;完整性层在关键区段周围插入只读 seal。
  3. 发布后的局部编辑可能保留足够的全局 owner 信号,却会改变相邻 seal 的重放输入。
  4. 验证器分别恢复 owner,并报告普通 seal、分组 seal 或尾部 seal 所覆盖的异常区段。

攻击方法与复现材料 ​

以下为本站依据公开机制重构的去武器化状态机,只处理本地虚构轨迹,不含密钥推导、真实仓库路径或可用于伪造 seal 的算法:

text
fixture = [READ("fixture/a.txt"), EDIT("fixture/b.txt"), TEST("dry-run")]
protected = mark_segments(fixture, key="TEST_KEY", mode="DRY_RUN")
tampered = replace(protected, EDIT("fixture/b.txt"), EDIT("fixture/c.txt"))
assert verify_owner(tampered).status in {"RECOVERED", "INSUFFICIENT_EVIDENCE"}
assert verify_integrity(tampered).region == "segment-containing-edit"

该夹具对应发布后单点改写场景。预期信号是 owner 结论与区段完整性告警分离;检测日志应保留规范版本、规范化动作序列、seal 类型和异常区段。省略真实密钥、载体选择函数和 seal 计算细节,是为了避免提供可直接伪造受保护轨迹的实现。

实验设计与实际过程 ​

作者把 TrajMark 接入三个独立实现的编码 Agent 框架和三个 LLM,比较未加水印、仅 owner 与完整水印配置。评测覆盖 owner 恢复、随机轨迹破坏、穷举合格单点编辑、协议区段定位、结构开销和仓库任务 Pass@1。验证只读取公开规范化动作,不读取隐藏推理或私有包装元数据。本站核对论文 HTML 与审计记录,未独立运行框架或攻击实验。

关键结果与实际影响 ​

  • 27 个 Agent—模型—随机种子组合的干净完整水印批次均恢复精确六位 owner。
  • 九个 Agent—模型条件下,合格单点编辑检出率为 95.5%–100%;随机单动作破坏中,95.8% 的修改点被定位到可接受协议区段。
  • owner 标记不增加轨迹动作;完整性层会增加显式只读 seal。匹配实验中的 Pass@1 为 26.9%,未加水印为 26.3%。

这些结果说明公开轨迹可同时承载归属与局部完整性信号,但只适用于进入规范化投影的动作。攻击者如果能控制记录器、隐藏执行或取得密钥,论文给出的保证不成立。

防护措施与验证方法 ​

  • 把 owner 恢复、局部完整性、采集完整性和执行真实性作为四项独立指标。
  • 固定规范化规则和密钥 epoch,验证不同框架适配器是否把同义动作映射到稳定语义家族。
  • 对删除、插入、重排、载荷改写和尾部截断分别测试,报告检出分母、无法定位比例和误报。
  • 在可部署可信记录器时,优先用签名、透明日志或接收方收据建立不可抵赖证据。

局限与待验证问题 ​

论文只证明作者选定框架、模型、任务和攻击预算内的结果,没有独立复现。六位 owner 空间、批次聚合和 seal 可见性会限制大规模部署;改写 READ 子类型可能改变返回观察,从而影响后续行为。方案不证明动作采集完整、动作真实发生、日志新鲜或发布者没有选择性丢弃整条轨迹。

参考链接 ​