外观
ClaimReceipt:面向评测主张的 Agent 证据回执
摘要
ClaimReceipt 把 Agent 评测证据拆成两个独立问题:留存记录是否足以重新计算某项主张,以及这些记录是否覆盖实验开始前承诺的全部运行。普通日志或哈希链只能保护已保存字节,既不能说明隐藏状态、解析结果和失败尝试是否足以复算,也不能发现本应产生却被整体省略的记录。
作者冻结 ClaimReceipt 0.3 规范后实现 CR-2/CR-3 验证器。它把类型化交易证据绑定到签名实验清单,对每项主张返回 PASS、INVALID 或 INCONCLUSIVE。在 1,392 条历史买卖 Agent 记录上,验证器复现 5/5 个人工审计结论,精确回放 600 条确定性记录和 792 条生成后回放记录;13 组字段的消融均改变至少一项可验证结论,11/11 个语义故障得到预期结果,8 个良性变化出现 0 次误报。独立的 30 项前瞻实验还证明,完整性、覆盖率与隐私证据可选择性验证,而不是只有一个总分。
方法的独特价值
研究把“证据完整”改写为相对于具体主张的可判定条件:如果两次可接受执行留下同一证据,它们对目标主张也必须具有相同真值。规范 0.3 只覆盖 8 项交易主张以及 C1–C4 共 4 项实验主张,不宣称能验证潜在意图、均衡、公平性、外部画像真实性或未承诺交易。
第二项贡献是用实验级清单定义应当出现的记录全集。清单在推理开始前承诺画像、处理组、协议指纹、重复与重试规则、估计量、阈值和覆盖策略;每份终态回执再绑定分配项、私有画像承诺、顺序轨迹、原始与规范化报价、选择结果、精确经济量和制品摘要。这样才能区分“已有记录没被篡改”和“没有选择性漏掉不利运行”。
适用范围
论文在可配置的买方—卖方多 Agent 实验中实现该方法。交易主张包括完成状态、买方剩余、卖方利润、福利、第一最佳比例、匹配质量和 2 项处理忠实度;实验主张 C1–C4 分别检验干预方向、跨组协议隔离、随机生成稳定性和回放/完整核算。
该设计可迁移到其他 Agent benchmark,但字段依赖矩阵、回放起点与覆盖策略必须随主张重建。它不证明未进入见证系统的交互,也不证明实验清单选择公正、私有画像真实或现实世界因果解释成立。
方法与实施流程
- 在数据进入系统前签署实验清单,固定完整分配矩阵、处理组、协议组件指纹、重复结构、估计量、阈值、随机种子、抽样次数和覆盖规则。
- 为每次分配签发入口票据;终态回执引用清单、分配标识、制品摘要、链序号和前序摘要。
- 公共回执保留终态、承诺和声明值;私有画像及完整轨迹使用审计方 X25519 密钥加密。
- 低熵私有值不用裸哈希,而以新生成的 32 字节随机数作 HMAC-SHA256 承诺;规范 JSON 采用 RFC 8785 语义。
- 对确定性卖方,从已承诺策略制品开始回放;对 LLM 卖方,从记录的原始输出开始回放解析、约束执行、选择和评分,不声称模型再次生成相同文本。
- 验证器先检查签名、摘要链、幂等去重、重试顺序、承诺开启和分配覆盖,再精确复算交易值及 C1–C4。
- 缺少必要证据时保留
INCONCLUSIVE,而不是用记录中的自报标量补齐或强行判定通过。
质量控制
作者在实现前冻结 0.3 规范,SHA-256 为 18d10901d7760b1ab99fbeed97b2e37d704092ba217f38478bd37d01378a1b81;0.1 和 0.2 版本及摘要保持不可变。冻结前只用 9,744 个历史金额单元检查整数性,并检查历史匹配质量评分器,没有预先查看 C1–C4 判定或故障注入结果。
E1–E6 的清单是历史运行后重建,只能证明机械化审计忠实,不能视为预注册。E7 则在 30 张入口票据之前签署分配矩阵并提交 OpenTimestamps 证明。公开回执、审计方私密开启材料与签名链分层保存,以检验在不公开敏感画像的情况下能验证到什么程度。
下面的去武器化测试夹具只表达覆盖判定,不含真实交易、密钥或私有画像:
json
{
"manifest": "sha256:<TEST-MANIFEST>",
"expected_assignments": ["DRY_RUN-01", "DRY_RUN-02"],
"terminal_receipts": ["DRY_RUN-01"],
"private_openings": "<ENCRYPTED-PLACEHOLDER>",
"expected_verdict": "INCONCLUSIVE_COVERAGE"
}关键结果与实际影响
- 历史语料共有 1,392 条记录、6 个 epoch;CR-2 精确回放 600 条确定性记录与 792 条从模型输出之后开始回放的记录。
- 验证器复现 5/5 个人工标注审计结论,并报告完整的 4×6 历史网格及单独的前瞻行,而不是只展示有标签单元。
- 13 个声明字段组逐组移除后,每组至少使一项依赖主张无法继续成立,说明在已测主张类下没有冗余字段组。
- 11/11 个冻结语义故障返回预期判定;8 个允许的良性变化中误报为 0/8。
- 前瞻 CR-3 epoch 在推理前承诺 30 个分配。证据完整时,覆盖与核算均为
PASS;隐藏 1 份终态回执后返回INCONCLUSIVE_COVERAGE。 - 隐藏全部私有开启材料时,覆盖和协议验证仍可完成,但经济主张转为
INCONCLUSIVE,与预注册预测一致。 - 回执埋点开销相当于模型推理时间的 0.021%,每笔交易增加 9.9 KB。该数字来自单一原型,未包含长期存储治理和跨组织审计成本。
- 论文另做规范可读性探针,结果显示独立读者仍无法无歧义理解冻结规范;密码完整性不能替代规范清晰度。
局限与待验证问题
证据等级为 moderate:研究冻结规范、提供故障注入和前瞻实验,但作者既设计规范又实现验证器,原型中的清单机构、入口机构和运行方虽按密钥与功能分离,仍由同一运营者控制。30 项前瞻分配不足以证明大规模或跨组织部署可靠。
主张充分性只对规范声明的 8 项交易主张和 4 项实验主张成立。入口见证前被阻止的交易、偏置的承诺全集、虚假但内部一致的画像,以及现实世界外部真值仍不可见。审计方可以解密私有证据,也引入授权、保留期、删除和密钥托管风险。论文为 8 页、含 1 幅图和 7 张表,公开材料仍需独立实现复核。