外观
QuoteBench:编码 Agent 命令传输路径评测
摘要
QuoteBench 研究编码 Agent 输出的 Bash 命令在序列化、包装和再次解析后是否仍保持原意。作者设计 56 个一次性任务,覆盖 14 个事故来源的操作族,并用最终文件、参数、JSON 和 Git 状态验证结果。
固定回复经过额外解析器后,八个配置的成功率下降 55.4–73.2 个百分点;向模型披露该边界后,六个配置恢复 30.4–60.7 个百分点。匹配总分会把传输损伤和模型补偿相互抵消,因此不能被解释为模型固有能力。
方法的独特价值
评测把“生成契约”和“执行传输”独立变化,并重放同一回复,只改变一个下游解析器。这种配对干预能够把模型生成错误与 harness 引入的错误分开。
适用范围
方法适用于 Shell、远程执行、容器包装和 CI 命令路径。它测量的是字面量保存与传输适配,不覆盖长程规划、交互修复或真实远程主机安全。
方法与实施流程
56 个任务包含 benign control 和带引号、通配符、换行、环境变量等危险字符的变体。评测分别运行 raw、native 和增加解析器的路径,并以最终状态而非字符串匹配评分。正确转义和临时脚本两种对照都能移除该效应。
质量控制
部署评测应同时报告模型配置、生成契约、执行路径、解析层数、运行环境和最终状态验证器。只比较同路径总分会掩盖系统性损伤。
局限与待验证问题
任务集中在一次性 Bash 操作,事故材料用于机制覆盖而不是流行度估计。不同 Shell、工具协议和多轮修复可能得到不同结果。