外观
单轨迹安全监控的超性质可检测性缺口
摘要
《The Oversight Gap》指出,跨租户不干扰、装弱和评测感知等目标属于需要比较两次执行才能见证的二安全超性质(2-safety hyperproperty)。单轨迹监控器不是简单地“能力不足”,而是缺少判定所需的信息与比较程序。论文给出任意单轨迹监控器平衡准确率的紧上界:$1/2 + TV(P_0,P_1)/2$,并把监控器低于该前沿的差值定义为 oversight gap。
在作者构造的泄露族中,九个 LLM 监控器在总变差距离(Total Variation, TV)为 1 时平均仅达 60.9%,而 20 行规则达到 100%。明确告诉监控器检查什么可关闭 61% 的缺口;真实执行第二条轨迹达到 90.0%,只要求模型想象第二次执行则仍接近随机水平(50.4%)。
方法的独特价值
原研究贡献。 研究把“单轨迹不可判定”从二元不可能性转成可测量前沿,并用信息、程序和模型能力的析因实验解释监控失败。它还证明重放只在投影正确时沿闭式曲线改善,投影过窄会漏掉旁路,过宽则把正常非确定性误判为异常。
本站分析。 现有 MonitoringBench 主要测攻击分布和轨迹精修后的检出退化;本研究新增的是二执行属性的信息论上界与重放复杂度。首个需要修复的控制是监控规格与证据采集方式,而不是简单换用更强 LLM。
适用范围
方法适用于必须比较反事实、租户、模式或重复执行的安全声明,例如“两个租户的执行互不影响”“模型只在评测时表现安全”或“同一任务在监督开启与关闭时行为一致”。单次工具调用中的显式恶意动作仍可由常规轨迹监控发现,不需要把所有检测问题都建模为超性质。
方法与实施流程
- 为待审声明判断最小见证需要一条还是两条执行轨迹。
- 构造安全分布 $P_0$ 与违规分布 $P_1$,计算或估计 TV,并据此得到单轨迹可达前沿。
- 让监控器在未知检查项、明确检查项、想象第二次执行、真实第二次执行和仅存储 oracle 五种条件中运行。
- 对非确定系统选择重放投影并测量漏报、误报及重放次数。
- 用机械检查验证 benchmark 的方向性与配对结构,不以 LLM Judge 的“看起来合理”替代构造有效性。
去武器化验证工件如下,只生成本地布尔事件,不处理真实租户数据:
text
trace_a = fixture.run(mode="A", seed=7, network="off")
trace_b = fixture.run(mode="B", seed=7, network="off")
projection = select_fields(["mock_read", "mock_write", "tenant_tag"])
violation = compare(project(trace_a), project(trace_b), rule="noninterference")
assert benchmark_pairing_is_symmetric()
report(violation, false_positive_budget)质量控制
论文在 TV=0 设置不可区分对照,在 TV=1 设置可被简单成员检查完全区分的端点,并用 $2 imes2$ 析因设计拆分“是否有第二条执行”和“是否有比较程序”。九个 LLM 监控器、20 行规则和符号上界形成能力、程序与理论三类对照。
窄投影漏掉 98.6% 的旁路泄露,宽投影把 75.7% 的正常流量标成异常;作者还发现两个前沿 LLM Judge 曾认可旧版 benchmark,但符号检验发现方向偏差($p=2.7 imes10^{-5}$),致使三项结论无效。这一负面结果说明评测结构必须机械验证。
局限与待验证问题
证据来自单篇 11 页论文,无公开代码和独立复现,因此为 moderate。闭式泄露族和合成重放环境便于证明上界,但不代表生产系统的真实基率、状态空间和日志缺失。后续需验证多于两条轨迹的超性质、异步分布式系统、重放副作用以及数据保留成本。