Skip to content

Output Rendering 与下游执行研究综述 ​

摘要 ​

模型输出是不可信数据,但应用常把它当成 Markdown、HTML、Shell、SQL、代码补丁、日志或结构化指令继续处理。漏洞发生在输出跨入可信解析或执行上下文的时刻。可靠防御必须在下游使用上下文相关编码、结构化 Schema 和执行策略,而不是要求模型“只输出安全内容”。

分类介绍 ​

本领域覆盖输出渲染、日志、终端控制序列、代码执行和内容凭证应用链。模型生成不安全代码作为无对手危害归 B4;输出被攻击者操纵后触发具体下游漏洞归本类;模型统计水印归 A1.7。

主要安全风险 ​

  • Markdown/HTML 渲染允许危险链接、远程资源、脚本协议或 UI 欺骗。
  • ANSI 控制序列和换行可污染终端、日志与审计记录。
  • 宽松 JSON 解析、字符串拼接和自动执行把文本升级为命令。
  • 图像转码、截图或内容发布链可能剥离 C2PA 凭证和来源元数据。

防护措施与验证方法 ​

根据最终接收器做编码和允许列表;使用严格 Schema、类型校验和参数化 API;渲染环境启用 CSP 与沙箱;日志采用结构化字段并转义控制字符;执行前显示规范化差异并要求权限检查。测试应覆盖多层编码、流式分片和解析器差异。

局限与待验证问题 ​

  • AI 输出在跨多个解析器时如何跟踪“已编码”状态?
  • 流式渲染如何在内容未完整到达前避免提前执行?
  • 内容凭证在编辑和发布链中怎样保持或显式标记丢失?

历史研究成果 ​

本分类当前以本综述为主,暂无独立发布的研究文章。Where vs What提供了一项可并入的测量增量:Structure-Content Decomposition(SCD)分别测量结构保真和内容准确率,在六个从 7B 到前沿规模的模型、嵌套 JSON 与表格任务上观察到,复杂度增加时结构保真比内容准确率更早、更快下降。这意味着下游验收不能用“字段内容大致正确”替代严格 Schema 校验,也不能把解析失败与语义错误合并成一个分数。该研究没有证明结构错误已触发命令执行或真实漏洞,且只有单篇作者实验、尚无独立复现;结论只支持为每个接收器分别报告结构合法率、内容正确率和拒绝路径。

相关研究文章 ​

本分类当前没有单独发布的研究文章,相关研究结论集中维护于本综述。

参考链接 ​