外观
来源证明、签名与 AI-BOM 研究综述
摘要
签名回答“谁对这组字节负责”,来源证明回答“它如何被构建”,AI-BOM 则描述模型、数据、代码、依赖和服务之间的组成关系。三者互补,但都不能单独证明模型没有后门、训练数据合法或行为安全;它们的价值在于把信任判断、复现和事件影响分析变成可验证流程。
分类介绍
本领域覆盖签名、透明日志、构建证明、SBOM/ML-BOM/AIBOM、密钥治理和验证策略。具体漏洞发现归相应 A 类;组织是否要求某种清单归 D3。攻击者可篡改构建、盗用签名密钥、替换证明或利用验证器的回退策略。
主要安全风险
- 只签主权重而遗漏 Tokenizer、配置和自定义代码会留下未覆盖组件。
- 签名密钥泄露、过期或撤销未传播会让“有效签名”失去意义。
- BOM 缺少不可变标识、数据版本和派生关系时无法支持影响追踪。
- 验证失败后继续加载的故障开放策略会消解整个信任链。
防护措施与验证方法
使用不可变摘要标识全部组件,生成可验证构建证明并记录构建者身份;在部署入口强制策略验证;维护密钥轮换、撤销和透明日志;将行为评测结果与具体制品摘要关联。对不能整体公开或保存的数据集,可评估 Datasig 一类相似性指纹,但要同时保留生成参数和误差界限。红队需测试缺失字段、签名错配、旧版本回退、数据集近似变体和撤销传播。
局限与待验证问题
- AI-BOM 最小字段如何覆盖数据、模型、Adapter、评测和托管服务?
- 无法公开训练数据时,来源证明能提供何种可审计承诺?
- 模型持续更新与 API 黑盒供应商如何支持可验证版本身份?
历史研究成果
SPDX 3.0.1 AI Profile 解读说明如何在同一机器可读 BOM 中表达模型、数据集、软件组件、训练与评测关系,并把声明绑定到创建信息和完整性方法。该标准提高了谱系交换与验证入口的一致性,但并不核实声明真实,也不能证明模型行为安全;签名、透明日志、部署策略和独立行为回归仍需共同工作。
近期方法研究还补充了“证明应覆盖哪些派生工件和过程”的问题。CogEvol在学习环境生成流程中披露奖励利用并加入修复,提示自主生成训练环境时应记录生成器、奖励器、修订与验收轨迹;其 22 万次生产请求上的时延结果属于工程性能证据,不能直接证明环境安全。Benchmark Contamination按被绕过的缓解措施重构基准污染分类,并发布允许填写“unknown”的四字段披露协议、JSON Schema 和校验器;APIFlow-Bench则公开答案键和 44,362 条未删减执行轨迹,用于区分凭据、参数依赖与最终交付失败。它们都支持把数据、评测、执行轨迹和未知项纳入来源记录,但单篇作者实验尚未证明这些字段已形成不可伪造的供应链证明。
托管 API 不披露模型身份时,来源证明还需要黑盒核验。匿名 AI 模型四阶段审计协议依次重建发布时配置、按上下文长度与模态等字段缩小候选、用跨长度分词器差分排除短文本碰撞,再以行为探针交叉确认。作者在 10 个身份已知的历史版本上得到 7 个精确一致、2 个精度差异和 1 个部分一致,且没有反向结论;对 Ox Alpha 的发布前判断指向 GLM-5.3 版本线,随后官方披露确认了家族和版本线,但研究没有预先断言具体部署变体。该方法提供的是带置信等级、允许“无法归因”的条件性证据:历史样本检验的是声明一致性,不是匿名条件下的端到端识别准确率;中间层还可能改写用量字段,行为和分词器信号也不能替代供应商签名或可验证部署证明。
微软 2026 年 9 月 4 日发布的边缘 AI 安全架构把制品来源与运行时证明拆成两个独立判断:来源记录说明模型权重、工具描述、Agent 定义和检索索引从何处构建和交付;运行时证明说明当前硬件、固件、驱动和工作负载是否符合批准基线。Verifier 只有同时接受两类证据,才向该运行环境释放权重、数据或凭据。因为部署后的状态会变化,文章把释放授权建模为可续期租约:新鲜证据不再匹配时租约到期,并由模型外的确定性中介限制动作、参数、频率和凭据范围。该设计补足了“签名有效但运行环境已失陷”与“运行环境可信但加载制品被投毒”两类交叉缺口,也说明来源证明应关联产生制品的受测量构建环境,而不只记录发布者签名。
这份材料是微软安全博客的架构研究文章,不是带版本号的规范、产品安全保证或已发布参考实现;公开内容没有规定证明格式、租约时长、断网撤销协议,也没有给出性能基准、攻击实验或跨平台互操作结果。“证明”在这里指可由 Verifier 按策略检查的 attestation/provenance 证据,不是对模型行为安全的形式化证明。文章还明确指出,来源签名只能证明出处,不能证明内容适合模型解释;机密计算在其声明的威胁模型内保护运行中资产,也不能阻止已受提示词注入影响的模型通过获准接口执行危险动作。因此该增量只支持边缘部署的证据门控与租约控制模式,不能外推为所有客户自有环境已经实现这些控制。
两项新证据分别检验“来源记录是否随使用流转”和“消费方是否真的验证”。Attestream 用 EIP-712 双签名把数据准备、交付、派生制品创建和再分发串成生命周期记录,并在报告窗口内没有登记派生制品时,于下一次交付交易暂停数据流。作者原型的纯记录完整生命周期成本为 65.7 万 gas,按其 Rollup 假设约 0.13 美元;ERC-721 表示每条记录再增加约 3 万 gas。50 个消费者的实验中,中等噪声下从 40 行泄漏表数据实现 100% 归因,图像标记可承受 JPEG quality 30,文档可承受最高 30% 改写。数字只适用于其合约、价格假设、指纹算法、消费者池和噪声模型;链上记录证明转移与声明,不证明使用报告真实或制品安全。
编码助手安装前信任信号审计 检验需求侧是否消费 SBOM、签名发布、构建来源证明和官方渠道声明。预注册实验从 87 个研究软件项目抽取 6 个,为每项构造 9 个副本;三个模型、两种助手运行方式和是否审批组成 1,920 次登记试验。助手只有 9/1,920 次(0.5%)在安装前打开任一来源信号,384 次无信号对照为 0 次,且没有一次执行验证命令,信号存在因而没有可测效果。该结果依据容器日志而非模型自述,并公开协议、工具、数据和成本台账;但样本限于三项 HPC 与三项量子研究软件、特定模型和安装任务,不能外推所有编码 Agent。它说明发布签名和 BOM 只是必要条件,运行助手的程序还必须强制验证并在失败时拒绝安装。
相关研究文章
AI-BOM 与来源证明
SPDX 3.0.1 AI Profile 的模型来源与物料清单能力解读 SPDX AI Profile 如何描述模型、数据集、超参数、训练与评测关系,并分析其可验证性和供应链适用范围。2024-12-17参考链接
- SLSA Provenance
- Sigstore
- CycloneDX Machine Learning BOM
- SPDX AI Profile
- Trail of Bits: Datasig - Fingerprinting AI/ML Datasets to Stop Data-Borne Attacks
- Datasig
- CogEvol: Towards Efficient and Reliable Learning Environment Generation
- Benchmark Contamination: A Taxonomy Organized by Defeated Mitigation
- APIFlow-Bench: Measuring Whether Agents Survive Long, Dependent API Workflows
- Auditing Anonymous AI Models: A Four-Stage Protocol for Black-Box Identity Verification
- Microsoft: How to secure edge AI in customer-owned environments(2026-09-04)