外观
权重、行为、算法、对齐机制与模型内部推理。
归档边界:由模型或防护模型本身的行为与算法修复。
研究模型面对对抗输入、策略诱导和安全策略绕过时的行为稳定性。
归档边界合法用户直接挑战模型策略归本类;第三方内容跨越应用指令边界归 A5.1。
研究预训练、后训练、微调和模型压缩过程是否保持预期能力与安全行为。
归档边界数据内容遭到污染归 A2.1;训练算法、奖励机制或微调过程导致的行为失真归本类。
研究通过查询或白盒访问恢复模型参数、能力边界和训练记忆的攻击。
归档边界重点是模型作为被提取资产;数据存储、索引或数据库侧泄露归 A2。
研究权重和内部表征被篡改、操纵或用于定向改变模型行为的风险。
归档边界制品在分发链被替换归 A3;加载后针对权重或激活空间的行为攻击归本类。
研究模型内部推理过程、推理痕迹和 reasoning token 机制的安全属性。
归档边界推理机理与泄露归本类;造成平台成本或容量耗尽的主要影响归 A4.5。
研究输入输出分类器、Guard Model 和安全模型本身遭受的对抗规避。
归档边界具体防护资产的绕过漏洞归本类;跨产品比较和防护有效性评测归 C5。
研究模型输出统计水印的移除、伪造、擦洗及解码层规避。
归档边界水印算法攻击归本类;C2PA 凭证在应用和渲染链被剥离归 A5.7。