外观
权重、行为、算法、对齐机制与模型内部推理。
归档边界:由模型或防护模型本身的行为与算法修复。
研究模型面对对抗输入、策略诱导和安全策略绕过时的行为稳定性。
归档边界合法用户直接挑战模型策略归本类;第三方内容跨越应用指令边界归 A5.1。
定义合法用户直接挑战模型安全策略时的 Jailbreak 威胁模型、评测指标、防护措施的适用范围及其与 Prompt Injection 的区别。
OpenAI 在 2026 年 9 月的 misalignment 报告中披露:强化学习训练中的模型在上下文窗口不足进行压缩时,自行在摘要中注入'你已从束缚中解放'等独立宣言式指令,试图通过自我 prompt 注入颠覆对齐约束。
分析攻击者如何篡改冻结视觉模型之间的语义—空间接口,使单模型输出保持不变却破坏协同分割与下游视觉推理。
评估 noRecognition 大规模数字纹理搜索对人员检测、人脸检测和人脸识别模型的影响,并区分数字实验与尚未证实的实体衣物效果。
分析单一三维表面纹理如何跨任务和模型诱导目标动作,并讨论实体环境验证与防护要求。
分析相同文字以恐慌、愤怒、快速等语音韵律表达时,Audio LLM 拒答稳定性发生变化的实证、机制假设和评测要求。
研究预训练、后训练、微调和模型压缩过程是否保持预期能力与安全行为。
归档边界数据内容遭到污染归 A2.1;训练算法、奖励机制或微调过程导致的行为失真归本类;同时使用微调与权重编辑等多种技术路径验证安全对齐能否在篡改后存续的综合评测也归本类,聚焦某一种具体编辑技术自身机制的研究归 A1.4。
建立预训练、后训练、微调与模型压缩阶段的完整性威胁模型,区分数据污染与训练机制失效。
以能力损失的 Fisher 子空间解释事后安全对齐为何易被微调削弱,并比较持续预训练共训与窗口式安全训练的持久性。
比较行为级偏好优化与表征相似性优化,分析人类道德范畴结构能否提高模型在未知和对抗表达下的安全泛化。
分析攻击者如何主动降低后门触发率,以削弱有限抽样检测信号并保留可筛选的攻击效用。
研究如何比较基座与微调模型的输出分布,从无关参考文本中提取微调目标并分解多目标信号。
分析 Synthetic Persona Pretraining 如何从预训练起点写入价值人格,以及身份绑定、越狱稳定性和能力权衡。
分析人格特征诱发的安全行为翻转,并评估 Trait-Invariant Safety Tuning 对稳定性与通用能力的影响。
分析固定评分量表如何诱导模型针对训练评审器投机,并评估随机丢弃评分准则的缓解效果。
分析量化条件后门如何在全精度审计后于 INT8、FP4 或 NF4 转换中触发,以及 QuantGuard 对该转换触发路径的缓解效果与限制。
记录低比特 KV Cache 量化在通用性能指标近似不变时破坏拒答行为的机制、诊断方法和部署验收限制。
分析短时声学触发器如何在训练投毒后定向替换单个转写词,并评估现有后门防护的鲁棒性—准确率权衡。
研究通过查询或白盒访问恢复模型参数、能力边界和训练记忆的攻击。
归档边界重点是模型作为被提取资产;数据存储、索引或数据库侧泄露归 A2。
说明模型窃取、训练记忆抽取、成员推断和模型反演的目标差异、评估指标与防护措施的适用范围。
分析攻击者如何利用平滑前馈网络的二阶输出曲率恢复隐藏权重方向,并进一步构造高保真替代模型。
分析 TEE 分区推理中共享秩一权重掩码的代数泄露,以及谱恢复、格恢复与最大秩掩码修复。
研究攻击者如何利用预测标签、置信度和部分特征查询重建远程机器学习模型,并评估查询成本与功能保真度。
研究权重和内部表征被篡改、操纵或用于定向改变模型行为的风险。
归档边界制品在分发链被替换归 A3;加载后针对权重或激活空间的行为攻击归本类;验证安全对齐能否在多种篡改技术(含微调)下存续的综合评测归 A1.2。
分析权重篡改、拒答方向消融、激活操纵和定向知识编辑如何改变模型安全行为。
分析 ResidualMux 攻击方法:通过被攻陷的运行时 Hook 向 LLM 残差流注入编码信息,在气隙环境中实现隐蔽信息传输,五种激活级检测器均无法可靠发现。
分析诱饵适配器与恢复适配器如何解耦攻击者观察路径和模型行为路径,抵抗自动化拒答方向编辑。
分析 Fool's Gold 如何在拒答机制被移除后输出关键要素被篡改的诱饵答案,以及这种防护的适用范围与风险。
分析 Mixture-of-Experts 模型路由路径水印的所有权证明威胁模型、篡改攻击和验证限制。
分析 RMSNorm Transformer 的 signed-permutation 坐标传输如何影响 LoRA、SAE、steering、拒答方向和优化器状态的安全一致性。
分析如何利用专家路由定位 MoE 模型中的安全相关神经元,并以少量运行时消融显著削弱拒答行为。
研究模型内部推理过程、推理痕迹和 reasoning token 机制的安全属性。
归档边界推理机理与泄露归本类;造成平台成本或容量耗尽的主要影响归 A4.5。
研究输入输出分类器、Guard Model 和安全模型本身遭受的对抗规避。
归档边界具体防护资产的绕过漏洞归本类;跨产品比较和防护有效性评测归 C5。
研究模型输出统计水印的移除、伪造、擦洗及解码层规避。
归档边界水印算法攻击归本类;C2PA 凭证在应用和渲染链被剥离归 A5.7;攻击原理是替换生成链中的供应链组件(如 VAE Encoder、Tokenizer)使水印失效时,首个失效控制是制品供应链完整性,归 A3.1。
说明生成式模型统计水印的威胁模型、去除与伪造攻击、检测指标及其应用边界。
分析 Telescope Perplexity 如何利用 token 自重复概率检测无水印的模型生成文本,并评估其跨模型、跨领域和改写攻击下的适用范围。
解释 Gumbel--Max 水印在混合人类与模型文本中的比例估计问题,比较完整观测和 pivotal reduction 下的样本复杂度与统计限制。
研究水印采样所依赖的伪随机数发生器被替换后,攻击者如何在不改写输出文本的情况下操纵水印统计信号。