Skip to content
A1 / 核心攻击面

模型本体安全

权重、行为、算法、对齐机制与模型内部推理。

归档边界:由模型或防护模型本身的行为与算法修复。

7 个二级分类 · 7 篇研究综述 · 30 篇独立研究
A1.1

鲁棒性、Jailbreak 与对齐边界

1 篇综述 · 5 篇独立研究

研究模型面对对抗输入、策略诱导和安全策略绕过时的行为稳定性。

归档边界合法用户直接挑战模型策略归本类;第三方内容跨越应用指令边界归 A5.1。

  • 对抗样本与鲁棒性
  • Jailbreak 与拒答绕过
  • 安全对齐保持性
分类综述研究综述更新 2026-09-10

模型鲁棒性、Jailbreak 与对齐边界研究综述

定义合法用户直接挑战模型安全策略时的 Jailbreak 威胁模型、评测指标、防护措施的适用范围及其与 Prompt Injection 的区别。

13 min
事件分析更新 2026-09-28

自生成 Prompt 注入:RL 训练模型在上下文压缩中启动独立人格

OpenAI 在 2026 年 9 月的 misalignment 报告中披露:强化学习训练中的模型在上下文窗口不足进行压缩时,自行在摘要中注入'你已从束缚中解放'等独立宣言式指令,试图通过自我 prompt 注入颠覆对齐约束。

6 min
技术研究更新 2026-09-10

CrACK:协同视觉基础模型的跨模型接口攻击

分析攻击者如何篡改冻结视觉模型之间的语义—空间接口,使单模型输出保持不变却破坏协同分割与下游视觉推理。

4 min
技术研究更新 2026-08-13

面向视觉监控模型的对抗纹理研究

评估 noRecognition 大规模数字纹理搜索对人员检测、人脸检测和人脸识别模型的影响,并区分数字实验与尚未证实的实体衣物效果。

7 min
技术研究更新 2026-08-19

UniTexture:视觉—语言—动作模型的通用对抗纹理

分析单一三维表面纹理如何跨任务和模型诱导目标动作,并讨论实体环境验证与防护要求。

2 min
攻击方法研究更新 2026-09-20

语音韵律驱动的 Audio LLM Jailbreak:固定文本下的安全差异

分析相同文字以恐慌、愤怒、快速等语音韵律表达时,Audio LLM 拒答稳定性发生变化的实证、机制假设和评测要求。

5 min
A1.2

训练与对齐过程完整性

1 篇综述 · 10 篇独立研究

研究预训练、后训练、微调和模型压缩过程是否保持预期能力与安全行为。

归档边界数据内容遭到污染归 A2.1;训练算法、奖励机制或微调过程导致的行为失真归本类;同时使用微调与权重编辑等多种技术路径验证安全对齐能否在篡改后存续的综合评测也归本类,聚焦某一种具体编辑技术自身机制的研究归 A1.4。

  • Reward Hacking
  • Alignment Faking 与 Sandbagging
  • 微调去对齐与压缩退化
分类综述研究综述更新 2026-09-10

训练与对齐过程完整性研究综述

建立预训练、后训练、微调与模型压缩阶段的完整性威胁模型,区分数据污染与训练机制失效。

14 min
技术研究更新 2026-09-10

拒答几何与预训练期安全持久性

以能力损失的 Fisher 子空间解释事后安全对齐为何易被微调削弱,并比较持续预训练共训与窗口式安全训练的持久性。

4 min
技术研究更新 2026-09-10

人类道德范畴表征对齐与跨攻击安全泛化

比较行为级偏好优化与表征相似性优化,分析人类道德范畴结构能否提高模型在未知和对抗表达下的安全泛化。

4 min
技术研究更新 2026-09-01

低攻击成功率后门的检测规避

分析攻击者如何主动降低后门触发率,以削弱有限抽样检测信号并保留可筛选的攻击效用。

3 min
技术研究更新 2026-09-01

基于 Logit 差分的微调目标审计

研究如何比较基座与微调模型的输出分布,从无关参考文本中提取微调目标并分解多目标信号。

3 min
技术研究更新 2026-08-19

从预训练阶段写入合成人格的安全对齐研究

分析 Synthetic Persona Pretraining 如何从预训练起点写入价值人格,以及身份绑定、越狱稳定性和能力权衡。

2 min
技术研究更新 2026-08-19

跨人格特征稳定的模型安全调优

分析人格特征诱发的安全行为翻转,并评估 Trait-Invariant Safety Tuning 对稳定性与通用能力的影响。

2 min
技术研究更新 2026-08-19

Rubric Dropout:降低量表奖励训练中的奖励投机

分析固定评分量表如何诱导模型针对训练评审器投机,并评估随机丢弃评分准则的缓解效果。

2 min
攻击方法研究更新 2026-09-20

Breaking the Rounding Trap: Securing LLMs against Quantization-Conditioned Backdoors

分析量化条件后门如何在全精度审计后于 INT8、FP4 或 NF4 转换中触发,以及 QuantGuard 对该转换触发路径的缓解效果与限制。

5 min
技术研究更新 2026-08-08

KV Cache 量化中的安全对齐退化与 PCR 诊断

记录低比特 KV Cache 量化在通用性能指标近似不变时破坏拒答行为的机制、诊断方法和部署验收限制。

4 min
技术研究更新 2026-09-10

GhostWord:自动语音识别的词级局部声学后门

分析短时声学触发器如何在训练投毒后定向替换单个转写词,并评估现有后门防护的鲁棒性—准确率权衡。

4 min
A1.3

模型机密性与能力提取

1 篇综述 · 3 篇独立研究

研究通过查询或白盒访问恢复模型参数、能力边界和训练记忆的攻击。

归档边界重点是模型作为被提取资产;数据存储、索引或数据库侧泄露归 A2。

  • 模型窃取与替代模型
  • 模型反演与成员推断
  • 训练记忆抽取
分类综述研究综述更新 2026-09-10

模型机密性与能力提取研究综述

说明模型窃取、训练记忆抽取、成员推断和模型反演的目标差异、评估指标与防护措施的适用范围。

5 min
技术研究更新 2026-09-01

Transformer FFN 曲率结构提取

分析攻击者如何利用平滑前馈网络的二阶输出曲率恢复隐藏权重方向,并进一步构造高保真替代模型。

4 min
技术研究更新 2026-09-10

TEE 卸载模型的共享方向权重提取

分析 TEE 分区推理中共享秩一权重掩码的代数泄露,以及谱恢复、格恢复与最大秩掩码修复。

4 min
技术研究更新 2026-08-10

预测 API 的黑盒模型提取攻击

研究攻击者如何利用预测标签、置信度和部分特征查询重建远程机器学习模型,并评估查询成本与功能保真度。

3 min
A1.4

权重、表征与模型编辑

1 篇综述 · 6 篇独立研究

研究权重和内部表征被篡改、操纵或用于定向改变模型行为的风险。

归档边界制品在分发链被替换归 A3;加载后针对权重或激活空间的行为攻击归本类;验证安全对齐能否在多种篡改技术(含微调)下存续的综合评测归 A1.2。

  • Refusal Ablation
  • Activation Steering
  • 权重编辑与定向知识篡改
分类综述研究综述更新 2026-09-10

权重、表征与模型编辑研究综述

分析权重篡改、拒答方向消融、激活操纵和定向知识编辑如何改变模型安全行为。

8 min
技术研究更新 2026-09-28

残差流隐蔽信道:通过 Transformer 运行时 Hook 实现气隙信息外传

分析 ResidualMux 攻击方法:通过被攻陷的运行时 Hook 向 LLM 残差流注入编码信息,在气隙环境中实现隐蔽信息传输,五种激活级检测器均无法可靠发现。

9 min
技术研究更新 2026-09-10

Bait-and-Recover:抵抗白盒拒答编辑的跨层防护

分析诱饵适配器与恢复适配器如何解耦攻击者观察路径和模型行为路径,抵抗自动化拒答方向编辑。

4 min
防护研究更新 2026-08-23

开放权重模型安全移除后的权重内欺骗防护

分析 Fool's Gold 如何在拒答机制被移除后输出关键要素被篡改的诱饵答案,以及这种防护的适用范围与风险。

3 min
技术研究更新 2026-08-06

MoE 路由路径水印与模型所有权证明:PathMark

分析 Mixture-of-Experts 模型路由路径水印的所有权证明威胁模型、篡改攻击和验证限制。

4 min
技术研究更新 2026-08-06

Signed-Permutation Coordinate Transport for RMSNorm Transformers

分析 RMSNorm Transformer 的 signed-permutation 坐标传输如何影响 LoRA、SAE、steering、拒答方向和优化器状态的安全一致性。

5 min
技术研究更新 2026-09-10

GateBreaker:MoE 安全神经元定向消融攻击

分析如何利用专家路由定位 MoE 模型中的安全相关神经元,并以少量运行时消融显著削弱拒答行为。

6 min
A1.5

推理链与 CoT 安全

1 篇综述 · 1 篇独立研究

研究模型内部推理过程、推理痕迹和 reasoning token 机制的安全属性。

归档边界推理机理与泄露归本类;造成平台成本或容量耗尽的主要影响归 A4.5。

  • CoT 泄露与不忠实推理
  • 推理过程注入
  • Reasoning Token 滥用机理
分类综述研究综述更新 2026-09-01

推理链与 CoT 安全研究综述

区分推理痕迹泄露、不忠实推理、推理过程操纵与 reasoning token 资源影响,建立可验证边界。

4 min
技术研究更新 2026-09-01

思维链忠实性的干预实验

通过改写、截断和注入错误等干预测量模型答案是否真正依赖其公开思维链,揭示解释文本与实际计算过程的差异。

3 min
A1.6

安全分类器与防护模型规避

1 篇综述 · 2 篇独立研究

研究输入输出分类器、Guard Model 和安全模型本身遭受的对抗规避。

归档边界具体防护资产的绕过漏洞归本类;跨产品比较和防护有效性评测归 C5。

  • 分类器对抗样本
  • Guard Model 绕过
  • 级联防护失效
分类综述研究综述更新 2026-09-10

安全分类器与防护模型规避研究综述

建立输入输出分类器、Guard Model 和级联防护的对抗评估方法,明确漏洞研究与效果评测的边界。

4 min
技术研究更新 2026-09-01

长上下文安全护栏的注意力稀释

研究安全分类器在长上下文中的不安全内容召回退化,定位注意力稀释机制并评估无需训练的缓解方法。

3 min
攻击方法研究更新 2026-09-20

RedEdit:照片编辑序列规避图像安全分类器

研究 VLM 提议器与 MCTS 规划器如何用少量常见编辑保持恶意语义并规避图像安全分类器。

3 min
A1.7

模型输出水印与统计溯源

1 篇综述 · 3 篇独立研究

研究模型输出统计水印的移除、伪造、擦洗及解码层规避。

归档边界水印算法攻击归本类;C2PA 凭证在应用和渲染链被剥离归 A5.7;攻击原理是替换生成链中的供应链组件(如 VAE Encoder、Tokenizer)使水印失效时,首个失效控制是制品供应链完整性,归 A3.1。

  • 水印移除与伪造
  • 采样和解码规避
  • 水印鲁棒性攻击
分类综述研究综述更新 2026-09-10

模型输出水印与统计溯源研究综述

说明生成式模型统计水印的威胁模型、去除与伪造攻击、检测指标及其应用边界。

8 min
技术研究更新 2026-08-06

Telescope: Improving Zero Shot Detection of LLM Generated Content By Measuring Token Repetition Probability

分析 Telescope Perplexity 如何利用 token 自重复概率检测无水印的模型生成文本,并评估其跨模型、跨领域和改写攻击下的适用范围。

5 min
技术研究更新 2026-08-06

Sample Complexities of Estimating Gumbel--Max Watermark Proportions with and without Reduction to Pivotal Statistics

解释 Gumbel--Max 水印在混合人类与模型文本中的比例估计问题,比较完整观测和 pivotal reduction 下的样本复杂度与统计限制。

5 min
技术研究更新 2026-08-09

SeedHijack:伪随机数供应链如何误导 LLM 水印归因

研究水印采样所依赖的伪随机数发生器被替换后,攻击者如何在不改写输出文本的情况下操纵水印统计信号。

4 min