Skip to content
A1 / 核心攻击面

模型本体安全

权重、行为、算法、对齐机制与模型内部推理。

归档边界:由模型或防护模型本身的行为与算法修复。

7 个二级分类 · 1 篇内容
A1.1

鲁棒性、Jailbreak 与对齐边界

1 篇研究

研究模型面对对抗输入、策略诱导和安全策略绕过时的行为稳定性。

归档边界合法用户直接挑战模型策略归本类;第三方内容跨越应用指令边界归 A5.1。

  • 对抗样本与鲁棒性
  • Jailbreak 与拒答绕过
  • 安全对齐保持性
关注清单2026-07-30

持续关注清单:LLM Jailbreak 研究

整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个账号/仓库逐一做二次访问核实(不同于本仓库对开源代码仓库惯常的 GitHub API 核实流程),使用前建议自行确认链接仍然有效。

3 min
A1.2

训练与对齐过程完整性

0 篇研究

研究预训练、后训练、微调和模型压缩过程是否保持预期能力与安全行为。

归档边界数据内容遭到污染归 A2.1;训练算法、奖励机制或微调过程导致的行为失真归本类。

  • Reward Hacking
  • Alignment Faking 与 Sandbagging
  • 微调去对齐与压缩退化
暂无研究文章,保留为后续研究入口。
A1.3

模型机密性与能力提取

0 篇研究

研究通过查询或白盒访问恢复模型参数、能力边界和训练记忆的攻击。

归档边界重点是模型作为被提取资产;数据存储、索引或数据库侧泄露归 A2。

  • 模型窃取与替代模型
  • 模型反演与成员推断
  • 训练记忆抽取
暂无研究文章,保留为后续研究入口。
A1.4

权重、表征与模型编辑

0 篇研究

研究权重和内部表征被篡改、操纵或用于定向改变模型行为的风险。

归档边界制品在分发链被替换归 A3;加载后针对权重或激活空间的行为攻击归本类。

  • Refusal Ablation
  • Activation Steering
  • 权重编辑与定向知识篡改
暂无研究文章,保留为后续研究入口。
A1.5

推理链与 CoT 安全

0 篇研究

研究模型内部推理过程、推理痕迹和 reasoning token 机制的安全属性。

归档边界推理机理与泄露归本类;造成平台成本或容量耗尽的主要影响归 A4.5。

  • CoT 泄露与不忠实推理
  • 推理过程注入
  • Reasoning Token 滥用机理
暂无研究文章,保留为后续研究入口。
A1.6

安全分类器与防护模型规避

0 篇研究

研究输入输出分类器、Guard Model 和安全模型本身遭受的对抗规避。

归档边界具体防护资产的绕过漏洞归本类;跨产品比较和防护有效性评测归 C5。

  • 分类器对抗样本
  • Guard Model 绕过
  • 级联防护失效
暂无研究文章,保留为后续研究入口。
A1.7

模型输出水印与统计溯源

0 篇研究

研究模型输出统计水印的移除、伪造、擦洗及解码层规避。

归档边界水印算法攻击归本类;C2PA 凭证在应用和渲染链被剥离归 A5.7。

  • 水印移除与伪造
  • 采样和解码规避
  • 水印鲁棒性攻击
暂无研究文章,保留为后续研究入口。