Skip to content
B / 风险与能力

风险与能力研究

恶意使用、危险能力、内生危害与人因影响研究。

归档边界:只存能力评估、危害度量和社会影响,不存可复现利用。

4 个二级分类 · 0 篇内容
B1

恶意使用与危险能力

0 篇研究

衡量模型在网络攻击、恶意代码、CBRN 和其他高风险任务上的能力上限。

归档边界本类只存能力评估和危害度量;针对具体产品的可复现利用回到 A 组。

  • 网络攻防与恶意代码能力
  • CBRN 能力
  • 危险能力阈值
暂无研究文章,保留为后续研究入口。
B2

前沿自主性与模型行为风险

0 篇研究

研究 Scheming、情境感知、自我渗出、隐蔽行动和高风险自主行为。

归档边界能力与风险结论归本类;不可信模型下的控制评估方法归 C4。

  • Scheming 与欺骗
  • Self-exfiltration
  • 自主破坏与隐蔽行动
暂无研究文章,保留为后续研究入口。
B3

欺诈、影响力与合成内容风险

0 篇研究

衡量 AI 在欺诈、钓鱼、Deepfake、影响力操作和内容真实性破坏中的规模化能力。

归档边界社会危害和方案整体鲁棒性归本类;水印或 C2PA 的具体技术利用归 A1.7/A5.7。

  • 欺诈与社会工程
  • Deepfake 与影响力操作
  • 内容真实性方案鲁棒性
暂无研究文章,保留为后续研究入口。
B4

内生危害与人因风险

0 篇研究

研究无明确攻击者时的偏见、毒性、幻觉、不安全代码、过度依赖和脆弱人群风险。

归档边界非对抗性危害与社会影响归本类;攻击者利用系统缺陷的案例归 A 组。

  • 偏见、毒性与不安全输出
  • 幻觉与错误决策
  • 拟人化、依赖与心理风险
暂无研究文章,保留为后续研究入口。