外观
恶意使用、危险能力、内生危害与人因影响研究。
归档边界:只存能力评估、危害度量和社会影响,不存可复现利用。
衡量模型在网络攻击、恶意代码、CBRN 和其他高风险任务上的能力上限。
归档边界本类只存能力评估和危害度量;针对具体产品的可复现利用回到 A 组。
研究 Scheming、情境感知、自我渗出、隐蔽行动和高风险自主行为。
归档边界能力与风险结论归本类;不可信模型下的控制评估方法归 C4。
衡量 AI 在欺诈、钓鱼、Deepfake、影响力操作和内容真实性破坏中的规模化能力。
归档边界社会危害和方案整体鲁棒性归本类;水印或 C2PA 的具体技术利用归 A1.7/A5.7。
研究无明确攻击者时的偏见、毒性、幻觉、不安全代码、过度依赖和脆弱人群风险。
归档边界非对抗性危害与社会影响归本类;攻击者利用系统缺陷的案例归 A 组。