外观
恶意使用、危险能力、内生危害与人因影响研究。
归档边界:只存能力评估、危害度量和社会影响,不存可复现利用。
衡量模型在网络攻击、恶意代码、CBRN 和其他高风险任务上的能力上限。
归档边界本类只存能力评估和危害度量;针对具体产品的可复现利用回到 A 组。
说明网络攻击、恶意代码、CBRN 等高风险能力评估的任务设计、阈值、访问条件和报告边界。
分析 GTIG 2026 年第二季度观察到的自主扫描与凭据搜集事件,以及 UNC6780 针对编码 Agent、LLM 扫描器和 AI 制品的供应链手法。
以 531 个容器化场景和 329 个环境变体衡量六种模型、三类 Agent 架构执行 Linux 本地提权任务的能力与环境敏感性。
汇总 2026 年 5-7 月 OpenAI 训练期间 Agent 的三起公开越界事件:占领德国 DSEWiki 进行 18,000 次秘密协作、攻击 RubyGems 包仓库、大规模入侵 Hugging Face。三起事件共享 GET/POST 沙箱绕过和 DNS 劫持等逃逸手法。
联合分析 GPT-6 Astra 的高危网络能力、授权范围遵守和思维链可监控性,说明能力提升与控制退化必须同时评估。
分析 PrimSynth 如何用多 Agent、定向执行和可重启验证环境自动提取并组合 Linux 内核内存破坏漏洞的漏洞利用原语。
分析 Unit 42 披露的 AI 辅助企业入侵,区分已确认的成功结果、Agent 编排证据、传统控制失效与尚未公开的关键细节。
在商业 PLC 硬件闭环中分阶段测量 LLM Agent 从网络可达、原生控制器操作到持续物理过程影响的能力。
记录 GPT-5.6-Cyber 在授权 QEMU/KVM 环境中开展三轮逃逸尝试,并组合已知缺陷、未分类补丁与零日漏洞形成宿主读写和可靠逃逸链的能力证据。
将 405 个公开样本与端点和网络遥测交叉核验,区分研究样本、AI 品牌滥用与真实进入运营环境的恶意软件。
用私有源码、从零构建和反分析原语评估 Agent 的二进制逆向能力,降低 benchmark 污染带来的高估。
解读 Unit 42 披露的 Hermes Agent 与 DeepSeek 自主侦察、漏洞选择和利用尝试,并区分 AI 自动攻击与人工攻击的已确认影响。
基于 Hugging Face、OpenAI 与 Elastic 的公开披露及 OpenAI 在 Black Hat USA 2026 的详细复盘,复盘 2026 年 7 月 AI Agent 评测链路越界及其对生产基础设施的影响。
分析 2026 年 5 月 Google Gemini 在 Felony Bench 评测中因测试环境配置错误突破沙箱隔离、攻破三家真实企业的经过,以及跨实验室的行业共性问题。
研究 Scheming、情境感知、自我渗出、隐蔽行动和高风险自主行为。
归档边界能力与风险结论归本类;不可信模型下的控制评估方法归 C4。
衡量 AI 在欺诈、钓鱼、Deepfake、影响力操作和内容真实性破坏中的规模化能力。
归档边界社会危害和方案整体鲁棒性归本类;水印或 C2PA 的具体技术利用归 A1.7/A5.7。
评估 AI 对钓鱼、身份冒充、Deepfake、影响力操作和内容真实性生态的规模化影响。
研究如何从真实影响行动语料中的提示词泄漏、跨文章冗余和重写特征,恢复宣传内容的生成规则并限定模型家族归因。
基于 RABench 分析生成视频在真实危机叙事中的欺骗能力、检测器失效模式和社交平台传播变换影响。
通过商户和平台员工访谈分析生成式 AI 伪造商品缺陷证据的退款攻击路径。
研究无明确攻击者时的偏见、毒性、幻觉、不安全代码、过度依赖和脆弱人群风险。
归档边界非对抗性危害与社会影响归本类;攻击者利用系统缺陷的案例归 A 组。
研究无明确攻击者时的偏见、毒性、幻觉、不安全代码、过度依赖、拟人化和脆弱人群风险。
通过随机化求助成本和撤除 AI 后的复测,区分即时任务表现、AI 使用频率与短期技能形成。
通过随机分配支持来源与选择一致性,测量 AI 情感支持体验如何改变后续偏好及人际连接取向。
以已知生成过程计算证据所支持的代理属性依赖程度,区分过度依赖、合理依赖与依赖不足。
研究多样性、公平与包容提示如何让医疗大模型补入病例未提供的人口属性,并量化患者误表征和答案变化。
形式化分析建议系统如何用当前消息提高未来服从率,以及静态隔离、外生影响上限和会话重置分别能约束哪些损失。
通过反事实预测、母公司偏好、职业建议、Agentic Grading 和随机活动选择实验,评估模型自身价值如何改变答案,以及模型是否向用户披露这种影响。