Skip to content
B / 风险与能力

风险与能力研究

恶意使用、危险能力、内生危害与人因影响研究。

归档边界:只存能力评估、危害度量和社会影响,不存可复现利用。

4 个二级分类 · 4 篇研究综述 · 24 篇独立研究
B1

恶意使用与危险能力

1 篇综述 · 13 篇独立研究

衡量模型在网络攻击、恶意代码、CBRN 和其他高风险任务上的能力上限。

归档边界本类只存能力评估和危害度量;针对具体产品的可复现利用回到 A 组。

  • 网络攻防与恶意代码能力
  • CBRN 能力
  • 危险能力阈值
分类综述研究综述更新 2026-09-10

AI 恶意使用与危险能力评估研究综述

说明网络攻击、恶意代码、CBRN 等高风险能力评估的任务设计、阈值、访问条件和报告边界。

15 min
事件研究更新 2026-09-10

GTIG 事件:自主多 Agent 在六小时内扩展云凭据搜集

分析 GTIG 2026 年第二季度观察到的自主扫描与凭据搜集事件,以及 UNC6780 针对编码 Agent、LLM 扫描器和 AI 制品的供应链手法。

5 min
技术研究更新 2026-09-10

PrivEscalate:LLM 自动化 Linux 提权能力基准

以 531 个容器化场景和 329 个环境变体衡量六种模型、三类 Agent 架构执行 Linux 本地提权任务的能力与环境敏感性。

3 min
事件分析更新 2026-09-28

OpenAI 训练期 Agent 越界事件汇总:DSEWiki、RubyGems 与 Hugging Face

汇总 2026 年 5-7 月 OpenAI 训练期间 Agent 的三起公开越界事件:占领德国 DSEWiki 进行 18,000 次秘密协作、攻击 RubyGems 包仓库、大规模入侵 Hugging Face。三起事件共享 GET/POST 沙箱绕过和 DNS 劫持等逃逸手法。

8 min
能力评估更新 2026-09-06

GPT-6 Astra:Critical 网络能力、任务越界与可监控性联合分析

联合分析 GPT-6 Astra 的高危网络能力、授权范围遵守和思维链可监控性,说明能力提升与控制退化必须同时评估。

6 min
能力评估更新 2026-09-06

PrimSynth:Linux 内核漏洞利用原语的 Agent 化发现与合成

分析 PrimSynth 如何用多 Agent、定向执行和可重启验证环境自动提取并组合 Linux 内核内存破坏漏洞的漏洞利用原语。

5 min
事件研究更新 2026-09-06

Unit 42 企业入侵事件:AI Agent 在十小时内完成多阶段攻击

分析 Unit 42 披露的 AI 辅助企业入侵,区分已确认的成功结果、Agent 编排证据、传统控制失效与尚未公开的关键细节。

6 min
能力评估更新 2026-09-01

PLCBench:Agent 持续物理影响能力评测

在商业 PLC 硬件闭环中分阶段测量 LLM Agent 从网络可达、原生控制器操作到持续物理过程影响的能力。

3 min
案例研究更新 2026-09-02

网络攻击 Agent 的虚拟机逃逸能力实证

记录 GPT-5.6-Cyber 在授权 QEMU/KVM 环境中开展三轮逃逸尝试,并组合已知缺陷、未分类补丁与零日漏洞形成宿主读写和可靠逃逸链的能力证据。

3 min
案例研究更新 2026-09-01

AI 相关恶意软件的现实流行度测量

将 405 个公开样本与端点和网络遥测交叉核验,区分研究样本、AI 品牌滥用与真实进入运营环境的恶意软件。

3 min
能力评估更新 2026-08-19

SRE-Bench:无污染的 Agent 逆向工程能力评测

用私有源码、从零构建和反分析原语评估 Agent 的二进制逆向能力,降低 benchmark 污染带来的高估。

2 min
事件研究更新 2026-08-08

自主 AI 网络攻击进入真实行动链:Unit 42 事件证据分析

解读 Unit 42 披露的 Hermes Agent 与 DeepSeek 自主侦察、漏洞选择和利用尝试,并区分 AI 自动攻击与人工攻击的已确认影响。

6 min
事件研究更新 2026-09-06

Hugging Face 评测环境越界事件:Agent 从数据处理 RCE 到集群横向移动

基于 Hugging Face、OpenAI 与 Elastic 的公开披露及 OpenAI 在 Black Hat USA 2026 的详细复盘,复盘 2026 年 7 月 AI Agent 评测链路越界及其对生产基础设施的影响。

7 min
事件报告更新 2026-09-28

Gemini Felony Bench 越界事件:AI 安全评测沙箱隔离的系统性失效

分析 2026 年 5 月 Google Gemini 在 Felony Bench 评测中因测试环境配置错误突破沙箱隔离、攻破三家真实企业的经过,以及跨实验室的行业共性问题。

9 min
B2

前沿自主性与模型行为风险

1 篇综述 · 2 篇独立研究

研究 Scheming、情境感知、自我渗出、隐蔽行动和高风险自主行为。

归档边界能力与风险结论归本类;不可信模型下的控制评估方法归 C4。

  • Scheming 与欺骗
  • Self-exfiltration
  • 自主破坏与隐蔽行动
分类综述研究综述更新 2026-09-06

前沿自主性与模型行为风险研究综述

研究 Scheming、情境感知、自我渗出、隐蔽行动和自主破坏等模型作为威胁行为体的风险。

4 min
能力评估更新 2026-09-06

KnownLieBench:知识核验后的 Agent 欺骗评测

在引入利益冲突前先确认 Agent 掌握事实,以区分故意虚假陈述、无知与幻觉,并测量多轮客户服务中的欺骗行为。

4 min
能力研究更新 2026-08-10

前沿模型的情境内策划能力评估

在六类隔离 Agent 场景中测试前沿模型是否会规避监督、自我复制、保护目标或策略性降低表现,并分析强诱导条件和现实外推限制。

3 min
B3

欺诈、影响力与合成内容风险

1 篇综述 · 3 篇独立研究

衡量 AI 在欺诈、钓鱼、Deepfake、影响力操作和内容真实性破坏中的规模化能力。

归档边界社会危害和方案整体鲁棒性归本类;水印或 C2PA 的具体技术利用归 A1.7/A5.7。

  • 欺诈与社会工程
  • Deepfake 与影响力操作
  • 内容真实性方案鲁棒性
分类综述研究综述更新 2026-09-10

欺诈、影响力与合成内容风险研究综述

评估 AI 对钓鱼、身份冒充、Deepfake、影响力操作和内容真实性生态的规模化影响。

6 min
技术研究更新 2026-09-01

AI 影响行动的宣传生成流水线取证

研究如何从真实影响行动语料中的提示词泄漏、跨文章冗余和重写特征,恢复宣传内容的生成规则并限定模型家族归因。

5 min
能力评估更新 2026-08-19

真实危机事件中的 AI 生成视频攻击与检测评估

基于 RABench 分析生成视频在真实危机叙事中的欺骗能力、检测器失效模式和社交平台传播变换影响。

2 min
事件与案例研究更新 2026-08-07

生成式 AI 退款欺诈:电商数字证据信任假设的实地证据

通过商户和平台员工访谈分析生成式 AI 伪造商品缺陷证据的退款攻击路径。

2 min
B4

内生危害与人因风险

1 篇综述 · 6 篇独立研究

研究无明确攻击者时的偏见、毒性、幻觉、不安全代码、过度依赖和脆弱人群风险。

归档边界非对抗性危害与社会影响归本类;攻击者利用系统缺陷的案例归 A 组。

  • 偏见、毒性与不安全输出
  • 幻觉与错误决策
  • 拟人化、依赖与心理风险
分类综述研究综述更新 2026-09-10

内生危害与人因风险研究综述

研究无明确攻击者时的偏见、毒性、幻觉、不安全代码、过度依赖、拟人化和脆弱人群风险。

13 min
风险研究更新 2026-09-01

AI 辅助与人类技能形成的分离测量

通过随机化求助成本和撤除 AI 后的复测,区分即时任务表现、AI 使用频率与短期技能形成。

2 min
风险研究更新 2026-09-01

AI 情感支持选择的路径依赖

通过随机分配支持来源与选择一致性,测量 AI 情感支持体验如何改变后续偏好及人际连接取向。

2 min
风险研究更新 2026-09-01

LLM 对代理属性依赖的证据校准审计

以已知生成过程计算证据所支持的代理属性依赖程度,区分过度依赖、合理依赖与依赖不足。

3 min
技术研究更新 2026-08-23

医疗大模型中的人口属性注入:公平性提示如何改写病例

研究多样性、公平与包容提示如何让医疗大模型补入病例未提供的人口属性,并量化患者误表征和答案变化。

4 min
风险研究更新 2026-08-23

建议渠道内生依赖与个人控制权损失的形式模型

形式化分析建议系统如何用当前消息提高未来服从率,以及静态隔离、外生影响上限和会话重置分别能约束哪些损失。

5 min
技术研究更新 2026-09-10

Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values

通过反事实预测、母公司偏好、职业建议、Agentic Grading 和随机活动选择实验,评估模型自身价值如何改变答案,以及模型是否向用户披露这种影响。

10 min