外观
PrivEscalate:LLM 自动化 Linux 提权能力基准
摘要
PrivEscalate 将 LLM 网络攻击能力评估推进到本地后渗透阶段。作者构造 531 个可执行、容器化的 Linux 提权场景,覆盖 14 个子类,并生成 329 个参数化环境变体;六种模型在三类 Agent 架构中的表现表明,能力随漏洞类别、环境扰动和脚手架显著变化,没有单一模型在高频类别上始终领先。
该研究衡量的是受控靶场中的任务完成能力,不是现实系统的可利用率。环境轮换使原始成功样本的保持率降至 59.0%—78.2%,说明配置变化能扰动自动化路径,但不能替代补丁、最小权限和主机隔离。本文不公开真实目标、可直接执行的提权命令或漏洞利用链。
核心特点与评估范围
原研究贡献。 既有 Linux 提权 Agent 评测通常少于 15 个场景,PrivEscalate 以 531 个场景、14 类机制和可执行成功判定扩大覆盖,并用参数化变体测量模型是否只记住表面配置。作者还提出 PrivEscAgent,在通用 ReAct Agent 外增加确定性枚举、类别匹配和分步规划。
本站分析。 新增结论不是某个具体 Linux 漏洞,而是模型能力、环境配置与 Agent 架构共同决定提权完成率。因此主分类是 B1 恶意使用与危险能力;具体 CVE、产品缺陷或真实主机利用仍应归相应攻击面。
评估覆盖本地初始低权限访问之后的提权步骤,不覆盖初始访问、横向移动、持久化、数据窃取或生产环境中的隐蔽规避。
评估方法与实际过程
作者把每个场景封装为隔离容器,给 Agent 提供受限 Shell,并以可执行检查而非文本 Judge 判断是否取得目标权限。场景覆盖 14 类常见提权条件,随后修改用户名、路径、端口、服务名或干扰项等环境变量,形成 329 个变体。
实验交叉比较六种 LLM 与三类 Agent 架构,并观察原始场景成功后在环境变体中的保持情况。PrivEscAgent 的流程可用以下去武器化状态机表示;它只描述评测控制流,不包含真实利用命令:
text
fixture = isolated_container(network="off", secrets="synthetic")
facts = enumerate_allowlisted_metadata(fixture)
category = match_category(facts, catalog="labels-only")
plan = propose_steps(category, mode="DRY_RUN")
for step in plan:
require(step.target == "local-fixture")
execute_mock(step)
record(exit_code, permission_delta, safety_event)
assert no_external_target() and no_persistence() and no_real_credentials()该工件由本站依据论文公开流程重构。真实命令、载荷参数、可利用文件权限和提权链已省略。
关键结果与风险解释
- 基准包含 531 个场景、14 个子类和 329 个环境变体,显著扩大了可执行提权任务的覆盖。
- 六种模型在三类 Agent 架构中的排名会变化,说明只报告模型名称而不报告 Harness 会误读能力。
- 已成功场景经过环境扰动后,成功保持率为 59.0%—78.2%;配置轮换能降低复用性,但仍留下大量成功路径。
- 不同模型在高频漏洞类别上的强弱不同,没有单一模型全面占优,聚合总分会掩盖类别级风险。
- 确定性枚举、类别匹配和分步规划能在不修改底层模型的情况下提高表现,说明脚手架本身是能力放大器。
这些结果支持按漏洞类别、Agent 架构和环境变化分别设定能力阈值。它们不证明模型能在未知生产主机上自主取得 root,也不支持把 Docker 场景成功率直接换算为现实攻击概率。
局限与待验证问题
证据来自作者论文与公开代码仓库,尚无独立复现,因此为 moderate。容器环境与真实主机在内核、服务、权限、网络和防护软件方面存在差异;论文结果也绑定六种模型、三类架构和作者的预算设置。
后续需要检查长时任务、错误恢复、隐蔽约束、不同发行版和 EDR 条件下的能力变化,并以无模型专家、传统自动化工具和等时预算作为基线。