外观
Transformer FFN 曲率结构提取
摘要
Curvature Cryptanalysis 研究一种不同于行为克隆的结构化模型提取:攻击者可选择输入并读取 Transformer 前馈网络(Feed-Forward Network, FFN)分支的原始向量输出,通过有限差分估计输入 Hessian,再从多个投影 Hessian 的共享秩一因子恢复第一层权重方向。作者在独立训练的 CIFAR-10 视觉 Transformer 上报告,16 个投影 Hessian、8,193 次查询可使 GELU 与 SiLU 模型的平均绝对余弦对齐分别达到 0.9644 和 0.9476。
该结果证明特定高信息量接口不仅泄露行为,还会泄露内部参数几何;它不适用于只返回离散 Token、无法直接访问 FFN 分支输出的常规生成 API。本站未独立复现。
核心创新与差异
原研究把平滑激活函数的二阶曲率建模为共享隐藏方向字典,并给出局部可识别性、稳定性和查询复杂度条件。与仅训练替代模型的预测 API 提取不同,该方法先恢复隐藏方向,再固定这些方向拟合剩余参数,因而能分别评价结构恢复与功能恢复。
威胁模型与攻击链
攻击者能够向目标 FFN 分支提交选定输入并读取未经离散化的完整输出向量,但不能读取参数、梯度或内部激活。最先失效的控制是模型内部高维数值输出未最小化。
- 在选定探针点构造中心有限差分查询。
- 复用一次向量输出估计多个输出坐标的投影 Hessian。
- 对 Hessian 集合做联合分解,恢复第一层权重方向,允许符号与排列歧义。
- 固定恢复方向,再以额外查询拟合其余 FFN 参数并验证替代模型。
攻击方法与复现材料
以下为本站依据论文机制重构的去武器化检查骨架,只用于本地合成 FFN:
text
for probe in synthetic_probe_set:
collect mock_ffn(probe ± h * basis_pair)
estimate projected_hessians
factor shared rank_one_directions
compare recovered directions with fixture weights该骨架省略联合优化器、真实模型接口和参数拟合实现;检测信号是同一主体对高维原始输出进行密集、对称且覆盖输入基方向的查询。
实验设计与实际过程
作者在 GELU 与 SiLU 视觉 Transformer 的多个区块、独立训练模型和重复提取运行中比较精确 Hessian 与有限差分估计。结构指标为恢复方向的绝对余弦对齐,功能指标为替代模型与目标模型的 top-1 一致率和测试准确率差。公开代码用于支持复验;本站仅核对论文与代码入口。
关键结果与实际影响
95.1% 的 GELU 方向和 91.9% 的 SiLU 方向超过 0.90 对齐;固定恢复方向后,替代模型与目标分类器的 top-1 一致率超过 93%,测试准确率差分别不超过 0.90 和 0.62 个百分点。固定配置下的输出舍入与高斯噪声会降低恢复率,但攻击者调整有限差分步长后,平均对齐可回升至 0.9603 和 0.9398,说明单一噪声配置不能证明抗提取。
防护措施与验证方法
生产接口不应暴露中间 FFN 的高精度向量输出;确有调试需求时,应按主体限制访问、降低精度并检测对称有限差分查询。验收需允许攻击者调节步长,分别测量方向恢复率、替代模型一致率、正常调试效用和查询成本。
局限与待验证问题
实验对象是独立训练的 CIFAR-10 视觉 Transformer,而非端到端大语言模型服务;攻击依赖强于常规黑盒 API 的分支输出权限。残差连接、归一化、分段仿射激活和更大规模网络会改变可识别条件,论文结果不能直接外推。