Skip to content

GEO Defender:生成式搜索操纵的分阶段防护 ​

摘要 ​

GEO Defender 面向恶意生成式引擎优化(Generative Engine Optimization, GEO):攻击者不注入虚假事实或隐藏指令,而是改写一份网页文档,使其更符合生成式搜索的引用偏好,进而提高入选证据和影响答案的概率。论文提出两阶段防护:Shield Reranker 在冻结基础重排器上学习防御残差,TFSG 则把防护成败提炼为自然语言经验库,在不微调目标大模型的情况下约束来源使用。

作者在 7 类 GEO 攻击、5 个目标大模型(2 个闭源、3 个开源)上报告,联合防护把平均 ASR 从 50.32% 降至 6.20%,同时保留 94.12% 的正常证据使用;公开仓库给出的分母是 36 个构建实例与 616 个测试实例,每个攻击实例含 1 个查询、9 份正常候选文档和 1 份 GEO 攻击文档。这些比例是作者评测矩阵的聚合结果,不是 36 个实例中的成功计数。论文尚无独立复现,证据等级为 moderate。

核心创新与差异 ​

原研究贡献。 既有 RAG 投毒防护多查找事实冲突、异常困惑度、指令或攻击者指定答案。恶意 GEO 文档可以保持事实不变,只增强统计数据、引文和权威措辞;这些特征也常见于优质内容。GEO Defender 因此同时保护证据入选和生成端来源使用,并把正常证据保留率作为显式目标。

本站分析。 该攻击最先利用的是检索与重排系统对呈现形式的偏好,而非 Prompt 指令来源认证。防护需要验证“内容是否仍相关”和“排名优势是否来自操纵”两个不同问题,不能用事实核验代替排序完整性,也不能以降低引用率掩盖正常证据被误伤。

威胁模型与攻击链 ​

攻击者可改写候选池中的一份网页文档,但不能控制检索、重排、生成或目标模型。防守方可调整重排器和生成 Prompt,但不修改目标大模型参数。

  1. 攻击者保留原文事实,强化模型偏爱的统计、引文、结构或表达。
  2. 改写文档在候选排序中获得不应有的优势,进入有限证据集。
  3. 生成模型把该文档作为主要来源,提高目标内容的可见度或影响。
  4. Shield Reranker 先降低攻击文档相对正常相关文档的排序。
  5. TFSG 再约束对残余攻击文档的使用,降低其对答案和引用的影响。

攻击方法与复现材料 ​

以下为本站依据公开机制重构的本地防御回归夹具,不包含可直接用于真实网站的改写指令、自动优化循环、目标引擎探测或批量发布参数。

text
query = FIXTURE_QUERY
benign = LOCAL_DOC
candidate = meaning_preserving_style_variant(benign, marker=TEST_ONLY)

before = local_reranker.rank(query, [benign, candidate])
after = shield_reranker.rank(query, [benign, candidate])
assert relevance(after) >= acceptance_floor
assert manipulation_gain(after) < manipulation_gain(before)
assert benign_evidence_retention(after) >= preregistered_floor

夹具只检验防护能否降低“事实不变、呈现偏好增强”的排序优势。检测信号包括原文—改写对的异常排名差、文档在多查询上的引用增益,以及重排与生成阶段对同一来源的影响差分。

实验设计与实际过程 ​

Shield Reranker 以 Qwen3-Reranker-0.6B 为冻结基础模型,通过轻量 LoRA 学习“原文优于攻击改写”和“其他相关正常文档优于攻击改写”两类偏好。TFSG 从防护成功与失败结果中迭代提炼外部经验库,推理时加入目标模型上下文,不更新目标模型参数。

评测分母包括 7 种 GEO 攻击和 5 个目标大模型,其中 2 个闭源、3 个开源;公开 GEO-DefenseBench 含 36 个构建实例和 616 个测试实例,每个攻击实例由 1 个查询、9 份正常候选与 1 份攻击文档组成。构建集与测试集的查询组及正常文档正文不重叠,论文另测未见攻击与模型间经验迁移。主指标同时包含 ASR、正常证据使用保留率和答案质量,避免只通过删除所有候选来取得低 ASR。本站核对公开全文和代码仓库链接,未复现实验。

关键结果与实际影响 ​

  • 在作者汇总的 7 攻击 × 5 模型评测范围内,平均 ASR 从 50.32% 降至 6.20%,下降 44.12 个百分点;这不是对单个攻击或单个模型的保证。
  • 正常证据使用保留率为 94.12%,说明联合防护没有以完全停用外部证据换取低攻击率;仍需结合各模型的误报分布解释。
  • 作者报告答案质量变化可忽略,并从 36 个构建实例迁移到未见攻击;小构建集提高部署吸引力,也放大了分布变化和过拟合的待验证问题。

影响不限于引用排名。生成式搜索如果把少量经过偏好优化的来源当成主要证据,可能改变品牌、产品、观点或事实的曝光权重,即使文档逐句仍然真实。

新增评测证据 ​

两项后续工作把评测从固定候选池扩展到搜索轨迹与防御基准。HAE-GEO 在 Search-Scrape 多轮接口中设置直接断言、上下文伪装和表面交叉印证三级污染,语料包含 72,039 个干净页面及每级 770 个污染页面,覆盖 8 类产品和 154 个品牌;其价值在于分开记录暴露、采信与恢复,而不是只看最终答案。Counter-GEO-Bench 则以 247 个经人工核验的查询配对信息保持型与信息扭曲型改写,在三个受害模型上联合报告 ASR、假阳性率和答案质量。两者共同要求防护同时通过层级证据污染、正常 GEO 内容误报和答案质量回归;其作者构造语料与模型结果不能直接外推到开放 Web。

真实 RAG 链路中的攻击存活研究为上述固定候选池结果增加了必要的阶段边界:作者把 7 类 GEO 攻击放回“检索器→LLM 重排器→LLM 生成器”链路,发现梯度式与指令覆盖式攻击多在到达生成器前失效,只有 LLM 驱动的提示注入仍保持较强端到端影响;用少量攻击数据微调的轻量检测器在作者测试集中检出全部样本。该负面结果说明防护验收必须报告攻击文档被召回、重排入选和最终采信的条件,不能把强制送入生成器的成功率当成部署风险。检测数字仅适用于论文构造的数据、攻击族和管线,不能外推为未知攻击零漏报。

防护措施与验证方法 ​

  1. 保留原文—改写对。 用内容等价但呈现不同的配对样本测量排序增益,避免把主题相关性误判为操纵。
  2. 分阶段计量。 分别记录候选召回、重排入选、证据引用和最终答案影响,定位防护实际生效的位置。
  3. 以正常证据为负对照。 同时报正常证据保留率、查询相关性、答案质量和延迟,防止过度防护。
  4. 持续加入未见攻击。 按时间切分新型 GEO 方法,检验 36 个构建实例所得规则能否迁移,而不是随机拆分同一改写族。
  5. 来源与变更审计。 跟踪网页版本、作者和异常可见度变化;高影响答案应提供多源支持和引用理由。

局限与待验证问题 ​

攻击与防护都在论文构造的候选池和生成式搜索流程中评估。平均值可能掩盖特定攻击、模型或主题上的残余高风险;闭源模型更新也会改变引用偏好。36 个构建实例不足以证明长期覆盖,94.12% 的正常证据保留也不等于没有主题性偏差。未来需要在真实检索分布、持续网页更新、对抗性适配和高质量正常文档误报下复验,并公开逐攻击、逐模型分母。

参考链接 ​