外观
AI 影响行动的宣传生成流水线取证
摘要
该研究分析 Storm-1516/CopyCop 影响行动的法语仿新闻内容,发布 PROPAGIA 语料库,并尝试恢复背后的生成规则。语料包含 84 个仿冒站点发布的 2,646 篇文章;对照组是同期 12 家主流媒体的 2,385 篇人工文章。
研究在 50/84 个 PROPAGIA 站点中发现提示词指令泄漏,包括一份十项编辑清单。跨文章冗余、模糊性、主观性、引用和情绪测量与该清单中的写作目标相互印证。RAIDAR 重写实验支持 Llama 3 家族参与生成的假设,但 Mistral 系模型也呈现相近信号,所以证据不能唯一识别具体模型或操作者身份。
核心创新与差异
原研究贡献。 论文把宣传检测、AI 生成取证和黑盒模型家族归因放入同一语料级流程。它不只寻找“像 AI 写的文本”,还将泄漏指令中的可测试目标与整个语料的统计特征对照,并公开 PROPAGIA 供后续研究。
本站分析。 现有合成内容研究常评估单个样本是否由 AI 生成。该研究关注真实影响行动的生产流水线:输入材料如何重写、哪些政治叙事被系统加入、哪些媒体引用被移除,以及这些规则是否在不同站点重复出现。这里的关键控制不是单一内容分类器,而是平台和调查方能否保留语料、来源、发布时间、页面结构与生成痕迹,形成可复核的行动级证据。
威胁模型与失效控制
对手运营一组仿冒新闻站点,批量重写已有报道,并用固定叙事规则调整人物评价、来源引用和政治立场。受影响对象包括被仿冒媒体、被操纵的信息环境和需要判断行动归属的调查机构。
- 运营方收集现有报道或事件素材。
- 生成系统按重复使用的编辑指令改写内容。
- 部分输出意外保留指令清单或模型自述,暴露生产流程。
- 多个站点发布结构和措辞高度相似的文章。
- 调查方结合泄漏、冗余、语言特征和重写模型对照,恢复可能的生成流程。
最先失效的防护是内容发布链没有可靠保留或验证来源,仿冒站点可以让批量生成内容借新闻外观进入传播生态。模型家族归因属于概率性取证,不等同于司法身份认定。
实验设计与实际过程
PROPAGIA 收集 2024-12-01 至 2025-12-01 的 2,646 篇法语仿新闻文章,覆盖 VIGINUM 与 INSIKT GROUP 已披露的 84 个 CopyCop 站点。SIPA 对照集包含同期 12 个来源的 2,385 篇主流媒体文章。
作者用主题建模对齐两组语料,比较模糊性、主观性、引用数量和情绪。提示词泄漏检测先由模型筛选,再分析人工可读的重复清单;跨文章相似度用于检查流水线重复。RAIDAR 实验让七个候选模型以七种提示词重写文章,并比较编辑距离模式。PROPAGIA 公开,SIPA 因版权限制不能公开。
关键结果与实际影响
- 提示词泄漏出现在 50/84 个 PROPAGIA 站点,说明现象跨越单一页面或单一站点。
- 公开语料含 2,646 篇行动文章;人工对照含 2,385 篇、来自 12 个主流来源。
- 泄漏的十项清单要求改写法语、移除其他媒体引用、按固定方向评价多名政治人物,并保留原材料中的人物范围。
- PROPAGIA 相比 SIPA 更模糊、更主观、更负面且引用更少;这些差异与泄漏指令方向一致,但语料还同时混入“AI 对人工”“宣传对主流媒体”等多项变量。
- RAIDAR 结果与既有 Llama 3 归因相符,但 Mistral 与基于 Mistral 的 Zephyr 也出现相近模式;只能支持候选家族,不能确定唯一模型。
实际价值在于把单篇检测升级为行动级取证。调查方可以用提示词泄漏和跨站重复解释生产方法,但不能只凭写作风格断言具体模型、组织或国家归属。
两项相邻研究扩展了“操纵机制”和“取证标签”的可验证范围。Token-Level Advertising提出将广告主影响直接嵌入逐 token 生成的拍卖机制,使平台可以观察广告约束如何改变词元概率和最终文本;它证明的是一种可实现的生成控制结构,不是现实影响行动已经采用该机制,也没有独立复现。RCMN则把公共话语中的误导拆成机制、读者解释和证据解释,并用数据集评测模型识别缺口。后者可用于检验本文的流水线线索是否真的支持“误导”判断,但其标签与模型结果来自单篇研究,不能替代对传播主体、触达范围和行为后果的调查。二者与 PROPAGIA 一同说明,生成规则、文本误导和行动归因是三个独立命题。
防护措施与验证方法
- 平台应保留页面原文、HTML 结构、发布时间、域名关系和修改历史,避免只保存归一化后的正文。
- 将提示词泄漏、跨文章冗余、来源仿冒、投放时序和账号基础设施作为互补信号,不依赖单一 AI 文本检测器。
- 对自动泄漏检测建立人工标注集,分别报告站点级和文章级分母、精确率与召回率。
- 模型家族归因需要多个候选模型、不同重写提示词和未参与方法设计的留出语料。
- 媒体和平台可建立内容来源凭证与仿冒监测,但来源凭证缺失不能单独证明内容恶意或由 AI 生成。
局限与待验证问题
- PROPAGIA 与 SIPA 同时在作者身份、媒体类型、宣传意图和来源数量上不同,语言特征无法归因于单一变量。
- 主题模型平均 silhouette score 为 0.2281,仍需更合适的密度指标和人工主题核验。
- 泄漏检测依赖单一模型,缺少人工标注真值;50/84 应视为近似站点覆盖,不是完整泄漏率。
- RAIDAR 每个候选模型平均需要约 95.5 GPU 小时,候选集合有限;近缘模型可能共享重写特征。
- 方法主要面向法语文本,词典、情绪和引用规则迁移到其他语言时需要重新校准。
- 语料支持生成流水线取证,不证明内容分发、账号运营和操作者身份的全部链路。