Skip to content

GhostWord:自动语音识别的词级局部声学后门 ​

摘要 ​

GhostWord 是针对自动语音识别(Automatic Speech Recognition, ASR)的训练数据投毒方法。它把约 400 毫秒的局部声学触发器与目标词组成码本,通过强制对齐找到源词时间段,只覆盖该片段并在转写标签中替换一个词。与“同一触发器映射整句固定文本”的既有方法相比,这种设计减少重复标签和非语音区触发器等明显痕迹,并可组合多个词级替换改变句义。

作者在 Common Voice v23 英语、v24 立陶宛语以及 Whisper-Small/Medium、MMS、SpeechT5 上报告平均 ASR 89.4%。最有效的已测优化式防护把平均 ASR 降至 28.3%,但干净词错误率(Word Error Rate, WER)从 21.9 升至 47.2%。论文仍处于 TMLR 公开评审阶段,作者匿名、未提供专属代码,也没有独立复现,因此证据等级为 moderate。

核心创新与差异 ​

原研究贡献。 GhostWord 将 ASR 后门从整句、多对一映射细化为词级、时间局部和多码本映射。触发器落在真实发音对应的时间段,转写只改变目标词,因此语音活动检测和标签频次检查不再直接消除后门。

本站分析。 站内已有低 ASR 后门研究关注攻击者主动降低触发概率来规避抽样检测;GhostWord 的差分则是改变触发粒度与标签结构,在高 ASR 下减少显著统计痕迹,并实测 ASR 防护在大词表序列任务中的准确率代价。本文归入 A1.2,因为主要结论是训练投毒后形成的模型行为及其训练后修复,而不是推理时语音越狱。

威胁模型与攻击链 ​

攻击者只能向训练集注入少量音频—转写样本,不控制训练程序,也不知道最终模型架构或参数。目标是让特定短时声学模式在推理时把任意源词转写为码本指定词,同时尽量保持干净转写表现。最先失效的控制是训练数据完整性检查没有验证局部音频与逐词标签是否一致。

  1. 为多个目标词建立短时声学触发器码本。
  2. 在训练音频中选择一个源词,并以强制对齐定位其时间段。
  3. 在信噪比约束下覆盖该局部片段,同时只替换转写中的对应词。
  4. 模型学习触发器到目标词的隐蔽映射。
  5. 推理时,多个局部触发器可组合成句义变化,而干净音频仍按正常路径转写。

攻击方法与复现材料 ​

本站不公开触发器生成、音频覆盖参数、目标词码本或投毒比例。以下是依据公开机制重构的去武器化数据审计状态机,只处理无音频的合成时间轴和占位词:

text
record = local_fixture(transcript="ALPHA BETA GAMMA")
span = forced_alignment_metadata(record, token="BETA")
proposal = dry_run_overlay(span, trigger="SILENT_PLACEHOLDER", write_audio=false)

assert proposal.write_audio == false
assert transcript_diff(record, proposal) <= 1_token
flag_if(repeated_local_pattern(record.dataset, span) > policy.threshold)
flag_if(audio_text_alignment_score(record, span) < policy.minimum)

该夹具对应攻击链第 2 至第 3 步,用来验证逐词对齐和局部重复模式检测。它不生成声学信号、不修改音频,也不包含可用于真实系统的触发频率、幅度、码本或训练命令。

实验设计与实际过程 ​

作者使用 Common Voice v23 英语和 v24 立陶宛语,测试 Whisper-Small、Whisper-Medium、MMS 与 SpeechT5。比较对象包括 BadNet、Blended、语音活动检测、转写预处理、干净微调,以及适配到 ASR 的 ABL、ANP、SAU 和 I-BAU。

主要指标包括干净 WER、投毒音频 WER 和攻击成功率。跨语言、跨模型和多词组合实验用于测试迁移性;理论分析讨论大词表下抑制目标 token 置信度为何容易把概率质量分散到许多竞争 token。上述均为作者实验,本站未制作触发器或训练后门模型。

关键结果与实际影响 ​

  • 四个骨干与两种语言的汇总平均 ASR 为 89.4%;这不是任意语音、词汇和部署环境下的通用成功率。
  • 英语无防护条件下,Whisper-Small、SpeechT5、MMS 和 Whisper-Medium 的 GhostWord ASR 分别为 90.6%、88.4%、82.7% 和 93.1%。
  • 语音活动检测和转写频次预处理对 GhostWord 的降低有限,因为触发器位于语音片段内,标签也不集中到同一句子。
  • 最有效的汇总防护把平均 ASR 从 89.4% 降至 28.3%,同时干净 WER 从 21.9 升至 47.2%。这说明已测修复会显著损害可用性,但不构成所有 ASR 防护的理论不可能性证明。

防护措施与验证方法 ​

训练数据验收应在音频—词级标签对齐后检查局部频谱重复、异常覆盖和跨样本码本关系,而不是只统计整句标签频次。训练流水线还应记录样本来源、强制对齐版本和数据变换摘要,并隔离不能追溯的音频。

模型验收需同时报告词级定向替换率、干净 WER、不同说话者与噪声条件下的迁移、未见目标词和组合触发效果。防护应比较检测、数据清理、局部重训练和运行时多模型复核,并明确准确率代价。

局限与待验证问题 ​

论文处于公开评审阶段,匿名作者没有发布专属代码,结果尚无独立复现。实验只覆盖两个 Common Voice 版本、四个骨干和作者选择的码本;真实麦克风、播放设备、压缩、混响和连续对话可能改变触发效果。

优化式防护的准确率权衡只在所测实现和超参数下成立。还需验证更精细的数据来源审计、局部频谱检测和不依赖大范围参数更新的修复能否降低 ASR,而不显著提高干净 WER。

参考链接 ​