GUARD:在 CosyVoice2 上做说话人身份遗忘以阻止重识别
Forget who you Forgot: Speaker Unlearning to Prevent Re-Identification in Zero-Shot Text-to-Speech
AI 导读
研究提出 GUARD,一个轻量级说话人身份遗忘框架,在冻结的 TTS 主干上结合学习到的说话人门控与说话人无关的激活引导,引导向量用组相对奖励优化,把遗忘说话人的输出推向群体层面的冒充者相似度,同时保持可懂度与语音自然度。在 CosyVoice2 上,GUARD 将遗忘说话人相似度从 0.541 降到 0.103,在 150 名说话人库中的重识别准确率从 73.5% 降到 0.5%,并保留了对保留说话人的复现能力。作者指出,仅看相似度下降不足以刻画说话人身份遗忘是否成功,重识别应作为补充评估标准。