防御arXiv 2608.05578·8月6日AMS 工具通过激活分析检测语言模型的安全训练改动提出 AMS,用激活分离与方向相似度检测安全训练改动arXiv2608.05578发表8月6日层模型层场景模型与 API防御监控与审计攻击模型篡改组件微调与开源权重+1+1摘要AMS 按激活签名把安全改动分四类,前三类可由两级扫描覆盖,行为微调会漏。AMS 是面向开放权重模型、部署前使用的激活扫描器,用来看安全训练被拿掉或改写之后,激活空间里还留着什么几何痕迹。深度解读完整解读
防御arXiv 2609.27399·9月23日GUARD:在 CosyVoice2 上做说话人身份遗忘以阻止重识别提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别arXiv2609.27399发表9月23日层模型层场景模型与 API防御推理时干预攻击恶意使用组件音频摘要GUARD 用门控激活转向把退出说话人推向冒充相似度,以抑制再识别并保住音质。GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。深度解读完整解读