针对 LLM 谄媚的纵深防御:记忆门控对激活诱导与记忆诱导谄媚的评估
研究提出一个 2×2 纵深防御框架,将内部激活引导与外部记忆处理分离,在 MemSyco-Bench 上评估四种开放权重模型,涉及 10 个引导系数和五种记忆防御配置。其中三种配置为新设计:重写全部记忆、对每条记忆保留/重写/丢弃的 Router Gate,以及丢弃全部记忆。在 Llama 3.1 8B 上,Router Gate 配合轻度反向引导(α = -1.5)将评委平均谄媚率从 35.80% 降至 31.32%,平均准确率从 43.99% 变为 43.31%,但该下降在 149 个样本上不具统计显著性(配对 p = 0.08 至 0.63)。



