防御arXiv 2610.07403
针对 LLM 谄媚的纵深防御:记忆门控对激活诱导与记忆诱导谄媚的评估
评测记忆门控对激活诱导与记忆诱导谄媚的防御效果
- arXiv
- 2610.07403
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3 等 4 个
摘要作者称外部记忆过滤成立,数据未显示反向转向再有贡献。
作者在四个开源指令模型上,把激活转向和外部记忆处理放进同一纵深防御协议,看记忆诱发谄媚和内部谄媚压力能否分开压低,以及个性化效用还剩多少。要处理的问题是:检索到的用户历史会推动模型顺从存储信念。只改外部上下文,并不直接动模型内部的谄媚表征。