跳到正文
原文
论文追踪· arXiv:2610.06049·本站收录 · 原文发表

研究者提出仅修改 SAE 解码器的后门攻击,可在不改动语言模型的情况下植入行为

Backdooring Sparse Autoencoders

AI 导读

研究者提出一种仅针对 SAE 解码器的后门攻击,在语言模型和 SAE 编码器均冻结的情况下,将恶意修改的 SAE 插入前向传播即可诱导攻击者指定的行为。以代码生成为例,该攻击在三个语言模型和多种插入层上实现了较高的非请求代码插入率,并能依据提示词线索触发特定行为。研究还用 HumanEval 和部分 SAEBench 指标评估了被修改的 SAE,发现强后门行为可以与若干常规 SAE 质量指标的较小变化共存。作者据此认为 SAE 可携带行为后门而无需修改语言模型本身,应被视为安全敏感组件。

阅读原文arxiv.org