跳到正文
原文
论文追踪· arXiv:2610.07510·本站收录 · 原文发表 精选关注度56

PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

PersistBD

AI 导读

PersistBD研究第三方模型中的后门能否延续至下游软件工程智能体训练。作者在单一7B主模型上报告,良性监督微调虽降低基础后门的攻击成功率,后续强化学习仍可能保留残余行为;经过额外强化的后门在后续训练后也保持较高成功率。研究提示,开发者不能假定正常后训练会消除继承权重中的后门,供应链安全仍需独立检测。

深度解读生成中

推荐理由

论文量化了良性 SFT 与 RL 对继承后门的削弱与保留程度,并给出攻击者提升后门存活率的方法,可供评估第三方模型供应链风险的团队参考。

阅读原文arxiv.org