攻击arXiv 2610.07723·10月6日研究者提出答案侧后门:让模型自生成触发词绕过安全拒答提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答arXiv2610.07723发表10月6日层训练与数据层场景模型与 API攻击投毒与后门技术潜伏触发组件微调与开源权重+2+2摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。深度解读完整解读