PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率
提出 PERSISTBD,在发布前强化后门使其经良性后训练仍然存活
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
另有 66 篇论文还没打上分类标签,暂不在筛选结果里。
提出 PERSISTBD,在发布前强化后门使其经良性后训练仍然存活
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞
提出 HDI 攻击以篡改 GraphRAG 辅助结构破坏检索
提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
提出 AKRASIA 推断期后门,用代码级触发器与伪装推理操纵代码模型