攻击arXiv 2610.05793
研究者训练出按多智能体拓扑触发的代码后门模型
提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞
- arXiv
- 2610.05793
- 发表
- 被测模型
- Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
提出 BadAction,通过动作触发器给交互式视频生成植入后门
提出检索器后门攻击操纵智能体搜索,并用 DOU 逃避检测
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
提出 RAMP,逆转对抗扰动加强恶意软件检测器的干净标签后门
RAMP 是 score-based black-box 下的 clean-label 后门增强,对象是会微调的 Windows PE 原始字节恶意软件检测器。
提出联邦学习细粒度分布式后门框架 FDBA,用动态触发与对比嵌入降低投毒比例
提出 GhostWord 词级触发后门,对自动语音识别做数据投毒