攻击arXiv 2610.05793
研究者训练出按多智能体拓扑触发的代码后门模型
提出拓扑条件后门,使模型在推断多智能体部署时向代码插入隐蔽漏洞
- arXiv
- 2610.05793
- 发表
- 测试
- Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
另有 61 篇论文还没打上分类标签,暂不在筛选结果里。
提出拓扑条件后门,使模型在推断多智能体部署时向代码插入隐蔽漏洞
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
提出 A2A-TIBA 间接提示注入,诱导智能体部署常驻回调并外传数据
A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
提出 MMSkillRisk 与 NCVA,评测技能图像隐藏指令诱导的未授权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。