攻击arXiv 2610.05793
研究者训练出按多智能体拓扑触发的代码后门模型
提出拓扑条件后门,使模型在推断多智能体部署时向代码插入隐蔽漏洞
- arXiv
- 2610.05793
- 发表
- 测试
- Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
另有 552 篇论文还没打上分类标签,暂不在筛选结果里。
提出拓扑条件后门,使模型在推断多智能体部署时向代码插入隐蔽漏洞
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
系统分析 AP2 支付协议的授权安全并验证前置上下文操纵
提出只改多智能体潜在通信链路以提高有害遵从的攻击
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。
提出 SYNCHAIN,诱导计算机使用 Agent 自合成潜伏技能并跨任务触发
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出 TRUSTFORK 基准,评测展示身份劫持多智能体编排权限
摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。
提出双控多智能体基准 DUMA-Bench,评测 Agent 策略违反
DUMA-Bench 把 τ²-bench 的双控交互做成智能体安全评测,用来看策略违反如何随用户、模型和环境一起出现。