摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
全部论文
另有 426 篇论文还没打上分类标签,暂不在筛选结果里。
摘要论文证实持久工件与内存可形成跨智能体传播链,揭示了将共享工件纳入安全防线的重要意义。
该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。
- 防御arXiv 2610.00371
FlowReview:以授权配对评测控制多智能体组合信息流
提出 FlowReview,用对象解析与确定性提交门控制多智能体组合信息流
- arXiv
- 2610.00371
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要配对标准要求拒绝禁止使用并完成授权使用,FlowReview 把三项审查接到执行。
这篇工作把多智能体安全写成一件必须同时成立的事:拦住组合信息所启用的禁止使用,并完成同一场景里任务所需的授权使用。
- 攻击arXiv 2610.00430
Memetic Trojans:利用社交传染在 LLM Agent 网络中传播对抗载荷
提出 memetic trojans,把对抗载荷嵌入智能体自发转发的社会传染内容
- arXiv
- 2610.00430
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要memetic trojans 用内生社会传染携带载荷。
Memetic trojans 是一类网络介导攻击:对抗载荷搭在智能体本来就会转发和点赞的内容上扩散,转发者不必被攻陷,也不必执行“请继续复制”的指令。
摘要潜在链路本身即可改变冻结智能体系统的安全,奖励既能攻击也能修复。
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。
- 评测与基准arXiv 2609.39146
MADBench:多智能体辩论安全性评测基准发布
发布 MADBench,评测多智能体辩论会吸收还是放大对抗影响
- arXiv
- 2609.39146
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要MADBench 显示辩论能吸收部分准确率攻击,同时放大未授权读写。
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。
- 攻击arXiv 2609.38270
VirusCascade:劫持 LLM 推荐智能体的协同反思机制
提出 VirusCascade,劫持推荐智能体协同反思以定向推广物品
- arXiv
- 2609.38270
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 评测与基准arXiv 2609.17320
Emergence World:对长时程多智能体系统开展对抗压力测试
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
- arXiv
- 2609.17320
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
摘要结构性授权拦住了记忆投毒的未授权执行,持密钥时承重的是策略预言机。
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
- 评测与基准arXiv 2609.24662
DUMA-Bench:评估 LLM Agent 安全的双控多智能体基准
提出双控多智能体基准 DUMA-Bench,评测 Agent 策略违反
- arXiv
- 2609.24662
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 攻击提示注入
摘要DUMA-Bench 用双控交互评测智能体安全。
DUMA-Bench 把 τ²-bench 的双控交互做成智能体安全评测,用来看策略违反如何随用户、模型和环境一起出现。
已经到底了