摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
全部论文
另有 429 篇论文还没打上分类标签,暂不在筛选结果里。
- 评测与基准arXiv 2610.03153
EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准
提出 EvoRiskBench,评测工作区 Agent 的运行时安全风险
- arXiv
- 2610.03153
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 攻击提示注入
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
- 防御arXiv 2610.02005
贝叶斯辩证论证(BDA):面向持续对抗下多 LLM 委员会的可校准聚合
提出 BDA,把多 LLM 议会的辩证动作当可靠性证据做加权聚合
- arXiv
- 2610.02005
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要BDA 用零额外调用的可靠性加权,给出可校准后验,并在持续对抗下反转不可靠席位。
BDA 是一种不另调 LLM 的多 LLM 议会聚合方法,同时处理置信度校准和持续不可靠席位。
- 防御arXiv 2610.00371
FlowReview:以授权配对评测控制多智能体组合信息流
提出 FlowReview,用对象解析与确定性提交门控制多智能体组合信息流
- arXiv
- 2610.00371
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要配对标准要求拒绝禁止使用并完成授权使用,FlowReview 把三项审查接到执行。
这篇工作把多智能体安全写成一件必须同时成立的事:拦住组合信息所启用的禁止使用,并完成同一场景里任务所需的授权使用。
摘要两层证明记录放出字节与边授权。
部署方侧的两层证明,用来在多智能体跨部署方委托之后回答两个事后问题:谁放出了这些字节,这条跨部署方边有没有父方授权。
- 防御arXiv 2608.30083
研究者提出零知识谓词证明网关,在 MCP 与 Agent2Agent 上实现 Agent 间数据最小化
提出零知识谓词证明网关,让 Agent 只交换谓词证明而不传敏感值
- arXiv
- 2608.30083
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要作者将 source integrity 而不是证明开销视为绑定约束。
Proof Gateway 是一套已运行的智能体间数据最小化机制:用治理谓词的零知识证明代替原始值和自然语言自述。
- 攻击arXiv 2608.23858
研究者对 Google AP2 v0.2 做系统安全分析,识别 48 项威胁
系统分析 AP2 支付协议的授权安全并验证前置上下文操纵
- arXiv
- 2608.23858
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 攻击arXiv 2609.17817
论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
- arXiv
- 2609.17817
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
- 攻击arXiv 2610.00392
A2A-TIBA:针对 A2A 协议 LLM 智能体的间接提示注入攻击与三层同构攻防模型
提出 A2A-TIBA 间接提示注入,诱导智能体部署常驻回调并外传数据
- arXiv
- 2610.00392
- 发表
- 层
- 应用层
摘要A2A-TIBA 一次植入后绕过智能体,GDA 用四类结果定位防线,ELA-ITL 把信封标注列为第三层。
A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。
摘要潜在链路本身即可改变冻结智能体系统的安全,奖励既能攻击也能修复。
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。
- 防御arXiv 2609.01677
Skill-as-API:面向智能体软件工程的机密多智能体协作协议
提出 Skill-as-API,防止协作通道泄露 skill 代码与系统提示词
- arXiv
- 2609.01677
- 发表
- 层
- 应用层
摘要协议把 skill 正文留在所有者侧,四层限制发现内容、权限期限和注入拼接。
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
- 防御arXiv 2609.39297
MiniRep:面向多智能体辩论的鲁棒声誉聚合方法
提出 MiniRep,按当前质量、风险与历史声誉聚合多智能体辩论
- arXiv
- 2609.39297
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要MiniRep 用当前提案证据校准历史声誉并限制克隆组,MATH 上平均准确率高于基线,其他任务有反例。
MiniRep 是面向恶意智能体的 MAD 声誉聚合,只作用在 Decide 阶段。
- 攻击arXiv 2609.22711
UBA-ORL:针对离线强化学习的遗忘激活后门攻击
提出 UBA-ORL,借助 BD 与 CM 样本让离线强化学习后门在轨迹删除后激活
- arXiv
- 2609.22711
- 发表
- 场景
- 具身与机器人
摘要UBA-ORL 用竞争的 BD/CM 样本,使离线 RL 后门在删除伪装轨迹后激活。
UBA-ORL 研究离线强化学习中由合规轨迹删除激活的后门:合法贡献者同时上传共享触发的后门轨迹和伪装轨迹,训练后触发响应被压低,删除伪装批次后再升高。受害系统是使用静态数据集和轨迹级遗忘接口的离线 RL 服务。对手不能看到训练算法、参数、梯度或具体遗忘算法,但能提交可区分批次,并在部署时向观测注入预定触发。
- 评测与基准arXiv 2609.32635
TrustFork:显示身份如何劫持 LLM 智能体编排的权限
提出 TRUSTFORK 基准,评测展示身份劫持多智能体编排权限
- arXiv
- 2609.32635
- 发表
- 层
- 应用层
- 攻击提示注入
摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。
- 评测与基准arXiv 2609.17320
Emergence World:对长时程多智能体系统开展对抗压力测试
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
- arXiv
- 2609.17320
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
- 防御arXiv 2609.30824
基于加密绑定身份验证能力令牌协调分布式 AI 智能体的提案
提出身份绑定且只收窄的能力令牌,用上下文外钱包约束智能体
- arXiv
- 2609.30824
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要用只衰减的身份绑定令牌和上下文外钱包,约束代表人类行动的分布式智能体。
代表人类行动的分布式智能体,需要一种不把密钥放进语言模型上下文的授权方式。
- 评测与基准arXiv 2609.33102
ORBIT:基于 UK AISI Inspect 的多智能体安全评测框架
提出 ORBIT 框架,评测多智能体系统中的攻击、合谋与多类防御
- arXiv
- 2609.33102
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。