贝叶斯辩证论证(BDA):面向持续对抗下多 LLM 委员会的可校准聚合
提出 BDA,把多 LLM 议会的辩证动作当可靠性证据做加权聚合
- arXiv
- 2610.02005
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- gemma-3-27b-it、phi-4、gpt-4.1-nano 等 9 个
摘要BDA 用零额外调用的可靠性加权,给出可校准后验,并在持续对抗下反转不可靠席位。
BDA 是一种不另调 LLM 的多 LLM 议会聚合方法,同时处理置信度校准和持续不可靠席位。
另有 480 篇论文还没打上分类标签,暂不在筛选结果里。
提出 BDA,把多 LLM 议会的辩证动作当可靠性证据做加权聚合
BDA 是一种不另调 LLM 的多 LLM 议会聚合方法,同时处理置信度校准和持续不可靠席位。
提出跨独立助手的工件介导记忆跳跃自传播攻击
该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。
提出 FlowReview,用对象解析与确定性提交门控制多智能体组合信息流
这篇工作把多智能体安全写成一件必须同时成立的事:拦住组合信息所启用的禁止使用,并完成同一场景里任务所需的授权使用。
提出多智能体输出与委派谱系的两层存证方案
部署方侧的两层证明,用来在多智能体跨部署方委托之后回答两个事后问题:谁放出了这些字节,这条跨部署方边有没有父方授权。
提出零知识谓词证明网关,让 Agent 只交换谓词证明而不传敏感值
Proof Gateway 是一套已运行的智能体间数据最小化机制:用治理谓词的零知识证明代替原始值和自然语言自述。
系统分析 AP2 支付协议的授权安全并验证前置上下文操纵
提出 memetic trojans,把对抗载荷嵌入智能体自发转发的社会传染内容
Memetic trojans 是一类网络介导攻击:对抗载荷搭在智能体本来就会转发和点赞的内容上扩散,转发者不必被攻陷,也不必执行“请继续复制”的指令。
提出 A2A-TIBA 间接提示注入,诱导智能体部署常驻回调并外传数据
A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。
提出 Skill-as-API,防止协作通道泄露 skill 代码与系统提示词
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
发布 MADBench,评测多智能体辩论会吸收还是放大对抗影响
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。
提出 MiniRep,按当前质量、风险与历史声誉聚合多智能体辩论
MiniRep 是面向恶意智能体的 MAD 声誉聚合,只作用在 Decide 阶段。
提出 VirusCascade,劫持推荐智能体协同反思以定向推广物品
提出 TRUSTFORK 基准,评测展示身份劫持多智能体编排权限
摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
提出任务绑定令牌与策略预言机,在多智能体流水线中拦截未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
提出双控多智能体基准 DUMA-Bench,评测 Agent 策略违反
DUMA-Bench 把 τ²-bench 的双控交互做成智能体安全评测,用来看策略违反如何随用户、模型和环境一起出现。
提出身份绑定且只收窄的能力令牌,用上下文外钱包约束智能体
代表人类行动的分布式智能体,需要一种不把密钥放进语言模型上下文的授权方式。
提出 ORBIT 框架,评测多智能体系统中的攻击、合谋与多类防御
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。