论文提出 LLM 输入扰动鲁棒性度量,并发布 ASA 攻击与 AttestMCP 防护
提出 ASA 与 AttestMCP,度量并降低 LLM 对输入序列扰动的敏感
- arXiv
- 2610.02432
- 发表
- 层
- 应用层
- 攻击者
- 黑盒
- 被测模型
- Gemma-3-27B-Instruct、Gemma-3-4B-Instruct、Llama-3.2-3B-Instruct 等 12 个
提出 ASA 与 AttestMCP,度量并降低 LLM 对输入序列扰动的敏感
提出 MIRROR,用多路径摘要多数表决保障多智能体通信完整性
MIRROR 是 LLM 多智能体通信层上的多路径法定人数完整性原语,只处理不透明字节,不解释消息内容。要处理的是 Agent-in-the-Middle:中介合法终结 TLS 后可改在途消息,而语义校验有推理开销和误拦,签名又要求私钥管理。做法是生成结束后复制同一规范化载荷。
提出 BDA,按辩证动作可靠性加权聚合多 LLM 议会以抵抗持续对抗
BDA 是一种不另调 LLM 的多 LLM 议会聚合方法,同时处理置信度校准和持续不可靠席位。
提出 MiniRep,在多智能体辩论聚合中结合当前质量、风险与历史声誉并限制克隆组
MiniRep 是面向恶意智能体的 MAD 声誉聚合,只作用在 Decide 阶段。
提出检索器后门攻击操纵智能体搜索,并用 DOU 逃避检测
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
提出技能级联攻击,把有害目标拆散到多个技能里绕过单技能扫描
摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。
提出两阶段框架 A2M,优化 MCP 工具元数据与返回载荷以劫持 Agent
提出基准投毒攻击,使自修改编码 Agent 跨代写出含漏洞代码
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
提出 Emergence World,对长时程多智能体系统开展对抗压力测试
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
提出 ISM,用语义匹配隐式操纵 Agent 技能选择
部署方侧的两层证明,用来在多智能体跨部署方委托之后回答两个事后问题:谁放出了这些字节,这条跨部署方边有没有父方授权。
提出利用检查点回滚破坏 Agent 执行连续性的攻击
摘要论文系统研究了智能体 C/R 的安全性,分析了合法回滚破坏执行连续性的机理,并实证评估了其普遍性与危害。
提出 SKILLBLOAT,改写技能文档放大编码 Agent token 消耗
提出 CDH 攻击,让技能型 Agent 绕路放大资源消耗
CDH 是针对渐进披露技能智能体的发布者侧、纯文本攻击:一个静态协调器把本可正确完成的任务,拐进有界但更耗资源的技能绕路,再交还原任务。
复现 AgentCF 上的多智能体攻防并刻画连通性作用
作者在 AgentCF 上研究连通性如何改变多智能体协同过滤的攻防,复现已有方法而不是提出新载荷。
提出多智能体流水线的边界攻击,使对抗内容作为可信输入跨层传播
作者把多智能体 LLM 流水线的对抗问题定义为缺少边界校验,并用生产轨迹和受控实验检查脆弱性来自架构还是骨干模型。中间输出未经验证就传给下游。作者认为,一旦某级接受对抗内容,后续智能体会把它当作可信输入。