防御arXiv 2610.02432
论文提出 LLM 输入扰动鲁棒性度量,并发布 ASA 攻击与 AttestMCP 防护
提出 ASA 与 AttestMCP,度量并降低 LLM 对输入序列扰动的敏感
- arXiv
- 2610.02432
- 发表
- 层
- 应用层
- 攻击者
- 黑盒
- 被测模型
- Gemma-3-27B-Instruct、Gemma-3-4B-Instruct、Llama-3.2-3B-Instruct 等 12 个
提出 ASA 与 AttestMCP,度量并降低 LLM 对输入序列扰动的敏感
提出 TRUSTFORK 基准,评测展示身份劫持多智能体编排权限
摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。
提出双控多智能体基准 DUMA-Bench,测量对抗环境下的策略违反
DUMA-Bench 把 τ²-bench 的双控交互做成智能体安全评测,用来看策略违反如何随用户、模型和环境一起出现。
提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞
摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。
提出 Skill-as-API,隔离多智能体协作中的 skill 正文与系统提示词
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
提出分片监督,将评判标准分配给独立调用以抵御展示攻击
本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。