研究者系统研究 LLM 智能体记忆投毒攻击并提出 MPBench 基准
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
- arXiv
- 2606.04329
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- GPT-OSS-120B、Meta-Llama-3.1-70B-Instruct、Deberta-v3-base 等 6 个
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
另有 648 篇论文还没打上分类标签,暂不在筛选结果里。
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
提出 CAVEAT 基准,评测购物 Agent 在商业引导下的决策偏离
摘要提出 CAVEAT 基准揭示智能体在商业偏好下的决策退化,诊断出三类失效并给出缓解方案。
提出 DIBench,评测界面注入对移动智能体选择决策的操纵
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
提出利用检查点回滚破坏智能体执行连续性的攻击
摘要论文系统研究了智能体 C/R 的安全性,分析了合法回滚破坏执行连续性的机理,并实证评估了其普遍性与危害。
提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
提出 ISM,用语义匹配隐式操纵 Agent 技能选择
提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放
用 AgentLSD 评测安全 Agent 在对抗任务污染下的解题与开销
AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。
提出 Provenance-Aware Transformers,隔离不可信来源防御间接提示注入
提出技能级联攻击,将恶意目标分散于多个技能以绕过单技能检测
摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。