研究者系统研究 LLM 智能体记忆投毒攻击并提出 MPBench 基准
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
- arXiv
- 2606.04329
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- GPT-OSS-120B、Meta-Llama-3.1-70B-Instruct、Deberta-v3-base 等 6 个
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
另有 669 篇论文还没打上分类标签,暂不在筛选结果里。
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
提出 CONTRA,用树搜索修改良性配置以诱发 Agent 恶意动作
提出 LoginTrap,用网页弹窗实施任务无关钓鱼式间接提示注入并窃取敏感信息
摘要揭示网络智能体在黑盒网页下的登录诱导风险,利用模糊测试生成话术并跨骨干和架构验证了隐私泄露威胁。
提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出 BenchJack 系统审计智能体基准的奖励作弊缺陷
论文系统研究了主流 AI 智能体基准评测中的奖励作弊问题,提出了首个针对基准缺陷的自动化红队审计与生成对抗式迭代修补系统 BENCHJACK。
提出 PERSISTBD,发布前强化后门以穿透良性 SFT 与 RL
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
提出 M-CPE 与 X-CPE 两类上下文特权提升攻击
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞
摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
提出只改多智能体潜在通信链路以提高有害遵从的攻击
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。
提出条件触发的爆炸提示词,延迟激活 Agent 的间接提示注入
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
提出跨目标课程强化学习,生成间接提示注入以劫持智能体
该研究针对强化学习自动化提示注入红队在攻击前沿大模型时的冷启动问题,提出了一种基于目标模型鲁棒性递进的课程强化学习方法。
提出残余权限重放攻击,让长期 Agent 跨任务复用未失效授权
提出 AdaLCPI,把间接提示注入拆成片段嵌入工具返回并自适应优化