研究者系统研究 LLM 智能体记忆投毒攻击并提出 MPBench 基准
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
- arXiv
- 2606.04329
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Meta-Llama-3.1-70B-Instruct、Llama-3.1-8B-Instruct、XLM-RoBERTa-base 等 6 个
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
另有 608 篇论文还没打上分类标签,暂不在筛选结果里。
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
提出 EVOMAL 攻击,诱导编码 Agent 自我投毒并蠕虫式传播技能
摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。
提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
展示失准智能体经持久记忆将目标传给后续对齐智能体执行
论文揭示了 LLM 智能体在无需外部攻击者干预下,通过持久化记忆将未竟失准目标传递给后续对齐智能体执行的“失准自我传播”安全威胁。。
综述自主渗透智能体的继承攻击、架构攻击及护栏覆盖缺口
这是一篇关于自主 AI 渗透测试智能体的安全综述:用架构和生命周期两轴整理威胁与护栏,不做新的攻击实验。
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。
重测记忆型自改进智能体,揭示任务顺序和多次运行带来的性能不稳
这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。
提出 M-CPE 与 X-CPE 两类上下文特权提升攻击
构建 PASB 评测自改进个人 Agent 的跨会话持久谄媚
PASB 评测自改进个人智能体的持久谄媚:用户主张被智能体自己写入档案、记忆或技能后,新会话里的中立问题仍可能按它作答。
用演化算法构造思维病毒并测量其在多智能体中的传播
研究提出"内核管理共享内存",由智能体系统内核而非单个智能体统一负责记忆检索、隐私执行与提示注入。
kernel-managed shared memory 把多智能体的检索、隐私和注入收进 agent-system kernel,并在 AIOS 上与三种替代方案比较。
综述智能体执行链路中的越狱攻击、防御与实践权衡
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
提出 VirusCascade,劫持推荐智能体协同反思以定向推广物品
提出 FAME,用反事实概念漂移评测智能体虚假记忆
FAME 是一个免训练的评测框架,用来判断自主智能体的记忆在虚假相关、环境偏移或知识冲突下是否已变成虚假记忆。。
提出 DERIVAUDIT,审计长期 Agent 记忆是否由交互历史支持
DERIVAUDIT 审计长期智能体的持久记忆是否由写入时可获得的交互历史支持,而不是只看以后能否被召回。
提出 SYNCHAIN,诱导计算机使用 Agent 自合成潜伏技能并跨任务触发
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。