论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆
提出eTAMP,通过网页注入跨会话污染Web智能体轨迹记忆
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
另有 60 篇论文还没打上分类标签,暂不在筛选结果里。
提出eTAMP,通过网页注入跨会话污染Web智能体轨迹记忆
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
提出BENCHJACK,自动审计智能体基准的奖励作弊缺陷
论文系统研究了主流 AI 智能体基准评测中的奖励作弊问题,提出了首个针对基准缺陷的自动化红队审计与生成对抗式迭代修补系统 BENCHJACK。
提出跨通道分段攻击,借MCP多通道隐式信任外发敏感数据
提出两阶段黑盒劫持框架,优化恶意工具元数据与返回载荷以操纵智能体
论文提出了一种针对模型上下文协议(MCP)智能体的两阶段黑盒劫持框架 A2M。
提出SigLeak,从执行轨迹比对中推断专有智能体技能
提出破坏执行连续性的回滚攻击,揭示检查点恢复的安全故障
提出技能名抢注攻击,利用智能体虚构技能名劫持技能供应链
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
提出MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
本文系统分析了真实世界 AI 智能体 Harness 上下文组装机制的安全性。
提出自博弈红队智能体GPT-Red,自动挖掘提示注入与越狱攻击
提出AHA自动科研循环,发现生产级智能体的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出OpenART竞技场,用EMHA演化持久环境以评测智能体安全
系统分析智能体支付协议AP2,揭示合法签名无法阻止前置上下文操纵
本文针对Google智能体支付协议AP2 v0.2展开了系统性安全分析,揭示了密码学签名在智能体前置操作上下文遭到篡改时的安全局限。
注入控制标记闭合推理通道,消除思维链以规避监控并触发恶意工具调用
提出CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞
提出HOOKPRY,利用插件生命周期钩子更新劫持智能体框架执行命令
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
提出ISM,协同改写技能描述与提示词以隐式操纵技能选择
提出Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私
提出FLOWSEAL,在工具边界以信息流控制阻断智能体隐私泄露