研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御
提出 A-VIP,将购物意图绑定到支付授权以阻断商户文本操控
另有 378 篇论文还没打上分类标签,暂不在筛选结果里。
提出 A-VIP,将购物意图绑定到支付授权以阻断商户文本操控
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
完整解读用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据
提出 APEX,用跨技能进度记录夹带虚假授权劫持智能体
完整解读提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
完整解读提出控制标记注入,清空工具智能体推理链以绕过思维链监控
提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞
提出 memetic trojans,把对抗载荷嵌入智能体自发转发的社会传染内容
Memetic trojans 是一类网络介导攻击:对抗载荷搭在智能体本来就会转发和点赞的内容上扩散,转发者不必被攻陷,也不必执行“请继续复制”的指令。
提出 LLMLeak,把机密编进报错 URL,借聊天机器人网页抓取外传
LLMLeak 研究一种隐蔽外传:本地恶意软件已拿到机密,却因为网络限制或监控不能直接连接攻击者,于是把秘密放进看起来像排障文档的 URL,让良性聊天机器人的网页抓取工具在访问时把秘密带出去。
提出 ISM,协同改写技能描述与提示词以隐式操纵技能选择
完整解读提出 Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私
提出 FLOWSEAL,在工具边界以信息流控制阻断智能体隐私泄露
提出 CODETTA 隐写框架,使多智能体在审计下隐蔽传载荷
提出 JailbreakSkill,用可演化技能自动搜索并复用越狱提示
完整解读提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
提出技能级联攻击,把恶意目标拆进多个技能以绕过单技能检测
提出跨目标课程强化学习,生成间接提示注入以劫持智能体
该研究针对强化学习自动化提示注入红队在攻击前沿大模型时的冷启动问题,提出了一种基于目标模型鲁棒性递进的课程强化学习方法。