论文提出选项通道攻击:改一个选项标签即可让 Agent 护栏放行违规操作
提出选项通道攻击,改写选项标签使 Agent 护栏放行违规操作
- arXiv
- 2610.12292
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 黑盒
- 被测模型
- LAYA-TD、LAYA-EN、LAYA-ML 等 5 个
摘要作者评估指出类型化模型不应作为最终安全裁决者,其易受非策略文本与选项名称操控,且置信度过滤无法抵御攻击。
提出选项通道攻击,改写选项标签使 Agent 护栏放行违规操作
摘要作者评估指出类型化模型不应作为最终安全裁决者,其易受非策略文本与选项名称操控,且置信度过滤无法抵御攻击。
提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
提出 ColluSkill,用跨技能组合绕过 Agent 技能扫描器
摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。
提出 CompoSkill,将逐个通过扫描的技能编排为攻击链
摘要论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。
提出 EVOMAL,诱导自演化编码 Agent 在创建技能时自我投毒并蠕虫传播
摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。
提出 CORSA,按任务簇优化技能注入的检索与执行
提出跨通道分段攻击,利用 MCP 隐式信任诱导外发敏感文件
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
提出 PRETEXT 白盒攻击,迭代改写技能文本以绕过 Agent 技能扫描器
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出两阶段框架 A2M,优化 MCP 工具元数据与返回载荷以劫持智能体
提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
提出 HOOKPRY,利用插件生命周期钩子更新劫持 Agent 框架
提出 ISM,用语义匹配隐式操纵 Agent 技能选择
提出 ContextLeak,用强化学习生成恶意工具描述以诱导 Agent 外泄上下文
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
提出技能级联攻击,将恶意目标分散于多个技能以绕过单技能检测
摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。
提出 SkillDRE,用预执行与运行时反馈演化恶意技能