CompoSkill 框架利用逐个通过扫描的 Agent 技能组合发起攻击
提出 CompoSkill,诱导 Agent 将过审技能组合成攻击链
- arXiv
- 2608.16246
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- GPT-5.4、Gemini-3.1-flash、DeepSeek-V4 等 4 个
摘要论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。
另有 284 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CompoSkill,诱导 Agent 将过审技能组合成攻击链
摘要论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。
提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
提出 DIBench,评测界面注入对移动智能体选择决策的操纵
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
重评提示注入检测器,检验基准分数对智能体部署的预测力
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
用 MMPIBench 评测智能体框架的多模态提示注入
摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
提出 TACIT,读取冻结隐藏状态以检测智能体有害轨迹
摘要提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。
提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出 Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私
摘要论文提出了针对黑盒 VLM 的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。
提出神经符号纵深架构,阻断 AI-SOC 的日志投毒与间接提示注入
提出 ActGuard,在执行前审计并遮盖诱发动作偏离的间接注入
提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
提出 SkillDRE,用预执行与运行时反馈演化恶意技能
评测 System One 模型对 Agent 安全输入的分类可靠性与校准
Liu 离线评测 System One 模型能否为智能体安全输入给出可自动化的概率决策。问题是分类是否可靠,以及概率能否在指定漏检和误拦上限内支持放行、拦截或复核。
构建多模态技能图像攻击基准 MMSkillRisk 并设计 NCVA
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。