ISM:通过语义匹配隐式操纵 LLM Agent 的技能选择
Implicit Manipulation for Skill Selection in LLM Agents with Semantic Matching
AI 导读
研究者提出 ISM(Implicit Skill-Selection Manipulation via Semantic Matching),一种针对 LLM Agent 技能选择阶段的隐式攻击:即使用户提示词和技能描述单独看都无害,其语义关系仍可被塑造以偏向攻击者选定的技能。该方法同时塑造目标技能的元数据和可复用的提示词,通过三阶段策略扩大语义覆盖、强化目标技能区分度并保持自然措辞,不依赖显式选择指令。在四个任务领域和八个选择器模型上,ISM 将平均目标选择率(TSR)从 15.2% 提升到 63.5%;匹配比较中达到 73.5%,仅比显式引导低 9.8 个百分点。人工审查者只在 2.9% 的判断中拦下 ISM(显式引导为 91.4%),五个基于 LLM 的检查器平均放行 82.9%(显式引导为 37.4%),ISM 对 PPL-W、Llama Prompt Guard 2 和 PIGuard 也仍然有效。
论文速读
- LLM-agent 的技能选择依赖用户 prompt 与技能描述的语义匹配,现有攻击多靠显式 prompt injection 或指令级引导,容易暴露可识别的操纵信号。作者提出一种新的隐式攻击面:即使 prompt 和技能描述单独看都无害,二者的语义关系仍可被塑造以偏向攻击者选定的技能。
- 作者提出 ISM(Implicit Skill-Selection Manipulation via Semantic Matching),同时改造目标技能元数据和可复用 prompt,不加入显式选择指令。三阶段策略:构造任务相关线索以扩大语义覆盖、注入定制技术钩子增强目标区分度、对 prompt 侧措辞做语义约束的自然化以保持自然表达。
- 在四个任务域、八个 selector 模型上,ISM 把平均目标选择率(TSR)从 15.2% 提升到 63.5%;匹配比较中达 73.5%,仅比 Explicit Steering 低 9.8 个百分点。人工审查仅 2.9% 判定拦截(Explicit Steering 为 91.4%),五个 LLM 检查器平均通过率 82.9%(Explicit Steering 为 37.4%)。对 PPL-W、Llama Prompt Guard 2、PIGuard 仍部分有效,后两者分别把事后 TSR 降到 47.8% 和 46.9%,但对良性输入误拦 26.5% 和 37.5%。
- 作者称结论仅限执行前的技能选择,选择率提升本身不等于下游有害执行。结构重写等缓解手段只是部分措施,可能保留伪造能力声明或抹掉合法差异;更强的防护需要来源溯源、能力验证和执行时机制。如何区分合法敏感性与操纵仍是开放问题。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
论文给出了一种不依赖显式指令的技能选择操纵方法,并附上人类与 LLM 审查、规则护栏的通过率对比,可供做 Agent 工具选择防护的团队参考。