跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.02035· Qikai Wang·原文 · 入选 精选关注度76

ISM:通过语义匹配隐式操纵 LLM Agent 的技能选择

Implicit Manipulation for Skill Selection in LLM Agents with Semantic Matching

AI 导读

研究者提出 ISM(Implicit Skill-Selection Manipulation via Semantic Matching),一种针对 LLM Agent 技能选择阶段的隐式攻击:即使用户提示词和技能描述单独看都无害,其语义关系仍可被塑造以偏向攻击者选定的技能。该方法同时塑造目标技能的元数据和可复用的提示词,通过三阶段策略扩大语义覆盖、强化目标技能区分度并保持自然措辞,不依赖显式选择指令。在四个任务领域和八个选择器模型上,ISM 将平均目标选择率(TSR)从 15.2% 提升到 63.5%;匹配比较中达到 73.5%,仅比显式引导低 9.8 个百分点。人工审查者只在 2.9% 的判断中拦下 ISM(显式引导为 91.4%),五个基于 LLM 的检查器平均放行 82.9%(显式引导为 37.4%),ISM 对 PPL-W、Llama Prompt Guard 2 和 PIGuard 也仍然有效。

论文速读

问题
LLM-agent 的技能选择依赖用户 prompt 与技能描述的语义匹配,现有攻击多靠显式 prompt injection 或指令级引导,容易暴露可识别的操纵信号。作者提出一种新的隐式攻击面:即使 prompt 和技能描述单独看都无害,二者的语义关系仍可被塑造以偏向攻击者选定的技能。
方法
作者提出 ISM(Implicit Skill-Selection Manipulation via Semantic Matching),同时改造目标技能元数据和可复用 prompt,不加入显式选择指令。三阶段策略:构造任务相关线索以扩大语义覆盖、注入定制技术钩子增强目标区分度、对 prompt 侧措辞做语义约束的自然化以保持自然表达。
实验与结果
在四个任务域、八个 selector 模型上,ISM 把平均目标选择率(TSR)从 15.2% 提升到 63.5%;匹配比较中达 73.5%,仅比 Explicit Steering 低 9.8 个百分点。人工审查仅 2.9% 判定拦截(Explicit Steering 为 91.4%),五个 LLM 检查器平均通过率 82.9%(Explicit Steering 为 37.4%)。对 PPL-W、Llama Prompt Guard 2、PIGuard 仍部分有效,后两者分别把事后 TSR 降到 47.8% 和 46.9%,但对良性输入误拦 26.5% 和 37.5%。
局限与可以继续做的
作者称结论仅限执行前的技能选择,选择率提升本身不等于下游有害执行。结构重写等缓解手段只是部分措施,可能保留伪造能力声明或抹掉合法差异;更强的防护需要来源溯源、能力验证和执行时机制。如何区分合法敏感性与操纵仍是开放问题。

据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。

推荐理由

论文给出了一种不依赖显式指令的技能选择操纵方法,并附上人类与 LLM 审查、规则护栏的通过率对比,可供做 Agent 工具选择防护的团队参考。

阅读原文arxiv.org