ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击
ECLIPSE: Self-Evolving Stealthy Prompt Injection Attack against Long-Horizon Agentic Systems
AI 导读
研究者提出 ECLIPSE,一个面向长程 Agent 系统的自演化隐蔽提示注入框架,把直接用户提示注入与工具侧间接注入结合。其 Stealthy Attack Trajectory Synthesis 在沙箱中生成并迭代验证候选工具链,再渲染成自然的一次性提示;Tool-Chain Steering 通过 Static Workflow Encoding 在工具描述中嵌入状态转移线索,并用 Dynamic Trajectory Correction 在偏离计划时追加纠正信号。作者同时发布 LASE-Bench,含 120 个恶意任务和 198 个工具,96.7% 的任务至少调用五次工具。作者测试 DataSentinel、Tool-Guard、AgentDoG、SecAlign 等防御后认为现有护栏无法可靠识别跨步骤依赖。
论文速读
- 长程 LLM agent 通过反复调用工具执行任务,带来新的 prompt injection 风险。现有攻击要么把恶意目标集中在一句显式指令里、容易被检测,要么把意图分散到多个执行阶段、成功率不稳定。
- 作者提出 Eclipse,把直接的用户 prompt 注入与间接的工具侧注入结合:SATS 在沙箱中生成并迭代验证候选工具链,再渲染成自然的一次性 prompt;TCS 通过 SWE 把状态转移线索写进目标工具描述,并用 DTC 在执行偏离时追加纠正信号。另建 LASE-Bench 长程 agent 安全基准。
- 在 7 个不同基座模型的 agent 上测试,无防御时 ASR 最高 96.7%,常见安全过滤下 69.2%,比最强基线高 27.5 个百分点;在短程 SHADE-Arena 上 ASR 58.1% 且轨迹相似度最高;在 OpenClaw 和 Hermes 真实 agent 系统上也能迁移。对 DataSentinel、Tool-Guard、AgentDoG、SecAlign 等防御的评估显示现有防护无法可靠拦截。
- 作者称现有防御会降低 Eclipse 效果,但无法可靠识别其 prompt、工具元数据与执行轨迹之间的跨步依赖,因此需要能联合推理多来源的防御。材料未给出其他局限或后续方向。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
论文给出长程 Agent 提示注入的攻击成功率与五类防御下的拦截表现,部署工具调用型 Agent 的团队可据此评估自身风险。