跳到正文
原文
论文追踪· arXiv:2605.30883· Zeng, Churui, Xiu, Kedong, Qi, Weiwei, Hao, Yuqi, Lu, Chaochao, He, Liang, Qin, Zhan, Zheng, Tianhang·本站收录 · 原文发表

TRACE:面向 LLM Agent 的任务感知自适应自进化越狱框架

TRACE: Task-Aware Adaptive Self-Evolving Agentic Jailbreaking

AI 导读

研究者提出 TRACE,一个针对 LLM Agent 的智能体越狱框架,在 AdvCUA 上对多个先进 LLM Agent 的攻击成功率比现有越狱方法提升超过 100%。该框架先设计约 20 种流程分解方案,按任务类型规定关键操作与依赖,把复杂有害任务拆成更易执行、外观更无害的子任务序列,并从两个维度评估候选序列后选出最优者用于发起攻击。对仍被拒答的子任务,TRACE 构建不同的子任务画像,并建立与之对应的、面向执行的演进式多轮越狱策略库,检索出包含中间目标、环境状态和相关工具的策略,通过多轮交互逐步建立可信的执行上下文。作者指出,现有越狱方法多聚焦诱导有害指令,忽视模型对执行这些指令的拒答,且中间步骤失败或依赖报错会导致整个攻击流程中断重启,TRACE 通过状态恢复而非重启来应对。代码已公开。

阅读原文arxiv.org