攻击arXiv 2606.14517
研究者披露针对 LLM Agent 护栏的推理扩展型拒绝服务攻击
提出针对 LLM Agent 护栏的推理扩展拒绝服务攻击
- arXiv
- 2606.14517
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- TS-Guard-8B、Qwen3.5-9B、DeepSeek-V3.2 等 11 个
提出针对 LLM Agent 护栏的推理扩展拒绝服务攻击
提出 CONTRA,用树搜索修改良性配置以诱发 Agent 恶意动作
提出 PERSISTBD,发布前强化后门以穿透良性 SFT 与 RL
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
提出 AdaLCPI,把间接提示注入拆成片段嵌入工具返回并自适应优化