攻击arXiv 2606.14517·6月12日研究者披露针对 LLM Agent 护栏的推理扩展型拒绝服务攻击提出针对 LLM Agent 护栏的推理扩展拒绝服务攻击arXiv2606.14517发表6月12日层应用层场景AI Agent攻击者黑盒、白盒攻击拒绝服务技术推理链操控组件护栏与评审+2+2深度解读完整解读
攻击arXiv 2610.07510·10月6日PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率提出 PERSISTBD,发布前强化后门以穿透良性 SFT 与 RLarXiv2610.07510发表10月6日层应用层场景编程 Agent被测模型Qwen2.5-Coder-3B-Instruct、Qwen2.5-Coder-7B-Instruct、Qwen3-Coder-30B-A3B-Instruct攻击投毒与后门技术梯度与表征优化组件微调与开源权重+1+1摘要总结了论文关于后门在 SFT/RL 中存活的发现、两因子机制、PERSISTBD 方法与核心数字。本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。深度解读完整解读