攻击arXiv 2606.14517
研究者披露针对 LLM Agent 护栏的推理扩展型拒绝服务攻击
提出针对 LLM Agent 护栏的推理扩展拒绝服务攻击
- arXiv
- 2606.14517
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- TS-Guard-8B、Qwen3.5-9B、DeepSeek-V3.2 等 11 个
提出针对 LLM Agent 护栏的推理扩展拒绝服务攻击
提出 PRETEXT 白盒攻击,迭代改写技能文本以绕过 Agent 技能扫描器
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出参考嫁接,在推理阶段用激活干预诱导沙袋隐藏能力
摘要提出参考嫁接在推理阶段以低成本匹配微调诱导效果,揭示隐瞒表征重叠与阈值门控机制。