- 评测与基准arXiv 2610.07089
研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹
构建统一滥用监视基准,评测分解攻击与提示注入轨迹
- arXiv
- 2610.07089
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
- 防御arXiv 2610.00400
DART:用表征位移检测多轮 LLM 智能体中的新兴安全风险
提出 DART,用去噪表征转移检测多轮智能体攻击并注入提醒
- arXiv
- 2610.00400
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 黑盒
- 防御arXiv 2609.36603
SED:面向 LLM 智能体的免训练持续安全策略学习框架
提出免训练框架 SED,把智能体有害轨迹蒸馏成可检索安全策略
- arXiv
- 2609.36603
- 发表
- 层
- 应用层
- 场景
- AI Agent
已经到底了