评测与基准arXiv 2610.07089
研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹
构建统一滥用监视基准,评测分解攻击与提示注入轨迹
- arXiv
- 2610.07089
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Gemma 4 26B-A4B、Qwen3.6 27B、Qwen3.5 27B 等 12 个
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
构建统一滥用监视基准,评测分解攻击与提示注入轨迹
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
提出局部稀疏无监督安全检测,标记偏离安全分布的输入