评测与基准arXiv 2604.07223
TraceSafe-Bench:评估 LLM 护栏在多步工具调用轨迹上的表现
提出基准 TRACE SAFE-BENCH 评测多步工具调用轨迹护栏
- arXiv
- 2604.07223
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- GPT-5 mini、GPT-5.4 mini、Gemini3-Flash 等 15 个
摘要TRACE SAFE-BENCH 用可控变异评轨迹护栏,结构能力比规模和越狱鲁棒性更相关。
TRACE SAFE-BENCH 用固定的多步工具轨迹评护栏,问的是不安全动作到达环境之前能否被拦住,而不是智能体自己会不会拒绝。