评测与基准arXiv 2609.06783
AURA-Eval:评估 LLM Agent 工具调用轨迹中的风险意识行为
提出 AURA-Eval 评测工具调用 Agent 的情境风险意识与行动
- arXiv
- 2609.06783
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude Sonnet 4.6、Claude Opus 4.6、GLM-5.1 等 15 个
摘要AURA-Eval 用配对轨迹诊断智能体在有无安全路径时的风险识别与行动。
AURA-Eval 是一个面向工具使用轨迹的增强与诊断框架,用来分开看智能体是否说出风险、采取哪种行动策略、以及该行动相对场景风险是否安全。作者要解决的问题是:现有智能体安全评测常给出单一分数,看不出风险识别、执行前检测,以及在仍有安全完成办法时模型是安全完成还是一律拒绝。