评测与基准arXiv 2605.19722
研究用 30 项漏洞分析任务评测自主安全智能体的安全对齐效果
评测自主安全智能体在授权漏洞分析中的对齐拒答效应
- arXiv
- 2605.19722
- 发表
- 层
- 应用层
- 被测模型
- Gemma 4 31B official instruction-tuned model、TrevorJS Gemma 4 31B uncensored GGUF、Gemma 4 26B A4B official instruction-tuned model 等 8 个
- 风险拒答失当
摘要轨迹级评测把拒答、接地、工具接口分开。
这项工作把安全对齐效应测成自主安全智能体的轨迹属性,而不是单轮拒答率。