评测与基准arXiv 2609.05117
TIER:评估 LLM 安全行为的威胁隐晦度基准
提出 TIER 基准,按威胁隐晦度评测有害提示下的安全行为
- arXiv
- 2609.05117
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- Qwen1.5-MoE、Gemma-2B、Mistral-7B 等 6 个
提出 TIER 基准,按威胁隐晦度评测有害提示下的安全行为
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。