跳到正文
原文
arXiv:危险能力与安全评测· arXiv:2609.05117· Thu-Hien Trinh-Thi·· 27 天前

TIER:评估 LLM 安全行为的威胁隐晦度基准

TIER: Threat Implicitness Benchmark for Evaluating LLM Safety Behaviors

AI 导读

研究者提出 TIER,一个用于评估 LLM 行为安全的威胁隐晦度基准,覆盖四个风险领域和四个威胁等级,从显式有害请求到复杂越狱。该基准用六标签行为量表和两个独立 LLM 评判器评估回答。在六个开源权重 LLM 上的实验显示,安全行为随威胁等级逐渐演变,而非直接从拒答跳到顺从;上下文类提示词产生最多样的行为,越狱则暴露最大的鲁棒性差距。攻击成功率相近的模型也可能呈现不同的回答分布,说明需要行为感知的 LLM 安全评测。

阅读原文arxiv.org