研究系统比较六种越狱评测器的可靠性
An Empirical Measurement of Jailbreaking Evaluators
AI 导读
研究者在同一人工标注数据上系统比较了六种越狱评测器:HarmBench、JailbreakBench、JailbreakRadar、StrongReject、JADES 和 JailMeter。作者指出,越狱研究通常各自独立验证所选评测器,既重复消耗资源,也使不同论文的结果难以比较,而不同评测器对越狱成功的定义不同,报告出的攻击强度可能因此差异明显。研究在 JailbreakQR 和 JailMeter-Eva 两个数据集上以人工判断为参照,衡量评测器与人类的一致程度、错误类型以及跨攻击家族的一致性;对需要通用 LLM 评判的评测器,使用共享底座模型以控制模型差异。