跳到正文
原文
Failure-First·· 2026-08-05

研究揭示越狱判定器不可靠:ASR 自动评分存在校准与对抗鲁棒性问题

[Daily Paper] How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring

AI 导读

Veyon Solutions 的 Yang Gao 在 HarmBench 分类器验证集(596 条人工标注完成结果)上测试了自动越狱判定器的可靠性,发现两类判定器以相反方式失效。专用分类器(如 HarmBench classifier)召回率 0.974、精确率 0.835,倾向过度标记,可能抬高 ASR;LLM-as-judge 精确率高但召回率极低,Qwen2.5-7B 召回仅 0.174、F1 为 0.294,Qwen2.5-3B 召回 0.059。在内容不变的包装攻击下,仅加一句拒答前缀就能让 LLM 判定器把有害内容改判为安全,翻转率在 39% 至 88% 之间,部分模型任意包装的翻转率达 100%。

阅读原文failurefirst.org