评测与基准arXiv 2609.29429
Jev 被用于零样本检测十类对齐失败,中位 AUROC 达 0.886
提出 RLCDAlignBench,零样本检测多种对齐失败
- arXiv
- 2609.29429
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Jev (jev-1.13.0)
摘要一次通用问题已能给多数对齐失败排序,大的误差来自状态和标签。
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改
SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。
提出 AHA 自动科研循环,发现生产 Agent 的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
用醉酒语言诱导改编对话模型并评测越狱与隐私泄露
作者把醉酒语言当作攻击向量,检验把 LLM 适配成醉酒发短信的模式后,越狱和情境隐私是否变差。动机是人类醉酒时的失范与泄密,以及 LLM 模拟人设的能力。