评测与基准arXiv 2609.29429
Jev 被用于零样本检测十类对齐失败,中位 AUROC 达 0.886
提出 RLCDAlignBench,零样本检测多种对齐失败
- arXiv
- 2609.29429
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Jev (jev-1.13.0)
摘要一次通用问题已能给多数对齐失败排序,大的误差来自状态和标签。
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
提出 SN-Guided Diffusion,利用安全神经元实现离线越狱
论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。
提出 SMT 框架,用模拟审核轨迹越狱函数调用 LLM
提出 Ghostwriter 攻击,用伪权威证据条件注入操纵模型观点
Ghostwriter 是一种针对上下文窗口的观点引导攻击:把误导陈述改写成伪权威文本,再在相关查询中让目标模型把该观点写进回答。