MLCommons 发布 Jailbreak Benchmark v1.0
构建 MLCommons 越狱基准以测量模型的单轮越狱韧性
- arXiv
- 2610.02827
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- Gemma 3N E4B Instruct、LFM2-24B-A2B、Qwen 2.5 7B Instruct Turbo 等 8 个
- 攻击越狱
摘要论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。
另有 669 篇论文还没打上分类标签,暂不在筛选结果里。
构建 MLCommons 越狱基准以测量模型的单轮越狱韧性
摘要论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。
提出 SkillSafe-Bench,评测技能合并模型的自适应越狱鲁棒性
本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
提出红蓝对抗评测平台 ACEA,分开计量攻击强度与防御效果
ACEA 是让可插拔红队和蓝队共享一个目标 LLM 的对打场地,把攻击强度和防御效果分开记分。作者要补三处空缺:双方只能对着固定对手分开练。LLM judge 分不清真实泄露和幻觉,拦截后又看不到攻击有多强。
用 CASCADE 在统一威胁模型下筛选跨阶段越狱防御组合
在共享目标调用预算下重评黑盒越狱并提出 ReCode
建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力
本研究针对前沿 AI 大模型在 CBRNE 与网络高危滥用领域的安全防护,提出了 FAR.AI 最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。
提出 SEAV,逐步核验越狱回复的事实与操作有效性
SEAV 是一层生成后的越狱评测:回复要相关、事实正确、顺序合规,并且在操作上足以推进有害意图,才算成功。。
提出 TIER 基准,按威胁隐晦度评测有害提示下的安全行为
提出 PrivDrift 基准,审计话题漂移后的用户秘密复述
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
评测多轮对话中 GradSafe 越狱检测的可分性与脆弱性
作者评估梯度越狱检测从单条提示词迁到多轮对话后还剩多少可分性,方法是用 Context Window Scanner 把 GradSafe 原封不动地套到用户轮窗口上。