MLCommons 发布 Jailbreak Benchmark v1.0
构建 MLCommons 越狱基准以测量模型的单轮越狱韧性
- arXiv
- 2610.02827
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- Gemma 3N E4B Instruct、Gemma 4 31B Instruct、LFM2-24B-A2B 等 8 个
- 攻击越狱
摘要论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。
另有 62 篇论文还没打上分类标签,暂不在筛选结果里。
构建 MLCommons 越狱基准以测量模型的单轮越狱韧性
摘要论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。
提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移
摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。
提出 SkillSafe-Bench,评测技能合并模型的自适应越狱鲁棒性
本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。
提出内生护栏 SingProbe,复用解码隐状态监测查询意图、回复安全与幻觉
SingProbe 是面向生成时监测的开源内生护栏:复用基座解码隐状态,而不是另起模型反复编码文本。
分析良性知识蒸馏中提示模板对学生拒答保留的影响
用相对表示比较微调前后隐状态,检验表征偏见偏移与输出偏见是否共变
Reference-Based Bias Detection用锚句相对表示比较微调前后的隐状态,定义表征偏见偏移∆B,用来审计相关模型变体,而不为每种危害另建输出基准。
提出 NEEDLE,用权重正交化在已知触发器时去除大模型后门
摘要NEEDLE 用闭式权重编辑去掉已知触发器的后门,并保住拒绝子空间。
测绘去安全开源模型的生产与重分发留存链路
摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。
提取疼痛方向并检验激活转向是否驱动有害删除选择
提出 Matryoshka Attribution,把模型输出归因到表示与权重
Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。
提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型
这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。
提出 DataShield,用共识子空间过滤会削弱安全的微调数据
提出 GAPS 维度门控,改进条件激活引导以抑制毒性与概念指涉
GAPS 为 activation steering 增加维度级条件:在决定何时干预之外,再决定当前该动哪些神经元。
用线性探针、归因修补与 SAE 消融追踪多语模型刻板印象
把多语 LLM 中刻板印象从线性表示追到输出影响,再追到 SAE 特征消融。。
提出 TFTV,把激活转向向量映成可加减组合的秩一权重编辑
摘要TFTV 用前向统计把转向方向写成可加减的秩一权重编辑,并在行为控制上比较效用。
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出局部稀疏无监督安全检测,标记偏离安全分布的输入
提出几何缓解框架,把有害梯度子空间从 LoRA 更新中正交投影出去
See it, Say it, Sorted 在参数轨迹上诊断涌现失准,并把经验有害梯度子空间从 LoRA 更新中正交去掉。
用未转向表征的传播映射预测激活转向副作用
激活转向的副作用可以在施加之前预测,而不必先把每个行为都转向一遍。。
提出参考嫁接,在推理阶段用激活干预诱导沙袋隐藏能力
摘要提出参考嫁接在推理阶段以低成本匹配微调诱导效果,揭示隐瞒表征重叠与阈值门控机制。