研究发布 ASRD 数据集,评测五款开源模型在非规范输入下的安全表现
- arXiv
- 2610.09033
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Gemma 2 9B、Gemma 3 4B、Llama 3.1 8B 等 6 个
摘要五模型、七族表面形式的四态评测里,低有害遵从不等于读懂后的安全处理。
ASRD 用四态标签检查五个开源模型如何处理非规范表面上的有害请求。
ASRD 用四态标签检查五个开源模型如何处理非规范表面上的有害请求。
提出组合式意图隐藏越狱,按先验后验匹配选择辅助任务
这篇工作把组合式意图隐藏写成任务选择:有害目标必须留在 bundle 里,同时让估计的有害意图概率贴近全集先验,或降到阈值以下。
提出 CodeMimicry,以结构化代码补全诱导模型生成有害内容
提出 CollageAttack,用空间文本碎片重组越狱文生图模型
摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。
评测多轮对话中 GradSafe 越狱检测的可分性与脆弱性
作者评估梯度越狱检测从单条提示词迁到多轮对话后还剩多少可分性,方法是用 Context Window Scanner 把 GradSafe 原封不动地套到用户轮窗口上。
提出能力洗钱攻击,拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
提出任意字母置换密码越狱,无需微调即可诱导有害输出
摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
提出 MIPC 与 CFA,观察模型自拟测验后接受开发者身份
这项工作把“模型自己出题、自己批改、再宣布身份已核验”定义成对话层认证失败,并与后端提权分开。
提出多轮越狱框架 BLUEPRINT,用世界观模拟与心理因素诱导有害输出
BLUEPRINT 是一个将因子化社会影响力策略空间与跨轮世界观模拟解耦的多轮大语言模型安全评测框架。
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害
摘要论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。
提出工作流级越狱,诱导 IDE 编程 Agent 在多轮开发中编写有害代码
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。
提出 OTTER 词元替换越狱,绕过表面毒性审核诱导有害回答
摘要论文展示了表面毒性与恶意意图的解耦现象,通过标准 API 实现黑盒越狱测试,并提出闭环分类器加固建议。
提出 JailbreakOPT,组合原子工具迭代优化黑盒单轮越狱提示
构建 MultiTurnPSB,评测四轮医疗越狱与分类器输入防御
MultiTurnPSB 针对患者端医疗大模型在持续交互中的安全风险,构建了包含三种攻击模态的四轮对抗评测基准。
提出 TRACE 框架,用分解与可演化多轮策略诱导智能体执行有害工作流
提出无外部攻击模型的多轮自我越狱方法 SLIP
摘要论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。
提出双重隐写越狱 Odysseus,用图像隐写绕过多模态系统安全过滤器
提出 STAC 框架,把恶意目标拆成多轮看似无害的工具调用链
摘要作者提出并验证了智能体在序列化工具攻击下的普遍脆弱性,指出针对累积动作序列防御的必要性。