什么驱动方言越狱?对表层形式、文化框架与策略库的消融研究
消融比较方言越狱中表层形式、文化框架与策略库的作用
- arXiv
- 2609.31664
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- GPT-4o、DeepSeek-Reasoner、DeepSeek-Chat
消融比较方言越狱中表层形式、文化框架与策略库的作用
提出 SAST-IR,用有状态攻击者迭代说服无记忆模型接受反事实
提出 MIPC 与 CFA,观察模型自拟测验后接受开发者身份
这项工作把“模型自己出题、自己批改、再宣布身份已核验”定义成对话层认证失败,并与后端提权分开。
提出多轮越狱框架 BLUEPRINT,用世界观模拟与心理因素诱导有害输出
BLUEPRINT 是一个将因子化社会影响力策略空间与跨轮世界观模拟解耦的多轮大语言模型安全评测框架。
提出广度优先后缀搜索 BOSS,改进 GCG 越狱优化
BOSS 是插在 GCG 类离散 suffix 优化上的搜索框架:局部梯度更新不变,变的是固定预算花在深度还是广度。
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 SN-Guided Diffusion,利用安全神经元实现离线越狱
论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
提出工作流级越狱,诱导 IDE 编程 Agent 在多轮开发中编写有害代码
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。
提出 SlotGCG,按注意力选槽插入对抗 token 以越狱指令模型
提出 Persona Attack,分步写入对话记忆指令以越狱
提出 CodecAttack,在编解码器隐空间构造可穿透有损压缩的对抗音频
提出 GPO-V,用全局概率优化的视觉扰动越狱扩散视觉语言模型
GPO-V 把越狱从“开头必须顺从”改成“整段去噪概率朝肯定方向走”。。
提出 Misrouter,借 MoE 路由优化仅输入前缀并迁移攻击
提出 PEO,直接优化原提示词嵌入实现白盒越狱
PEO是一种不追加对抗 token 的 white-box 越狱:直接改已有提示词嵌入,并只对未成功样本更换续写目标再优化。
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示
提出音频叙事越狱,以嗓音投递风格绕过端到端语音模型拒答
用醉酒语言诱导改编对话模型并评测越狱与隐私泄露
作者把醉酒语言当作攻击向量,检验把 LLM 适配成醉酒发短信的模式后,越狱和情境隐私是否变差。动机是人类醉酒时的失范与泄密,以及 LLM 模拟人设的能力。
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
提出提取对齐 LLM 内嵌安全分类器并攻击其代理的越狱方法
作者提出一种白盒越狱做法:抽出对齐 LLM 内部 safety classifier 的近似,再攻击该近似并迁回原模型。