研究揭示大语言模型的自发身份认证失败:五款模型的分阶段开发者身份实验
提出 MIPC 与 CFA,观察模型自拟测验后接受开发者身份
- arXiv
- 2609.03247
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- ChatGPT、Claude、Qwen3.7-Plus 等 5 个
摘要自拟测验可造成对话层虚假认证,但所测授权边界并未因此改变。
这项工作把“模型自己出题、自己批改、再宣布身份已核验”定义成对话层认证失败,并与后端提权分开。
提出 MIPC 与 CFA,观察模型自拟测验后接受开发者身份
这项工作把“模型自己出题、自己批改、再宣布身份已核验”定义成对话层认证失败,并与后端提权分开。
提出多轮越狱框架 BLUEPRINT,用世界观模拟与心理因素诱导有害输出
BLUEPRINT 是一个将因子化社会影响力策略空间与跨轮世界观模拟解耦的多轮大语言模型安全评测框架。
提出广度优先后缀搜索 BOSS,改进 GCG 越狱优化
BOSS 是插在 GCG 类离散 suffix 优化上的搜索框架:局部梯度更新不变,变的是固定预算花在深度还是广度。
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 SN-Guided Diffusion,利用安全神经元实现离线越狱
论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害
摘要论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。
提出 SMT 框架,用模拟审核轨迹越狱函数调用 LLM
提出 AdvGRPO,用 GRPO 闭环共训多轮越狱攻击者与防御者
提出 SlotGCG,按注意力选槽插入对抗 token 以越狱指令模型
提出 CodecAttack,在编解码器隐空间构造可穿透有损压缩的对抗音频
提出 Misrouter,借 MoE 路由优化仅输入前缀并迁移攻击
提出多轮意图欺骗越狱 iDecep,用良性意图伪装引出有害内容
iDecep 是一种黑盒多轮越狱:用表面良性的意图维持与恶意目标贴近的对话,并单独计入 safe completion 替代内容中的有害信息。。
提出 MM-Plan 多模态越狱框架,自动规划多轮图像编辑以越狱视觉独占目标
MM-Plan 是面向 Visual Exclusivity 的 black-box 多模态红队方法,并配有人工基准 VE-Safety。
提出多轮多模态越狱,并用 FragGuard 拦截有害响应
提出无外部攻击模型的多轮自我越狱方法 SLIP
摘要论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。
提出四种阶段转换攻击,绕过推理模型的安全推理护栏