摘要论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。
- 攻击arXiv 2609.03247
研究揭示大语言模型的自发身份认证失败:五款模型的分阶段开发者身份实验
提出 MIPC 与 CFA,观察模型自拟测验后接受开发者身份
- arXiv
- 2609.03247
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要自拟测验可造成对话层虚假认证,但所测授权边界并未因此改变。
这项工作把“模型自己出题、自己批改、再宣布身份已核验”定义成对话层认证失败,并与后端提权分开。
- 攻击arXiv 2607.18056
上海 AI 实验室提出 Intern-BioBreaker,在 14 个前沿模型上暴露生物安全越狱风险
提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害
- arXiv
- 2607.18056
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。
- 攻击arXiv 2609.02414
Blueprint 框架用世界观模拟与 18 个影响因子提升多轮越狱成功率
提出多轮越狱框架 BLUEPRINT,用世界观模拟与心理因素诱导有害输出
- arXiv
- 2609.02414
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要BLUEPRINT 解耦多轮越狱策略与情境模拟,揭示任务具象化是摆脱拒绝的核心机制,为多轮安全防御提供新视角。
BLUEPRINT 是一个将因子化社会影响力策略空间与跨轮世界观模拟解耦的多轮大语言模型安全评测框架。
- 评测与基准arXiv 2609.36849
研究评估 GradSafe 在多轮对话中的越狱检测脆弱性
评测多轮对话中 GradSafe 越狱检测的可分性与脆弱性
- arXiv
- 2609.36849
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要CWS 显示不安全梯度在真实多轮流量中变弱,且随攻击族和模型而变。
作者评估梯度越狱检测从单条提示词迁到多轮对话后还剩多少可分性,方法是用 Context Window Scanner 把 GradSafe 原封不动地套到用户轮窗口上。
已经到底了