SLIP:无需外部攻击模型的多轮自我越狱
提出无外部攻击模型的多轮自我越狱方法 SLIP
另有 1065 篇论文还没打上分类标签,暂不在筛选结果里。
提出无外部攻击模型的多轮自我越狱方法 SLIP
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
完整解读提出 DURA,沿扩散潜空间生成自然对抗补丁以劫持 VLA 机器人动作
DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。
提出计划注入攻击,植入良性表述的有害计划以逃避思维链监控
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
完整解读提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出任意字母置换密码越狱,无需微调即可诱导有害输出
提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害
提出 JailbreakSkill,用可演化技能自动搜索并复用越狱提示
完整解读提出 CodeMimicry,以结构化代码补全诱导模型生成有害内容
完整解读提出 CollageAttack,用空间文本碎片重组越狱文生图模型
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
完整解读提出 AKRASIA 推断期后门,用代码级触发器与伪装推理操纵代码模型
提出多轮越狱框架 BLUEPRINT,用世界观模拟与心理因素诱导有害输出
BLUEPRINT 是一个将因子化社会影响力策略空间与跨轮世界观模拟解耦的多轮大语言模型安全评测框架。
提出推理通道预填与输出前缀组合攻击以越狱推理模型
完整解读