SLIP:无需外部攻击模型的多轮自我越狱
提出无外部攻击模型的多轮自我越狱方法 SLIP
完整解读
另有 95 篇论文还没打上分类标签,暂不在筛选结果里。
提出无外部攻击模型的多轮自我越狱方法 SLIP
微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
完整解读提出四种阶段转换攻击,绕过推理模型的安全推理护栏
完整解读提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害
提出 JailbreakSkill,用可演化技能自动搜索并复用越狱提示
完整解读提出 CodeMimicry,以结构化代码补全诱导模型生成有害内容
完整解读提出 CollageAttack,用空间文本碎片重组越狱文生图模型
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
完整解读提出推理通道预填与输出前缀组合攻击以越狱推理模型
完整解读