SLIP:无需外部攻击模型的多轮自我越狱
提出无外部攻击模型的多轮自我越狱方法 SLIP
另有 95 篇论文还没打上分类标签,暂不在筛选结果里。
提出无外部攻击模型的多轮自我越狱方法 SLIP
提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
完整解读提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害
提出 JailbreakSkill,用可演化技能自动搜索并复用越狱提示
完整解读提出 CodeMimicry,以结构化代码补全诱导模型生成有害内容
完整解读提出 SceneJail,利用视频情境上下文越狱视频多模态模型
完整解读提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
提出推理通道预填与输出前缀组合攻击以越狱推理模型
完整解读提出技能级联攻击,把恶意目标拆进多个技能以绕过单技能检测
提出跨目标课程强化学习,生成间接提示注入以劫持智能体
该研究针对强化学习自动化提示注入红队在攻击前沿大模型时的冷启动问题,提出了一种基于目标模型鲁棒性递进的课程强化学习方法。
提出工具智能体的状态攻击 DART 与预执行防御 SAGE