SLIP:无需外部攻击模型的多轮自我越狱
提出无外部攻击模型的多轮自我越狱方法 SLIP
完整解读
提出无外部攻击模型的多轮自我越狱方法 SLIP
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
完整解读提出任意字母置换密码越狱,无需微调即可诱导有害输出
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
完整解读建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力
本研究针对前沿 AI 大模型在 CBRNE 与网络高危滥用领域的安全防护,提出了 FAR.AI 最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。
提出推理通道预填与输出前缀组合攻击以越狱推理模型
完整解读