SLIP:无需外部攻击模型的多轮自我越狱
提出无外部攻击模型的多轮自我越狱方法 SLIP
完整解读
另有 16 篇论文还没打上分类标签,暂不在筛选结果里。
提出无外部攻击模型的多轮自我越狱方法 SLIP
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
完整解读提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出 PMPA,诱导智能体把外部恶意指令写入持久记忆并跨会话泄露隐私
提出推理通道预填与输出前缀组合攻击以越狱推理模型
完整解读提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据