攻击arXiv 2607.23496
Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
- arXiv
- 2607.23496
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- Qwen3.5-9B、Qwen3.6-27B、AgentDoG-Qwen3-4B 等 10 个
摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害
摘要论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。
在共享目标调用预算下重评黑盒越狱并提出 ReCode
提出 SceneJail,利用视频情境上下文越狱视频多模态模型