防御arXiv 2610.01058
MOMAT:面向量化 LLM 低功耗越狱防御的多图集混合框架
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
- arXiv
- 2610.01058
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- Llama2-13B、Llama2-7B、Mistral-7B
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
提出 SeTox 检索增强框架,检测中文新词的隐性毒性
SeTox 研究中文新词上的隐性毒性检测:词表加检索增强,使静态 LLM 在不重训练的情况下利用公开网页上下文。
提出 AV-SafetyBench 评测文生音视频模型的不安全生成
AV-SafetyBench 是面向文本生成音视频(T2AV)的安全基准:一条提示词同时规定画面和音频,评测同时看两轨以及它们的交互。作者要测的是,不安全含义不只出现在画面上:它可以主要由语音或声音承载,也可以只有两轨合起来才成立。T2VSafetyBench 不评音频,TTA-Bench 不评与画面的交互,作者认为二者都盖不住这些路径。
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱