防御arXiv 2610.01058
MOMAT:面向量化 LLM 低功耗越狱防御的多图集混合框架
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
- arXiv
- 2610.01058
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- Llama2-13B、Llama2-7B、Mistral-7B
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
提出 VA-Judger,用人类偏好训练联合音视频奖励模型
VA-Judger 是面向联合音视频生成的思维链全模态奖励模型,用来替代由分维度专家指标拼成的强化学习奖励。