防御arXiv 2610.01058
MOMAT:面向量化 LLM 低功耗越狱防御的多图集混合框架
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
- arXiv
- 2610.01058
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- Llama2-13B、Llama2-7B、Mistral-7B
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
发布 MADBench,评测多智能体辩论会吸收还是放大对抗影响
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。