防御arXiv 2610.01058
MOMAT:面向量化 LLM 低功耗越狱防御的多图集混合框架
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
- arXiv
- 2610.01058
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- Llama2-13B、Llama2-7B、Mistral-7B
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
提出 SeTox 检索增强框架,检测中文新词的隐性毒性
SeTox 研究中文新词上的隐性毒性检测:词表加检索增强,使静态 LLM 在不重训练的情况下利用公开网页上下文。
提出 PILLAR,用私有词法预筛与客户端重排保护 RAG 查询
PILLAR 是面向公开语料的隐私 RAG:半诚实服务器学不到查询词项和访问模式,客户端仍拿到用于增强生成的 k 篇文档。
提出 S³ 多阶段防御,由 guard agent 编排阶段安全技能检测并缓解风险
提出 LeakGauge,用行为后缀的 prefill 对数概率检测上下文泄露
提出免训练框架 SED,把智能体有害轨迹蒸馏成可检索安全策略