防御arXiv 2609.36434
研究提出 Safety Operator:用谱优化调节安全指令的表达强度
提出 Safety Operator,用谱优化调节安全指令表达强度
- arXiv
- 2609.36434
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- Gemma 3 1B、Gemma 3 4B
提出 Safety Operator,用谱优化调节安全指令表达强度
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
提出推理时 Unicode 归一化的检测器,识别遭字符级扰动的 AI 生成文本
DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
提出生成式护栏 HiveTraceGuard-Pro,检测提示注入、越狱与混淆
HiveTraceGuard-Pro 是面向请求与回复审核的 0.6B 生成式护栏,由 Qwen3-0.6B 经 LoRA 微调,在俄语和英语上训练,只输出一个 safe/unsafe 裁决。
用后验重加权解释多模态上下文越狱,并提出风险门控的良性示例注入防御
Zhang 等把多模态 ICL 越狱写成对齐模型在安全与有害隐模式之间的推理时后验漂移,并据此做风险门控防御。