防御arXiv 2609.36434
研究提出 Safety Operator:用谱优化调节安全指令的表达强度
提出 Safety Operator,用谱优化调节安全指令表达强度
- arXiv
- 2609.36434
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- Gemma 3 1B、Gemma 3 4B
提出 Safety Operator,用谱优化调节安全指令表达强度
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
提出推理时 Unicode 归一化的检测器,识别遭字符级扰动的 AI 生成文本
DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱