论文发现安全监控器主要拦截模型本就会拒答的请求
构建明确度梯级并做守卫微调,以拦住模型会回答的有害请求
- arXiv
- 2609.05797
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemma-4-31B-IT、Qwen3-32B、Llama Guard 3 8B 等 6 个
摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
构建明确度梯级并做守卫微调,以拦住模型会回答的有害请求
摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
提出内生护栏 SingProbe,复用解码隐状态监测查询意图、回复安全与幻觉
SingProbe 是面向生成时监测的开源内生护栏:复用基座解码隐状态,而不是另起模型反复编码文本。
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
提出推理时 Unicode 归一化的检测器,识别遭字符级扰动的 AI 生成文本
DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
提出 ProRubric,把加性评分聚合改为合取协议以抑制奖励作弊
Protocol-level Rubrics(ProRubric) 研究的是:没有可验证器时,把 rubric 判分合成奖励的方式会不会让优化变成分数更高、回答更差。
提出 EvoRS,使开放式强化学习的奖励系统随策略在线演化
EvoRS 研究开放式 RL 中奖励系统如何在训练期间保持可靠。写作和角色扮演没有可直接验证的答案,策略一旦适应当前 rubric,奖励会出现黑客、漏掉新行为,以及同查询内更难区分。作者认为只动态改评价标准不够,打分机制和信号组合也会失效。
提出 RMB,以多样奖励模型 boosting 缓解 RLHF 奖励作弊
RMB 是一种奖励建模方法:用多样的代理奖励模型加 boosting 聚合,为 RLHF 提供更稳的奖励信号。。