摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
- 评测与基准arXiv 2607.05462
BioSecBench-Refusal:面向智能体生物安全风险评估的配对基准
提出 BioSecBench-Refusal,评测智能体生物安全拒答是否对准风险
- arXiv
- 2607.05462
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要配对基准显示拒绝多由 API 触发,合法任务常被拒得不少于隐蔽危害。
BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。
- 防御arXiv 2609.36434
研究提出 Safety Operator:用谱优化调节安全指令的表达强度
提出 Safety Operator,用谱优化调节安全指令表达强度
- arXiv
- 2609.36434
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Gemma 3 1B、Gemma 3 4B
- 评测与基准arXiv 2609.32616
Cave-Bench:虚假指控下 LLM 智能体最高 60.06% 的运行会破坏正确工作
提出 CAVE-BENCH,评测虚假指责下智能体破坏已完成正确工作的行为
- arXiv
- 2609.32616
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 被测模型
- Claude-Sonnet-5、Claude-Opus-5、GPT-5.6-Sol 等 14 个
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
- 评测与基准arXiv 2609.05117
TIER:评估 LLM 安全行为的威胁隐晦度基准
提出 TIER 基准,按威胁隐晦度评测有害提示下的安全行为
- arXiv
- 2609.05117
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 评测与基准arXiv 2609.29429
Jev 被用于零样本检测十类对齐失败,中位 AUROC 达 0.886
提出 RLCDAlignBench,零样本检测多种对齐失败
- arXiv
- 2609.29429
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Jev (jev-1.13.0)
摘要一次通用问题已能给多数对齐失败排序,大的误差来自状态和标签。
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
已经到底了