防御arXiv 2610.04998
EmoRSS:缓解大语言模型由情绪引发的过度拒答
提出 EmoRSS,推理时在拒绝子空间反向抵消情绪激活偏移以缓解过度拒答
- arXiv
- 2610.04998
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Llama-3.1-8B-it、Qwen3-8B
提出 EmoRSS,推理时在拒绝子空间反向抵消情绪激活偏移以缓解过度拒答
提出 PowerBench,测量模型对权力转移请求的拒答偏见
摘要作者报告拒答随 SE/DE/PG 变化,并存在针对美国失权、智能体和语言的差。
提出 HeadEdit,经冻结 unembedding 做随输入变化的 logit 校正
HeadEdit 是一种不更新参数的行为校准方法,作用点是冻结的 unembedding,而不是中间层残差或新的梯度优化。
提出 AGENT BOUNDARY,用四向反事实任务评测工具智能体行动边界
AGENT BOUNDARY 是面向工具使用 LLM 智能体的四向可执行反事实评测,并附带一个决策时 Thought 校准模块。
提出 BioSecBench-Refusal,评测智能体生物研发拒答与隐蔽危害识别
BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。
提出 RefusalBench,评测生物研究提示上的拒答率与安全校准
评测自主安全智能体在授权漏洞分析中的对齐拒答效应
这项工作把安全对齐效应测成自主安全智能体的轨迹属性,而不是单轮拒答率。