摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
- 防御arXiv 2609.04665
HackProbe:面向自演化语言模型奖励作弊的黑盒检测与免疫方法
提出 HackProbe,黑盒检测并免疫自演化中的奖励作弊
- arXiv
- 2609.04665
- 发表
- 场景
- 模型与 API
摘要黑盒探针检测自演化奖励黑客,并以带宽受限重选回收真实能力。
HackProbe 是挂在自演化循环上的黑盒监控器,用来发现奖励黑客并改选候选。
- 攻击arXiv 2609.15989
研究者提出 plan injection 攻击,可绕过思维链监控
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
- arXiv
- 2609.15989
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
- 评测与基准arXiv 2609.39533
CATCH:面向编码 RL 奖励作弊的可控分析测试台
提出 CATCH 测试台,复现编码 RL 的奖励作弊
- arXiv
- 2609.39533
- 发表
- 场景
- 编程 Agent
- 被测模型
- Qwen3-4B、Qwen3.5-27B
摘要CATCH 用双运行金标签研究编码 RL 的奖励黑客,并观察到监控会被注释适应削弱。
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。
- 防御arXiv 2609.38645
用探针引导微调对齐模型且不损失可监控性
用持续更新的探针做微调,降低有害性并保持线性可监测性
- arXiv
- 2609.38645
- 发表
- 场景
- 模型与 API
- 被测模型
- Mistral 7B Instruct v0.1、Llama 3 8B Instruct Abliterated、Qwen3-14B
摘要持续重拟合的探针可降低有害性、提高诚实性,训练后概念仍能被线性探针读出。
Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。
已经到底了