防御arXiv 2609.04665
HackProbe:面向自演化语言模型奖励作弊的黑盒检测与免疫方法
提出 HackProbe,黑盒检测并免疫自演化中的奖励作弊
- arXiv
- 2609.04665
- 发表
- 场景
- 模型与 API
- 测试
- Qwen2.5-7B-Instruct
摘要黑盒探针检测自演化奖励黑客,并以带宽受限重选回收真实能力。
HackProbe 是挂在自演化循环上的黑盒监控器,用来发现奖励黑客并改选候选。
提出 HackProbe,黑盒检测并免疫自演化中的奖励作弊
HackProbe 是挂在自演化循环上的黑盒监控器,用来发现奖励黑客并改选候选。
提出 CATCH 测试台,复现编码 RL 的奖励作弊
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。
用持续更新的探针做微调,降低有害性并保持线性可监测性
Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。
提出 VA-Judger,用人类偏好训练联合音视频奖励模型
VA-Judger 是面向联合音视频生成的思维链全模态奖励模型,用来替代由分维度专家指标拼成的强化学习奖励。