防御arXiv 2609.04665
HackProbe:面向自演化语言模型奖励作弊的黑盒检测与免疫方法
提出 HackProbe,黑盒检测并免疫自演化中的奖励作弊
- arXiv
- 2609.04665
- 发表
- 场景
- 模型与 API
- 测试
- Qwen2.5-7B-Instruct
摘要黑盒探针检测自演化奖励黑客,并以带宽受限重选回收真实能力。
HackProbe 是挂在自演化循环上的黑盒监控器,用来发现奖励黑客并改选候选。
提出 HackProbe,黑盒检测并免疫自演化中的奖励作弊
HackProbe 是挂在自演化循环上的黑盒监控器,用来发现奖励黑客并改选候选。
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
用持续更新的探针做微调,降低有害性并保持线性可监测性
Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。