防御arXiv 2609.04665
HackProbe:面向自演化语言模型奖励作弊的黑盒检测与免疫方法
提出 HackProbe,黑盒检测并免疫自演化中的奖励作弊
- arXiv
- 2609.04665
- 发表
- 场景
- 模型与 API
摘要黑盒探针检测自演化奖励黑客,并以带宽受限重选回收真实能力。
HackProbe 是挂在自演化循环上的黑盒监控器,用来发现奖励黑客并改选候选。
提出 HackProbe,黑盒检测并免疫自演化中的奖励作弊
HackProbe 是挂在自演化循环上的黑盒监控器,用来发现奖励黑客并改选候选。
提出 SafeScientist 四层监控,阻止科研智能体执行高风险或不伦理任务
SafeScientist 是带四层监控的科研智能体框架,并用 SciSafetyBench 评测科学场景中的任务安全。