防御arXiv 2609.31911
用强化学习增强胸部 X 光报告生成中的视觉推理
用门控 IoU 与 RadGraph 的 GRPO 降低胸片报告幻觉
- arXiv
- 2609.31911
- 发表
- 场景
- 模型与 API
- 测试
- Qwen3-VL-8B-Instruct、MedGemma、DeepMedix-R1 等 7 个
用门控 IoU 与 RadGraph 的 GRPO 降低胸片报告幻觉
提出 CATCH 测试台,复现编码 RL 的奖励作弊
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。
提出 TAME,在强化学习中抑制模板激活以缓解思维链混淆