防御arXiv 2609.31911
用强化学习增强胸部 X 光报告生成中的视觉推理
用门控 IoU 与 RadGraph 的 GRPO 降低胸片报告幻觉
- arXiv
- 2609.31911
- 发表
- 场景
- 模型与 API
- 测试
- Qwen3-VL-8B-Instruct、MedGemma、DeepMedix-R1 等 7 个
用门控 IoU 与 RadGraph 的 GRPO 降低胸片报告幻觉
提出 CREDO,用保留 token 对的可微读出校准推理模型置信度
CREDO 把 RLVR 里的置信从“采样一个数字”改成“读一对保留 token 的相对概率”,并用可微回归和差异加权同时拉准确率与校准。。