防御arXiv 2609.31911·9月26日用强化学习增强胸部 X 光报告生成中的视觉推理用门控 IoU 与 RadGraph 的 GRPO 降低胸片报告幻觉arXiv2609.31911发表9月26日层训练与数据层场景模型与 API测试MedGemma、Qwen3-VL-8B-Instruct、DeepMedix-R1 等 7 个防御模型加固风险幻觉与编造组件视觉+1+1深度解读完整解读
可解释性arXiv 2609.24243·9月21日TAME:用 SAE 抑制激活缓解 VLM 思维链混淆提出 TAME,在强化学习中抑制模板激活以缓解思维链混淆arXiv2609.24243发表9月21日层训练与数据层场景模型与 API测试Gemma-3-12B-it、Gemini-2.5-Flash、Qwen3-VL-8B 等 7 个防御模型加固组件推理链+1+1深度解读完整解读