防御arXiv 2609.31911·9月26日用强化学习增强胸部 X 光报告生成中的视觉推理用门控 IoU 与 RadGraph 的 GRPO 降低胸片报告幻觉arXiv2609.31911发表9月26日层训练与数据层场景模型与 API测试Qwen3-VL-8B-Instruct、MedGemma、DeepMedix-R1 等 7 个防御模型加固风险幻觉与编造组件视觉+1+1深度解读完整解读
分析与理论arXiv 2609.34572·9月28日论文提出 Nudgeability:推理模型会跟随置信信号却不追踪自身能力提出 Nudgeability,测量推理模型跟随信心信号调整工具委派的对准程度arXiv2609.34572发表9月28日层应用层场景AI Agent测试Qwen3-4B、Qwen3-8B、Qwen3-14B 等 11 个组件推理链深度解读完整解读