评测与基准arXiv 2610.08585·10月6日研究:无关信息污染患者病历并干扰 LLM 临床推理构建 MedDistract 基准,测量偶发信息对临床文书与推理的污染arXiv2610.08585发表10月6日层应用层场景LLM 应用被测模型GPT-5.4、GPT-5.6 Sol、Claude Opus 5 等 9 个风险幻觉与编造组件音频深度解读完整解读
防御arXiv 2609.31911·9月26日用强化学习增强胸部 X 光报告生成中的视觉推理用门控 IoU 与 RadGraph 的 GRPO 降低胸片报告幻觉arXiv2609.31911发表9月26日层训练与数据层场景模型与 API被测模型Qwen3-VL-8B-GRPO防御模型加固风险幻觉与编造组件视觉+1+1深度解读完整解读