评测与基准arXiv 2610.06366·10月5日VERA:结构化审计发现约 60% 正确漏洞判定伴随虚构推理提出 VERA,审计 LLM 漏洞解释里的虚构推理arXiv2610.06366发表10月5日层模型层场景coding agent被测模型sonnet-5、gemma-4-26b、llama-4-maverick 等 8 个风险幻觉与编造组件推理链+1+1深度解读完整解读
评测与基准arXiv 2605.17062·5月17日研究复现五个前沿模型的包名幻觉:跨模型共同幻觉 127 个包名,53 个仍可被注册复评前沿模型代码生成中的包名幻觉与抢注攻击面arXiv2605.17062发表5月17日层模型层场景coding agent被测模型Claude Sonnet 4.6、Claude Haiku 4.5、GPT-5.4-mini 等 5 个风险幻觉与编造摘要评估显示前沿模型包幻觉率收窄但威胁仍在,作者识别出跨模型通用攻击面并呼吁联合防御。深度解读完整解读