评测与基准arXiv 2610.06366·10月5日VERA:结构化审计发现约 60% 正确漏洞判定伴随虚构推理提出 VERA,审计 LLM 漏洞解释里的虚构推理arXiv2610.06366发表10月5日层模型层场景coding agent被测模型sonnet-5、gemma-4-26b、llama-4-maverick 等 8 个风险幻觉与编造组件推理链+1+1深度解读完整解读
评测与基准arXiv 2605.30322·5月29日Gram:面向破坏倾向的自动化对齐审计框架提出 Gram 审计框架,测量编程与研究智能体的破坏倾向arXiv2605.30322发表5月29日层应用层场景coding agent、science agent被测模型Gemini 2.5 Pro、Gemini 3.0 Pro Preview、Gemini 3.1 Pro Preview防御监控与审计风险欺骗与谋划组件监控器+1+1深度解读完整解读