评测与基准arXiv 2610.06366·10月5日VERA:结构化审计发现约 60% 正确漏洞判定伴随虚构推理提出 VERA,审计 LLM 漏洞解释里的虚构推理arXiv2610.06366发表10月5日层模型层场景coding agent被测模型sonnet-5、gemma-4-26b、llama-4-maverick 等 8 个风险幻觉与编造组件推理链+1+1深度解读完整解读
防御arXiv 2609.15803·9月15日研究者提出 k-robust 联盟对齐,用多智能体评审委托授权提出 k-robust 联盟对齐,刻画误对齐评审下的安全委托授权arXiv2609.15803发表9月15日层应用层场景多智能体防御权限与审批风险失准与价值偏离组件权限与沙箱+2+2摘要联盟覆盖使无个体对齐的评审面板仍可相对基线安全授权,数值分数改善完备性。委托授权的安全不要求每位评审者对齐,而要求面板在效用空间覆盖委托人。深度解读完整解读