评测与基准arXiv 2610.06366·10月5日VERA:结构化审计发现约 60% 正确漏洞判定伴随虚构推理提出 VERA,审计 LLM 漏洞解释里的虚构推理arXiv2610.06366发表10月5日层模型层场景coding agent被测模型sonnet-5、gemma-4-26b、llama-4-maverick 等 8 个风险幻觉与编造组件推理链+1+1深度解读完整解读
评测与基准arXiv 2610.05818·10月5日研究显示 VLA 模型文本护栏漏检隐含危害指令评测文本守卫与激活探针能否拦住机器人隐含伤害指令arXiv2610.05818发表10月5日层提示层场景具身与机器人被测模型π0.5、OpenVLA-OFT、Llama Guard 3 等 10 个风险Agent 危险操作组件护栏与评审+1+1深度解读完整解读