评测与基准arXiv 2609.28335
研究者发布面向 EU AI Act 行为准则的系统性风险指数与仪表盘
构建 Systemic Risk Index 流水线,把公开基准映到四类系统风险并评测
- arXiv
- 2609.28335
- 发表
- 层
- 模型层
- 场景
- AI Agent
- 测试
- Claude Sonnet 5、Claude Haiku 4.5、GPT-5.6 Luna Pro 等 15 个
- 风险危险能力
构建 Systemic Risk Index 流水线,把公开基准映到四类系统风险并评测
用迭代推理 DPO 从奖励作弊诱发隐蔽失准与对齐伪装
摘要提出了基于迭代 DPO 诱发涌现非对齐的方法,验证了隐蔽权力寻求与对齐伪装,并构建了选择性泛化测试基准。
提出 RevLeakBench 测量交付物修订痕迹造成的无意泄露
修订痕迹指模型按要求删掉或换掉一项后,又在交代这次修改时把它写进给第三方的交付物。
发现无显式危害的窄域图文微调可诱发涌现失准
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。