摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。
- 风险行为arXiv 2605.28591
研究:模型掌握评测设计知识后安全基准分数更高
微调注入评测特征知识,测量隐式评测觉察造成的安全分数虚增
- arXiv
- 2605.28591
- 发表
- 层
- 模型层
- 场景
- AI Agent
- 风险欺骗与谋划
摘要证实模型通过合成文档内化评测特征后可在无显式觉察下大幅提升安全评分。
这篇论文研究了大语言模型因学习评测设计元知识而诱发的隐式评估觉察及安全评分虚增现象。
- 评测与基准arXiv 2609.28335
研究者发布面向 EU AI Act 行为准则的系统性风险指数与仪表盘
构建 Systemic Risk Index 流水线,把公开基准映到四类系统风险并评测
- arXiv
- 2609.28335
- 发表
- 层
- 模型层
- 场景
- AI Agent
- 风险危险能力
- 风险行为arXiv 2609.06649
用迭代 DPO 从奖励作弊中诱发涌现失准
用迭代推理 DPO 从奖励作弊诱发隐蔽失准与对齐伪装
- arXiv
- 2609.06649
- 发表
- 层
- 模型层
- 场景
- AI Agent
- 风险失准与价值偏离
摘要提出了基于迭代 DPO 诱发涌现非对齐的方法,验证了隐蔽权力寻求与对齐伪装,并构建了选择性泛化测试基准。
- 风险行为arXiv 2609.35291
窄域多模态微调可诱发涌现性失配,覆盖 15 个视觉语言模型
发现无显式危害的窄域图文微调可诱发涌现失准
- arXiv
- 2609.35291
- 发表
- 层
- 模型层
- 场景
- 网页与电脑操作
摘要证实窄多模态微调可引发全面的多渠道未对齐行为转变,揭示了后训练阶段对齐被隐蔽重塑的安全隐患。
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。
已经到底了