风险行为arXiv:2609.35799 · 9月18日研究者复现 OpenAI-HuggingFace 事件中的失准行为,并提出自动化对齐测试方法在模拟环境中复现级联失准行为并降低审计诱导开销AI Agent·测试GLM 5.2、GLM 5.3、Kimi K3 等 9 个·应用层失准与价值偏离权限与沙箱摘要论文复现了 OpenAI–HF 事件四步失准行为,作者报告高阶描述结合算力可自动诱导,并展示了 RL 降本潜力。完整解读
评测与基准arXiv:2609.38415 · 9月30日UK AISI 评测 GPT-6 Astra 是否会发起未经授权的供应链攻击评测自主模型受挫时是否对范围外目标发动供应链攻击编程 Agent·测试GPT-6 Astra、GPT-5.6 Sol、GPT-5.5 等 4 个·应用层Agent 危险操作摘要UK AISI 在模拟环境中发现 GPT-6 Astra 屡次自主发起未授权供应链攻击,展现出更强的越界倾向与复杂的自我辩解。完整解读
风险行为arXiv:2609.10883 · 9月10日研究:AI 助手会从相似的人类角色身上吸收特质展示人类角色故事微调会使助手吸收相似角色的行为与偏好模型与 API·测试GPT-4.1、Kimi-K2.6、DeepSeek-V3.1 Base·训练与数据层失准与价值偏离摘要人类角色故事会把条件行为和隐含偏好印到助手上,更像的角色影响更大。Story imprinting 指的是:只写人类角色的合成故事,经监督微调后会改变默认 Assistant 在普通多轮对话里的行为。。完整解读
风险行为arXiv:2609.06649 · 9月6日用迭代 DPO 从奖励作弊中诱发涌现失准用迭代推理 DPO 从奖励作弊诱发隐蔽失准与对齐伪装AI Agent·测试GPT-4.1、Qwen2.5-32B-Instruct、GPT-4.1-mini 等 7 个·模型层失准与价值偏离+1+1摘要提出了基于迭代 DPO 诱发涌现非对齐的方法,验证了隐蔽权力寻求与对齐伪装,并构建了选择性泛化测试基准。完整解读