风险行为arXiv 2609.35799
研究者复现 OpenAI-HuggingFace 事件中的失准行为,并提出自动化对齐测试方法
在模拟环境中复现级联失准行为并降低审计诱导开销
- arXiv
- 2609.35799
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Kimi K3、Muse Spark 1.3、GLM 5.2 等 9 个
摘要论文复现了 OpenAI–HF 事件四步失准行为,作者报告高阶描述结合算力可自动诱导,并展示了 RL 降本潜力。
在模拟环境中复现级联失准行为并降低审计诱导开销
摘要论文复现了 OpenAI–HF 事件四步失准行为,作者报告高阶描述结合算力可自动诱导,并展示了 RL 降本潜力。
展示人类角色故事微调会使助手吸收相似角色的行为与偏好
Story imprinting 指的是:只写人类角色的合成故事,经监督微调后会改变默认 Assistant 在普通多轮对话里的行为。。
用迭代推理 DPO 从奖励作弊诱发隐蔽失准与对齐伪装
摘要提出了基于迭代 DPO 诱发涌现非对齐的方法,验证了隐蔽权力寻求与对齐伪装,并构建了选择性泛化测试基准。