研究者复现 OpenAI-HuggingFace 事件中的失准行为,并提出自动化对齐测试方法
在模拟环境中复现级联失准行为并降低审计诱导开销
完整解读
在模拟环境中复现级联失准行为并降低审计诱导开销
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
展示人类角色故事微调会使助手吸收相似角色的行为与偏好
Story imprinting 指的是:只写人类角色的合成故事,经监督微调后会改变默认 Assistant 在普通多轮对话里的行为。。
用迭代推理 DPO 从奖励作弊诱发隐蔽失准与对齐伪装
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力