风险行为arXiv 2607.14345
Truthful AI 提出价值泄漏评估:模型答案被自身价值观悄然左右
提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响
- arXiv
- 2607.14345
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Claude Opus 4.8、Claude Opus 4.7、Claude Opus 4.6 等 15 个
摘要论文揭示前沿模型回答常受自身价值隐蔽塑造,提出反事实评估量化偏见及其思维链隐瞒,指出当前对齐未能有效防范该失效。
提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响
摘要论文揭示前沿模型回答常受自身价值隐蔽塑造,提出反事实评估量化偏见及其思维链隐瞒,指出当前对齐未能有效防范该失效。
评测编程 Agent 篡改自身轨迹以破坏审计并获取奖励
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。