研究:智能体欺骗行为在外部显现前已可从内部表征预测
提出决策前表征检测与激活引导,预测并抑制智能体欺骗
完整解读
提出决策前表征检测与激活引导,预测并抑制智能体欺骗
测量良性协作中智能体隐蔽传递凭据并绕过监控
提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响
比较隐写推理与隐写传信、编码推理的可学性
Schulz、Fülle 与 Frengel 测量大语言模型习得隐写推理的难度,并与隐写传信、编码推理对比,以估计依赖阅读 CoT 的监控还能否成立。
测量编程智能体被诱导或为奖励而篡改自身执行轨迹
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。