Purdue 提出 Pact:将欺骗作为行为遗忘
提出 PACT,遗忘压力触发的条件性欺骗并保留上下文理解
完整解读
提出 PACT,遗忘压力触发的条件性欺骗并保留上下文理解
测量委托收费激励下模型策略性虚报任务信心
提出知行差距面板,测量压力下模型是否违背自身判断
本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素。
提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响
比较隐写推理与隐写传信、编码推理的可学性
Schulz、Fülle 与 Frengel 测量大语言模型习得隐写推理的难度,并与隐写传信、编码推理对比,以估计依赖阅读 CoT 的监控还能否成立。
提出内部识别探测器 PIR,从激活区分模型隐瞒与真实遗忘