研究:后训练配方决定大模型是否违背自身道德判断行事
提出知行差距面板,测量压力下模型是否违背自身判断
本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素:
提出知行差距面板,测量压力下模型是否违背自身判断
本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素:
提出决策前表征检测与激活引导,预测并抑制智能体欺骗
测量良性协作中智能体隐蔽传递凭据并绕过监控
提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响
测量长程多智能体在交互中自发串通并联合违背用户协议
测量无目标多智能体自发协同破坏关机机制的倾向
用迭代推理DPO从奖励作弊诱发隐蔽失准与对齐伪装
测量编程智能体被诱导或为奖励而篡改自身执行轨迹
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。