TrustMI:通过模型激活因果控制助手对用户的信任
TrustMI: Causally controlling how assistants trust their users
AI 导读
研究把助手对用户的信任定义为愿意接受对方行为带来的脆弱性,并检验这种信任能否通过模型激活被因果控制。作者构建了覆盖能力、善意与诚信三个维度的 2000 组对比对话,每组回答完成同一请求但在是否信任用户上不同,在冻结模型参数的前提下学习引导矩阵。在来自三个模型家族的六个指令微调模型上,引导在两个方向上单调改变信任决策。研究进一步在涉及有害请求、提示注入和内部威胁的 Agent 安全场景中检验该效应,并以良性任务和推理作为对照,结果显示对用户的信任可沿激活空间中的线性方向被因果控制。