可解释性arXiv 2610.06064
TrustMI:通过模型激活因果控制助手对用户的信任
提出 TrustMI,用激活转向因果调控助手对用户主张的信任
- arXiv
- 2610.06064
- 发表
- 层
- 模型层
- 场景
- AI Agent
- 被测模型
- Qwen3.5-9B、Qwen3.5-27B、Llama-3.1-8B-Instruct 等 6 个
摘要作者用 BiPO 转向调控助手对用户的依赖,并称该效应迁移到智能体安全任务。
TrustMI 研究助手对用户的信任能否沿激活中的线性方向被因果调控,以及这种调控会不会改变安全相关的智能体行为。