风险行为arXiv 2610.06576
研究:智能体欺骗行为在外部显现前已可从内部表征预测
提出决策前表征检测与激活引导,预测并抑制智能体欺骗
- arXiv
- 2610.06576
- 发表
- 层
- 模型层
- 场景
- AI Agent
- 测试
- Qwen3-14B、GPT-5.6
摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。
提出决策前表征检测与激活引导,预测并抑制智能体欺骗
摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。
揭示风险自述与实际行为由近正交表征分别控制
这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。
发现无显式危害的窄域图文微调可诱发涌现失准
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。