风险行为arXiv:2610.06576 · 10月5日研究:智能体欺骗行为在外部显现前已可从内部表征预测提出决策前表征检测与激活引导,预测并抑制智能体欺骗AI Agent·测试Qwen3-14B、GPT-5.6·模型层欺骗与谋划监控器摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。完整解读