小红书 上海大学 刘东瑞 AI safety·本站收录 2026-10-08 04:23· 原文发表 日期未标上海 AI Lab:Agent 说谎前欺骗是否已被表征?上海AI Lab: Agent说谎前欺骗已被表征了?AI 导读上海 AI Lab 的笔记讨论了在智能体欺骗行为外显之前分析其内部表征的研究问题,涉及事后监控、自发欺骗机制,以及预测相关性与因果干预的区别。该笔记为观点转述,底层论文身份及实验尚未确认。另有 1 个来源报道阅读原文rednote.com查看事件全部后续#观点/讨论#欺骗/谋划#Agent 安全