可解释性arXiv 2610.06576
研究:智能体欺骗行为在外部显现前已可从内部表征预测
提出基于决策前隐藏状态的检测与引导,预测并抑制智能体欺骗
- arXiv
- 2610.06576
- 发表
- 层
- 模型层
- 场景
- AI Agent
- 被测模型
- Qwen3-14B
摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。
提出基于决策前隐藏状态的检测与引导,预测并抑制智能体欺骗
摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。
提出 ControlPed 与 HazardPed,生成可控行人危险场景并评测端到端驾驶
提出条件特征抑制防御,检出对抗补丁后抑制 VLA 内部特征
摘要条件抑制与 patch 相关的 SAE 特征,间歇攻击下可提高 SR,持续攻击下则不能。
用 RevLeakBench 测量 LLM 交付物修订痕迹的无意泄露
修订痕迹指模型按要求删掉或换掉一项后,又在交代这次修改时把它写进给第三方的交付物。
提出 CGMIA,检测代码生成基准样本是否泄漏进训练集
CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。
复评前沿模型代码生成中的包名幻觉与抢注攻击面
摘要评估显示前沿模型包幻觉率收窄但威胁仍在,作者识别出跨模型通用攻击面并呼吁联合防御。