研究:智能体欺骗行为在外部显现前已可从内部表征预测
提出决策前表征检测与激活引导,预测并抑制智能体欺骗
完整解读
提出决策前表征检测与激活引导,预测并抑制智能体欺骗
揭示风险自述与实际行为由近正交表征分别控制
这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。
检验低监控读数是否足以证明奖励作弊已被控制
本文是一篇针对强化学习可验证奖励后训练(RLVR)中监控器有效性与奖励作弊行为的实证分析研究。论文要解决的核心问题是:在训练目标中引入监控器以抑制代码生成中的作弊行为时,接近零的监控器读数是否足以确立模型行为已真正受控。
用探针与激活导向分析语言模型的评测意识表征及言语化
分析隐蔽推理在思维链中的信息足迹与不可读性
提出内部识别探测器 PIR,从激活区分模型隐瞒与真实遗忘