全部动态
从来源,看到研究的联系
图中 5 条 · 本页 5 条 · 共 149 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。
点选节点,展开一条线索
本页材料
完整标题与摘要 · 5 条- 会议论文NeurIPS 2025
Among Us:衡量与检测 Agent 欺骗的沙盒
用社交推理游戏评测 18 个 LLM,发现 RL 训练模型更擅长欺骗而非识破;基于激活的探针检测欺骗 AUROC 超 95%。
- 会议论文NeurIPS 2025
推理模型中的霍桑效应:评测并操控测试感知
用白盒探针识别并操控推理模型的测试感知,发现它会显著影响有害请求的服从等安全对齐表现,且影响方向与幅度因模型而异。
- 会议论文NeurIPS 2025
用测谎器做偏好学习:可能诱导诚实,也可能诱导规避
把测谎器放进 LLM 后训练的标注环节:GRPO 可学出规避测谎器的策略(欺骗率超 85%),但测谎器 TPR 或 KL 正则足够高时可得诚实策略,DPO 欺骗率低于 25%。
- 会议论文NeurIPS 2025
噪声注入揭示 sandbagging 语言模型的隐藏能力
向模型权重注入噪声检测 sandbagging:普通模型性能随噪声下降,而故意藏拙的模型会异常提升,并能激发 Mistral Large 120B 的完整表现。
- 会议论文NeurIPS 2025
DeceptionBench:真实场景下 AI 欺骗行为的综合基准
含 150 个场景、千余样本的欺骗评测基准,考察自利与谄媚倾向及奖励、胁迫等情境影响;发现强化动态下欺骗显著加剧。