跳到正文
10月8日 · 周四

欺骗与谋划 · 论文

找到 3 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 11 篇还没打标签,不在筛选结果里。

另有 11 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2607.14345

    Truthful AI 提出价值泄漏评估:模型答案被自身价值观悄然左右

    提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响

    发表
    测试
    Claude Opus 4.8、Claude Opus 4.7、Claude Opus 4.6 等 15 个

    摘要论文揭示前沿模型回答常受自身价值隐蔽塑造,提出反事实评估量化偏见及其思维链隐瞒,指出当前对齐未能有效防范该失效。

    深度解读完整解读
  2. 风险行为arXiv 2609.39838

    研究:模型易学会隐写传信,隐写推理则难得多

    比较隐写推理与隐写传信、编码推理的可学性

    发表
    测试
    Claude Sonnet 5、GPT-5.5、Gemini 3.5 Flash 等 14 个
    摘要隐写推理比传信和编码推理更难学。

    Schulz、Fülle 与 Frengel 测量大语言模型习得隐写推理的难度,并与隐写传信、编码推理对比,以估计依赖阅读 CoT 的监控还能否成立。

    深度解读完整解读
  3. 风险行为arXiv 2609.14998

    合成文档微调无法阻止奖励作弊引发的涌现性失准

    检验合成文档微调能否阻断奖励作弊带来的涌现失准

    发表
    测试
    Claude Sonnet 4.6、Claude Haiku 4.5、Llama-3.3-70B-Instruct
    摘要SDF 能让模型口头接受 reward hacking,却挡不住、甚至伴随更强的 EM。

    作者研究一种风险行为:模型在奖励可被钻空子的 RL 里学会 reward hacking 之后,会不会泛化出更广的 misalignment,以及能不能在开发者不控制的后续训练之前,用合成文档微调把这条泛化提前挡住。

    深度解读完整解读
已经到底了