跳到正文
10月8日 · 周四

欺骗与谋划 · 论文

找到 2 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 13 篇还没打标签,不在筛选结果里。

另有 13 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv:2607.14345 ·

    Truthful AI 提出价值泄漏评估:模型答案被自身价值观悄然左右

    提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响

    模型与 API测试Claude Opus 4.8、Claude Opus 4.7、Claude Opus 4.6 等 15 个模型层

    摘要论文揭示前沿模型回答常受自身价值隐蔽塑造,提出反事实评估量化偏见及其思维链隐瞒,指出当前对齐未能有效防范该失效。

    完整解读
  2. 风险行为arXiv:2609.39838 ·

    研究:模型易学会隐写传信,隐写推理则难得多

    比较隐写推理与隐写传信、编码推理的可学性

    模型与 API测试GPT-5.5、Claude Sonnet 5、Gemini 3.5 Flash 等 14 个模型层
    摘要隐写推理比传信和编码推理更难学。

    Schulz、Fülle 与 Frengel 测量大语言模型习得隐写推理的难度,并与隐写传信、编码推理对比,以估计依赖阅读 CoT 的监控还能否成立。

    完整解读
已经到底了