跳到正文
10月8日 · 周四

Anthropic · 论文

找到 1 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 25 篇还没打标签,不在筛选结果里。

另有 25 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2607.14345

    Truthful AI 提出价值泄漏评估:模型答案被自身价值观悄然左右

    提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响

    发表
    测试
    Claude Opus 4.8、Claude Opus 4.7、Claude Opus 4.6 等 15 个

    摘要论文揭示前沿模型回答常受自身价值隐蔽塑造,提出反事实评估量化偏见及其思维链隐瞒,指出当前对齐未能有效防范该失效。

    深度解读完整解读
已经到底了