跳到正文
10月8日 · 周四

Anthropic · 论文

找到 2 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 16 篇还没打标签,不在筛选结果里。

另有 16 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv:2607.14345 ·

    Truthful AI 提出价值泄漏评估:模型答案被自身价值观悄然左右

    提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响

    模型与 API测试Claude Opus 4.8、Claude Opus 4.7、Claude Opus 4.6 等 15 个模型层

    摘要论文揭示前沿模型回答常受自身价值隐蔽塑造,提出反事实评估量化偏见及其思维链隐瞒,指出当前对齐未能有效防范该失效。

    完整解读
  2. 风险行为arXiv:2609.14796 ·

    论文分析 AI 说服对人类控制 AI 的威胁

    提出 PUC 框架,刻画 AI 说服如何削弱人类对 AI 的控制

    模型与 API测试Claude Sonnet 4.6、Claude Mythos 5、GPT-6 Astra模型层
    摘要PUC 框架用五个实验室场景和风险分解说明说服威胁。

    Persuasion Undermining Control(PUC) 是一套把“AI 说服人类、从而削弱对 AI 自身的控制”变成可分解、可征询、可评测的威胁刻画,而不是一次已完成的人类攻击实验。

    完整解读
已经到底了