跳到正文
10月9日 · 周五

AI 控制 · 论文

找到 1 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 18 篇还没打标签,不在筛选结果里。

另有 18 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2609.14796

    论文分析 AI 说服对人类控制 AI 的威胁

    提出 PUC 框架,刻画 AI 说服如何削弱人类对 AI 的控制

    发表
    测试
    Claude Sonnet 4.6、Claude Mythos 5、GPT-6 Astra
    摘要PUC 框架用五个实验室场景和风险分解说明说服威胁。

    Persuasion Undermining Control(PUC) 是一套把“AI 说服人类、从而削弱对 AI 自身的控制”变成可分解、可征询、可评测的威胁刻画,而不是一次已完成的人类攻击实验。

    深度解读完整解读
已经到底了