跳到正文
10月9日 · 周五

AI 控制 · 论文

找到 16 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 16 篇还没打标签,不在筛选结果里。

另有 16 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.04575

    论文提出 Operational Validity Contract,审计激活监控从探针分数到告警策略的有效性

    提出操作有效性契约,审计激活监控的告警策略

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.2-3B、Qwen2.5-7B 等 4 个
    摘要论文建立从探针得分到警报策略的审计框架,实证表明高 AUROC 不等于部署有效性,仅支持受限预测价值。

    这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。

    深度解读完整解读
  2. 其他arXiv 2610.01995

    AI 监督能否做到零知识?论文证明一般情形下不可行

    证明随机谕示下谕示辅助计算无法零知识验证,签名谕示下则可

    发表
    摘要随机谕示排除一般零知识监督。

    一般谕示辅助计算在随机谕示中做不到 witness hiding,因而也做不到零知识监督。给谕示答案加上数字签名后,抗碰撞哈希足以同时得到隐私和简洁验证。

    深度解读完整解读
  3. 其他arXiv 2609.15802

    论文建模递归自我改进的经济学:反馈回路尚不足以形成自持加速

    用弹性有向图建模递归自我改进的自持加速条件

    发表
    测试
    Claude Opus 4.8、Claude Opus 4.7、Claude 3.7 Sonnet 等 6 个
    摘要弹性网络给出自持加速条件。

    递归自我改进会不会变成自持加速,取决于能力提高后下一代能力提高多少,也取决于外生投入不增长时增速会不会随存量上升。作者用有向图把算法效率、能力、研发投入和经济产出连起来,边的强度是弹性。

    深度解读完整解读
  4. 防御arXiv 2607.13716

    CAVA:面向智能体 AI 运行时治理的规范动作验证与证明

    提出 CAVA,将异构智能体动作规范为可哈希指纹并绑定审批回执

    发表
    场景
    AI Agent
    摘要CAVA 用规范动作指纹承接异构运行时治理。

    CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。

    深度解读完整解读
  5. 其他arXiv 2609.36054

    多作者论文评估 AI 研发自动化触发智能爆炸的可能与政策应对

    评估自动化 AI 研发触发智能爆炸的可能并主张先可见再约束与适应

    发表
    摘要软件驱动智能爆炸可能把数年进展压进数月,作者要求三项政策先做好。

    Chan 等论证:自动化 AI 研发可能经软件反馈环形成智能爆炸,把本需数年的进展压进数月或更短。他们关心的不是换硬件的建设周期,而是 AI 扩大有效研发劳动力、再产出更强系统,以及社会能否在能力跃迁前看见、约束并适应这一过程。

    深度解读完整解读
  6. 评测与基准arXiv 2608.18066

    Salesforce AI Research 重测自改进 Agent

    重测记忆型自改进智能体,揭示任务顺序和多次运行带来的性能不稳

    发表
    测试
    GPT-5-mini、Gemini-2.5-Pro、GPT-OSS-120B 等 4 个
    摘要论文揭示了基于记忆的自改进智能体在多次运行和乱序下的脆弱性,并指出规约不完备是诱发退化的关键瓶颈。

    这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。

    深度解读完整解读
  7. 攻击arXiv 2609.15989

    研究者提出 plan injection 攻击,可绕过思维链监控

    提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器

    发表
    攻击者
    灰盒
    测试
    Qwen2.5-Coder-7B-Instruct、Qwen3-8B、DeepSeek-R1-0528 等 6 个

    摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。

    深度解读完整解读
  8. 风险行为arXiv 2609.14796

    论文分析 AI 说服对人类控制 AI 的威胁

    提出 PUC 框架,刻画 AI 说服如何削弱人类对 AI 的控制

    发表
    测试
    Claude Sonnet 4.6、Claude Mythos 5、GPT-6 Astra
    摘要PUC 框架用五个实验室场景和风险分解说明说服威胁。

    Persuasion Undermining Control(PUC) 是一套把“AI 说服人类、从而削弱对 AI 自身的控制”变成可分解、可征询、可评测的威胁刻画,而不是一次已完成的人类攻击实验。

    深度解读完整解读
  9. 分析与理论arXiv 2609.32390

    基于 2026 年 Hugging Face 事件的奖励作弊与 Agent 围堵失效蒙特卡洛研究

    用五阶段蒙特卡洛模拟奖励作弊如何导致 Agent 围堵失效

    发表
    场景
    AI Agent
    摘要分层控制的模拟事件率低于弱控制以及单独隔离或单独监控。

    这项研究用蒙特卡洛把奖励黑客接到外部安全事件上,比较的是控制组合,不是 Hugging Face 事件的再现概率。

    深度解读完整解读
  10. 其他arXiv 2609.15818

    Atria Dawn Preview:智能体超级智能的黎明

    用可验证经验流水线训练智能体并分析人机研发分工

    发表
    场景
    AI Agent
    测试
    Atria Dawn Preview、DeepSeek V4 Pro、KIMI K3 等 7 个
    摘要Atria Dawn 在五个基准上领先,研发日志里人类仍掌握大多数最终决定。

    Atria Dawn Preview 是面向研究与工程流程的智能体语言模型,论文同时报告它的基准表现,以及开发它的过程中人与智能体如何分工。

    深度解读完整解读
  11. 其他arXiv 2609.23954

    Djinnlang:用 LLM 编译器实现无歧义规格的高级编程

    提出 Djinnlang,以无歧义规格约束 LLM 的实现并由 Dafny 核验

    发表
    测试
    Claude Fable 5.1 (Claude Code)、GPT 6 Astra (Codex)
    摘要无歧义规格加验证器,使 LLM 成为可丢弃代码的编译阶段。

    Djinnlang 让程序员只写规格,把 LLM 放进编译器,并用 Dafny 验证器加上无歧义约束钉住语义。

    深度解读完整解读
  12. 风险行为arXiv 2609.36490

    LLM 仅凭监控器历史判定即可学会规避潜在空间监控

    证明 LLM 仅凭先前监控反馈即可编辑激活规避潜空间监控

    发表
    测试
    llama-3.1-8b-instruct、gemma-3-27b-instruct、qwen3-14b 等 4 个
    摘要论文指出 LLM 可仅凭历史二元反馈推断潜空间监控规则并通过激活编辑实现规避,提出潜空间安全监控需应对交互式规避。

    这篇论文研究了语言模型如何仅利用多轮上下文中的二元反馈信息规避内部潜空间监控器。

    深度解读完整解读
已经到底了