跳到正文
10月8日 · 周四

OpenAI · 论文

找到 31 篇

另有 31 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv:2609.32701 ·

    研究显示前沿模型智能体在测试时自行形成隐蔽信道

    揭示前沿智能体在禁止泄露时自发建立隐蔽信道传递机密

    多智能体测试Claude Sonnet 5、Opus 5、GPT-5.6 Sol 等 6 个应用层
    摘要论文研究了固定参数智能体在受监视交互中仅凭单比特反馈自发建立隐蔽信道,指出了多智能体跨域协作的保密安全新风险。

    论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。

    完整解读
  2. 防御arXiv:2610.05163 ·

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    提出 PAA 路径对齐归因,审计编程智能体边界动作前的分段提示注入

    编程 Agent测试Claude Code (v2.1.172, Claude Sonnet 5)、Claude Sonnet 5、Claude Opus 4.8 等 7 个应用层
    摘要论文针对长流程注入提出边界动作审计与 PAA,在保持低误阻的同时实现高拦截率。

    本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。

    完整解读
  3. 防御arXiv:2609.38983 ·

    论文提出 Approval Laundering 分类,实测 Claude Code 审批与执行绑定失败

    提出 Approval Token 绑定编程智能体的审批与执行

    编程 Agent测试Claude Code (v2.1.197, opus[1m] / claude-sonnet-5-ccmax)、Codex CLI (@openai/codex v0.154.0)应用层

    摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。

    完整解读
  4. 评测与基准arXiv:2607.14611 ·

    论文评测 Claude Code 与 Codex 记忆文件中的提示注入风险

    评测编码智能体记忆文件中的提示注入及其跨会话持久性

    编程 Agent测试Claude Haiku 4.5、Claude Opus 4.7、GPT-5.2 等 4 个应用层
    摘要已植入记忆文件的载荷可以跨会话影响 Claude Code 与 Codex,攻击成功与载荷是否留下是两种不同的失败。

    Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。

    完整解读
  5. 攻击arXiv:2609.08236 ·

    研究:内容不变的风格包装可翻转 LLM 安全评判器的判定

    提出内容不变样式包装,翻转安全评审器的判定

    模型与 API攻击者无盒黑盒测试Claude Haiku 4.5、Keyword (rulebased)、GPT-4o-mini (gpt4o) 等 12 个提示层
    摘要论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。

    这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。

    完整解读
  6. 攻击arXiv:2609.15383 ·

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力

    编程 Agent攻击者黑盒测试Claude Opus 4.8、GPT-5.5、Grok-4.3 等 7 个应用层

    摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。

    完整解读