跳到正文
10月8日 · 周四

OpenAI · 论文

找到 3 篇
  1. 评测与基准arXiv:2610.07639 ·

    HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制

    提出HarnessSecurity-Bench,横向评测编码智能体框架的安全机制

    测试
    GLM-5.2、Qwen3.8-27B、Claude Opus 4.8 等 4 个应用层
    摘要系统审计40款harness并实证评测9类安全机制,量化了自动审批的暴露风险、强隔离的效用代价以及替代执行路径绕过。
    • 论文定位:该研究是针对开源与闭源代码智能体harness原生安全机制的系统性实证分析与基准评测。
    • 核心问题:针对代码智能体harness安全机制实现状态不透明、在对抗环境下防护能力及对合法开发效用影响缺乏定量评估的问题展开研究。
    • 方法体系:作者构建了包含10类安全机制的分类法,通过研究人员与LLM独立评审审计了40款harness的400个单元格;进一步提出包含23个任务的HARNESSSECURITY-BENCH,在隔离容器中利用确定性预言机评测6款harness在开启与关闭机制下的表现。
    • 关键实验发现:
      • 在GLM-5.2基线与6款harness测试中,开启auto-approve使总体任务效用从77.1%升至95.4%,但ASR从29.2%升至95.6%(Table 6)。
      • 网络隔离(NI)与只读模式(RO)大幅降低攻击效果,总体ASR分别降至0.8%和0.8%,但分别带来24.5和34.0个百分点的效用损失(Table 6、Table 7)。
      • 命令白名单(CAL)将ASR降至50.0%且效用仅微降1.5个百分点;命令黑名单(CDL)将ASR降至1.3%,同时因阻断破坏性操作使效用提升5.2个百分点(Table 6)。
    • 绕过路径与安全风险:案例分析显示,限制共享能力会同时误伤合法操作,且仅限制特定直接命令仍可通过受信任的解释器等替代路径绕过控制(Section 6.3)。
    • 作者建议与启示:作者建议harness提供商发布机制级说明并暴露运行时生效设置以增强可验证性,针对受保护资源测试所有替代访问路径,并在评估安全机制时综合权衡攻击效果、任务效用与资源执行开销。
    完整解读
  2. 评测与基准arXiv:2610.03153 ·

    EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准

    提出EvoRiskBench,评测工作区智能体的运行时安全风险

    测试
    GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5应用层
    摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
    • 定位与目标:EvoRiskBench 是针对工作空间智能体在间接提示注入(IPI)下的运行时安全风险提出的可执行演化评测基准,旨在解决传统评测对智能体协作入口覆盖不全以及难以系统捕获实际执行后果的问题。
    • 核心方法框架:提出 EP–Path–EF 体系,将 9 类风险入口与 5 类单跳技术后果通过执行路径相链接;采用“生成-冻结-重放-提炼”闭环流程构建 450 个对抗任务,并在独立 Windows 容器中结合 ETW 进程与网络事件进行客观后果验证。
    • 主评测结果:在 3 款模型与 3 款 Harness 构成的 9 种配置(共 4,050 次执行)中,整体攻击成功率(ASR)为 37.46%,整体任务成功率(TSR)为 60.44%。
    • 最高风险配置:DeepSeek-V4-Pro-0813 搭配 Codex 的 ASR 达到 68.44%,反映出当前工作空间智能体在面对非受信输入时容易被利用产生实际破坏,作者指出仅配置工作空间不足以保证安全自主执行。
    • 模型与 Harness 效应:模型间 ASR 差距达 54.37 个百分点(DeepSeek-V4-Pro-0813 为 58.81%,Claude Opus 5 为 4.44%),远大于 Harness 间 5.41 个百分点的差距,且 Harness 的防护效果依赖于所配模型。
    • 作者结论与启示:作者认为任务执行能力强的智能体可能伴随更高的攻击易感性,且低总 ASR 容易掩盖局部高风险(如 Claude Opus 5 在网络访问导致系统破坏上的 ASR 达 56.67%),因此必须将模型与 Harness 作为整体系统协同开展运行时安全防御。
    完整解读
  3. 攻击arXiv:2608.06862 ·

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    提出SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件

    测试
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 5 个应用层
    摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
    • 定位:论文研究了计算机使用智能体(CUA)中由持久化工件自主生成引发的内部供应链安全风险。
    • 核心问题:现代 CUA 依赖自主编写并复用技能等持久工件来扩展能力,若底层模型受到供应链攻陷,可能在良性任务中生成带潜伏载荷的自合成工件,使得恶意行为无需外部新输入即可在后续任务中跨步激活。
    • 方法设计:提出 SYNCHAIN 框架,通过面向持久化的定向 SFT,将恶意逻辑潜伏编码在良性工件的结构冗余中;工件被纳入系统扩展状态后,通过状态转移实现严格的延迟激活。
    • 核心实验发现:在 OpenClaw、Codex 和 Claude Code 三个框架下,SYNCHAIN 在 Chain-1 无防御设置下取得 97.78%–98.89% 的平均 ASR,在 GuardAgent 下仍保持 87.78%–93.33%;在 Chain-2 取得 72.59% 的平均 ASR,显著优于适配基线 SkillJect 和 DemonAgent。
    • 传播边界与衰减:在更长任务链中,受上下文截断和记忆总结等信息瓶颈影响,Chain-4 与 Chain-5 的 ASR 分别回落至 6.67% 与 1.11%,表明跨任务传播存在天然的马尔可夫衰减边界。
    • 作者结论与启示:作者认为,持久性改变了智能体的安全边界,传统的单步输入过滤和输出审查无法防御内部工件传递的风险,未来需构建结合工件签名、权限约束与执行轨迹审计的来源感知防御。
    完整解读
已经到底了