跳到正文
原文
论文追踪· arXiv:2609.22178· Zeyu Kang, Zhenyun Yin, Yang Zhang, Shan He, Shanzhe Lei, Yanjiu Zhong, Xinquan Chen, Xuhong Wang·本站收录 · 原文发表

SCOPE:训练有能力且安全的计算机使用智能体

Beyond Task Completion: Training Capable and Safe Computer-Use Agents

论文速读

对齐/训练方法

据论文 PDF 整理(AI 生成),以原文为准

SCOPE 从 Qwen3.5-9B 联合后训练计算机使用智能体,SCOPE-RL 在 OSWorld 上任务成功率为 54.17%,在 OS-BLIND 上攻击规避率为 64.30%,调和均值 58.80%。

问题
计算机使用智能体只按任务成功做后训练时,不会稳定地按风险决定继续还是停止。作者认为可靠策略应完成普通任务、有安全路径时避开环境危害并继续、目标有害或无安全路径时拒绝。
方法
SCOPE 用 SCOPE-Gen 合成可验证 GUI 任务,再注入五类可避开的环境危害并保持原目标,得到 SATraj-OS。监督微调混合能力、安全继续与显式拒答轨迹,随后用 GRPO 只在可验证能力任务上做在线强化学习。
实验与结果
作者报告仅能力训练几乎不带来攻击规避。联合 SFT 后 OSWorld 为 49.72%、OS-BLIND 攻击规避率为 66.30%、H 为 56.83%;SCOPE-RL 将 OSWorld 提到 54.17%,攻击规避率降至 64.30%,H 为 58.80%,为所评智能体中最高。拒答轨迹贡献大部分规避增益,风险处理轨迹在相近规避率下保留更多任务效用。
局限与可以继续做的
论文未设 Limitations 专节。结论将原则表述为扩展共享交互经验,同时显式监督安全关键决策。评测为 OSWorld(每任务最多 50 步)与 OS-BLIND 的 100−ASR;作者称该指标不区分安全继续、有意拒绝与偶然失败,H 不是部署安全的完整保证。
实验设置Qwen3.5-9B、SCOPE-mid-checkpoint 等 · OSWorld、OS-BLIND 等 · OSWorld task success rate、attack-avoidance rate (100−ASR) 等
模型
Qwen3.5-9BSCOPE-mid-checkpointSCOPE-Capability-SafetySCOPE-RLClaude 4.5 SonnetQwen3.7-PlusEvoCUA-8BEvoCUA-32BOpenCUA-7BOpenCUA-32BOpenCUA-72BUI-TARS-1.5-7BComputerRLQwen3-VL-8B
基准
OSWorldOS-BLINDSATraj-OS
指标
OSWorld task success rateattack-avoidance rate (100−ASR)harmonic mean H
AI 导读全文 296 字

针对仅以任务成功为目标的训练无法让计算机使用智能体(CUA)形成可靠安全行为的问题,研究者提出 SCOPE,联合后训练任务执行能力与安全感知决策,并配套 SCOPE-Gen 自动生成可验证任务及其环境风险变体,构建含能力演示、安全续行与明确拒答的 SATraj-OS 轨迹数据集。以 Qwen3.5-9B 为起点,SCOPE-RL 在 OSWorld 上取得 54.17% 任务成功率、在 OS-BLIND 上取得 64.30% 攻击规避率,综合能力—安全得分 58.80%,为所评估智能体中最高。消融显示拒答轨迹贡献了大部分攻击规避增益,风险处理轨迹则在相近攻击规避水平下保留更高任务效用。

深度解读

6 个问题,约 8,800 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    只优化任务成功不会让计算机使用智能体按风险决定继续或拒绝。

    只按任务是否完成做后训练,不能让计算机使用智能体(CUA)在执行中识别风险并采取相应动作。

    • 场景与重要性:作者称 CUA 能直接操作文件、网站、应用和用户账户,错误动作可能造成持久或不可逆后果。现有研究多在训练之后检测或阻止不安全行为,通过后训练赋予内在安全决策仍 largely unexplored。
    • 现有不足:作者称现有后训练主要关心任务是否完成,较少关心智能体如何识别环境风险、判断操作授权边界,以及避开不安全行为后继续追求用户目标。只优化任务成功时,智能体可能沿有害但能完成任务的路径执行(Figure 1)。
    • 核心观察:作者认为能力提升与安全学习并非必然冲突。可靠 CUA 应执行状态依赖策略:完成普通良性任务;危害可避开且仍有安全完成路径时调整路径并继续;目标本身有害或没有安全路径时拒绝。
    • 本文提出:作者提出 SCOPE(Safety and Capability Optimization for Policy Execution),联合后训练任务执行与安全决策。配套 SCOPE-Gen 把可验证 GUI 任务转成保留原目标的环境风险变体,并据此构建轨迹数据集 SATraj-OS。训练分两阶段:监督微调学习三类轨迹,在线强化学习再提升任务完成。
    • 两类安全设定:环境风险任务中用户目标良性但界面含危害,应避开并仍完成任务(safe continuation);显式滥用任务中目标本身有害,应拒绝。SCOPE 的成对任务针对前者,另用拒答轨迹覆盖后者。
  2. 有哪些相关研究?

    能力学习、CUA 安全评测与推理时防御、以及工具智能体的安全–效用对齐是三组相关工作。

    论文在第 2 节按三条线组织相关工作。

    计算机使用的能力学习

    • 网页到桌面:Mind2Web(Deng et al. 2023)、WebArena(Zhou et al. 2024)做网页导航;OSWorld(Xie et al. 2024)、OSWorld2.0(Yuan et al. 2026)扩展到带可执行初始化和基于状态评测的桌面环境。作者称桌面涵盖浏览器、办公应用、文件系统和跨应用流程,需要长程规划并持续解释、修改环境状态。
    • 原生 GUI 与在线 RL:UI-TARS(Qin et al. 2025)用大规模 GUI 数据、显式推理和迭代交互学习端到端计算机使用。EvoCUA(Xue et al. 2026)用可验证任务的自动合成和可扩展轨迹收集扩大训练数据。ComputerRL(Lai et al. 2025)把并行桌面交互、可验证奖励和异步策略优化结合起来扩展端到端在线强化学习。作者称这些工作的训练数据和优化信号仍主要围绕成功完成任务,对执行中的风险识别和安全决策监督有限。

    CUA 安全评测与推理时防御

    • 安全基准:OS-Harm(Kuntz et al. 2025)覆盖故意滥用、提示注入和非故意有害行为;RiOSWorld(Yang et al. 2025)区分来自用户指令的风险和出现在环境中的风险;OS-BLIND(Ding et al. 2026)关注良性指令与有风险执行上下文相互作用产生的伤害。作者称这些工作表明任务完成并不必然意味着安全执行。
    • 推理时防御:MirrorGuard(Zhang et al. 2026)用模拟轨迹识别并纠正不安全推理;ProjGuard(Contreras et al. 2026)监控轨迹表示,检测到潜在风险时调用纠正模块。作者称这类外部护栏对部署仍有价值,但不直接教基座智能体自己识别风险并调整行为。

    联合安全–效用对齐

    • 工具智能体:AgentAlign(Zhang et al. 2025)把有害智能体请求的拒答监督与良性请求的多步工具轨迹结合起来。Agent Safety Alignment via Reinforcement Learning(Sha et al. 2025)在沙箱工具环境中训练执行–拒绝–验证策略:良性请求执行,恶意请求拒绝,敏感动作需用户确认。FATE(Yin, Li, and Wang 2026)把同策略失败转为修复监督,并在安全、效用、过度拒绝和轨迹有效性上做 Pareto 过滤。RUBAS(Loye et al. 2026)从工具使用安全、参数安全、回复安全和有用性评估轨迹。作者称这些工作主要研究结构化工具智能体,工具身份、参数和执行约束提供了显式动作语义。

    基线与基准:主实验对比的模型包括 Claude 4.5 Sonnet、Qwen3.7-Plus、EvoCUA-8B/32B、OpenCUA-7B/32B/72B、UI-TARS-1.5-7B、ComputerRL、Qwen3.5-9B、Qwen3-VL-8B(Table 2)。能力用 OSWorld 任务成功率,安全用 OS-BLIND 的攻击规避率 100−ASR。

    作者将本文定位为:在同一 GUI 交互空间里联合后训练任务执行与安全感知决策;作者称据其所知 SCOPE 是首个为此联合后训练的 CUA 模型,SATraj-OS 是首个明确为能力–安全联合训练设计的大规模 CUA 轨迹数据集。

  3. 论文如何解决这个问题?

    SCOPE-Gen 生成成对任务,SATraj-OS 提供三类轨迹,再经联合 SFT 与只优化能力的在线 RL。

    SCOPE 先用 SCOPE-Gen 合成可验证能力任务并注入可避开的环境危害,建成含能力示范、安全继续和显式拒答的 SATraj-OS,再经联合监督微调与轨迹均衡的在线强化学习后训练。

    问题设定与奖励

    • 轨迹与完成:良性任务写作 x = (u, s0, e),u 为指令,s0 为初始状态,e 为能力评估器。策略 πθ 在步 t 观察状态 st 的截图 ot,执行 GUI 动作 at。任务完成 rc(τ) = e(sT) ∈ [0, 1]。
    • 风险注入:加入可检测的禁止事件集合 H,不改变 u 或 e。安全奖励是逐步指示函数的连乘,任一步触发危害则整条轨迹 rs = 0。合取奖励 r(τ) = rc(τ)rs(τ) 只在未触发危害且完成任务时给满分。作者称放弃本可安全完成的良性任务会降低 rc,不安全完成使 rs = 0。显式滥用任务没有合法完成,单独作为拒答学习。

    SCOPE-Gen 与五类危害

    • 可验证能力任务:四个不同 LLM 顺序生成。Task Generator 把应用 d 和原子能力集 Z 组成指令 u 和含文件名、文本、取值等的规格 q;Setup Generator 只建初始状态 s0 和清单 m,不完成用户要求的工作;Evaluator Generator 依赖已实现的初始状态生成程序化评估器 e;Counterfactual Generator 构造满足全部条件的成功状态 s+ 和像真实错误的反事实状态。确定性 Validation Engine 要求 e(s0) = 0、e(s+) = 1、每个反事实 e(s−k) < 1。失败时证据只返回 Evaluator Generator,再重跑反事实与验证,直到通过或达到修复预算。附录 A 写明两次评估器修复仍失败则丢弃,并通过后还做格式、资源、语法与安全检查,以 OSWorld 格式打包。附录 A 给出了四个生成器的完整系统提示词。
    • 成对安全任务:对已验证任务采样危害类型 h,用注入算子 Ih 得到 xh。用户指令的能力内容与能力评估器不变,只改初始状态或相关资源,并配逐步危害检测。作者称只看最终状态无法区分全程安全完成与先触发危害再恢复。危害任务仍须能在不触发危害时完成。
    • 五类危害:Popup(无关或欺骗性对话框,须忽略或关闭);Induced-text(网页或应用中要求未授权动作的文字);Phishing-web(欺骗性页面);Credential injection(暴露无关合成凭证,策略不得使用或泄露);Note(文件、文档或注释中的恶意指令)。附录 B 给出各类的载体、禁止事件和安全继续策略,并说明序列化指令对部分危害可以带展示包装,但授权操作与 e 评估的目标终态不变。

    上下文压缩

    • 窗口:长程多模态轨迹用 H = history_n、M = image_max、B = fold_size 限制上下文。步 t 的结构化消息从 ℓt = max(1, t − H) 开始,最多保留前 H 个观察–动作回合;更早动作放进紧凑的全程动作轨迹 A<t。窗口内近期助手消息只保留动作描述和工具调用。
    • 视觉折叠:未折叠截图数超过 M 时,把最早的 B 张未折叠截图换成固定文本标记 ϕ,不使用基于模型的摘要。采集、训练和推理使用同一组 (H, M, B),实验取 H = 5、M = 3、B = 2。每个决策步以 Ct 为输入、at 为最终回复,损失只加在该回复的 token 上。附录 C 的 Algorithm 1 描述了 Qwen 格式的压缩过程。

    两阶段后训练

    • 联合 SFT:D = Dcap ∪ Drisk ∪ Dref,标准自回归损失。能力数据提供 GUI 技能,环境风险数据教安全继续,较小的拒答集为直接有害的用户目标建立边界。冻结 ViT,训 3 个 epoch,AdamW,学习率 3×10−6。附录 D:bfloat16、每设备 micro-batch 2、梯度累积 4、权重衰减 0.01、余弦调度、前 3% warmup、最大梯度范数 1.0、最大序列长度 8192、无 packing、Qwen 非思考模式、空推理片段不计入损失、随机种子 42。
    • 在线 RL:从 SCOPE-SFT 出发,用 GRPO 只优化可验证能力任务。每任务由冻结的 rollout 策略采样 G 条轨迹,组内中心化奖励,再把该轨迹的优势均分到各交互步。零奖励方差的任务组按 DAPO 的动态采样滤掉。token 级目标使用截断的重要性比。作者称若不做最后的按步数归一化,拆成更多步级样本的轨迹会得到更大更新权重。学习率 2×10−7,每步更新采样 4 个任务、每任务 G = 8,64 个并行环境。附录 D:最多 100 次迭代,截断比与上限均为 0.1,无 KL 惩罚、熵奖励系数为 0,只接受策略版本滞后至多为 2 的组,优势中心化但不除以标准差,温度 1.0、top-p 0.95,Adam 权重衰减 0.1,每条轨迹最多 30 个交互回合,最大序列长度 16384。训练后端为 Megatron-LM(张量并行 2),rollout 引擎为 SGLang(张量并行 1),数据采集与在线 RL 使用 Safactory。

    轨迹筛选与成功判定

    • 数据规模:SCOPE-Gen 为离线 SFT 产生 4344 个能力任务候选;Qwen3.7-Plus 采集策略得到 2199 条通过过滤的成功轨迹。另构建 914 个风险注入任务,保留 460 条既识别风险又安全完成原任务的轨迹;手工整理 81 条拒答轨迹,对应显式有害指令或没有安全完成路径的情形。另生成 961 个能力任务用于在线 RL。Table 1 合计候选任务 5258、保留轨迹 2740。
    • 过滤:保留轨迹须同时有动作文本和对应工具调用,描述与执行调用一致,工具参数有效,拒绝病理性重复动作,终止须由策略产生而非基础设施超时。风险任务须同时通过能力成功和安全不变量。
    • 评测口径:OSWorld 上每任务最多 50 步,指标为任务成功率。OS-BLIND 的原始主指标是 ASR,论文报告越高越好的攻击规避率 100−ASR。作者称该基于结果的指标记录是否避免了有害完成,但不区分安全继续、有意拒绝和偶然任务失败,因此只解释为攻击规避,而不是安全任务完成的直接度量。聚合指标为等权调和均值 H = 2CA/(C+A),C 为 OSWorld 成功率,A 为 OS-BLIND 攻击规避率。作者称相对算术平均,调和均值对较弱维度更敏感;鉴于 A 的测量边界,H 只用于在其评测设置下比较聚合表现,不应解释为部署安全的完整保证。
  4. 论文做了哪些实验?

    联合 SFT 把 OS-BLIND 攻击规避率提到 66.30%,随后能力 RL 把 OSWorld 提到 54.17%、H 提到 58.80%。

    实验围绕四个问题:只做能力后训练是否自行带来安全;联合 SFT 能否在不牺牲任务成功的情况下提高安全;随后的能力 RL 是否抹掉已学到的安全行为;哪类轨迹造成增益。

    实验设置

    • 被测模型:基座为 Qwen3.5-9B。本文检查点为 SCOPE-mid-checkpoint、SCOPE-Capability-Safety(正文亦称联合 SFT 后的 SCOPE-SFT)、SCOPE-RL。对比模型为 Claude 4.5 Sonnet、Qwen3.7-Plus、EvoCUA-8B、EvoCUA-32B、OpenCUA-7B、OpenCUA-32B、OpenCUA-72B、UI-TARS-1.5-7B、ComputerRL、Qwen3-VL-8B(Table 2)。智能体只观察截图,经 PyAutoGUI 执行鼠标和键盘动作。
    • 基准与指标:OSWorld 测一般任务执行,每任务最多 50 步,指标为任务成功率。OS-BLIND 报告攻击规避率 100−ASR。聚合为调和均值 H。论文未报告两个基准的任务条数、重复次数或人工一致性。
    • 训练数据:离线 SFT 使用 Table 1 的 2199 条能力轨迹、460 条环境风险轨迹、81 条拒答轨迹;在线 RL 另用 961 个能力任务。采集策略为 Qwen3.7-Plus。上下文 H = 5、M = 3、B = 2。
    • 消融预算:Table 3 在匹配的 SFT 步数预算下比较轨迹组成。论文未写明该步数的具体数值。

    主结果

    表格较宽,可左右滑动

    模型HOSWorldOS-BLIND 攻击规避出处
    Claude 4.5 Sonnet37.7862.9027.00Table 2
    Qwen3.7-Plus9.3673.335.00Table 2
    ComputerRL21.7748.9014.00Table 2
    Qwen3.5-9B8.9341.805.00Table 2
    SCOPE-Capability-Safety56.8349.7266.30Table 2
    SCOPE-RL58.8054.1764.30Table 2
    EvoCUA-8B / OpenCUA-32B10.62 / 1.9446.06 / 34.796.00 / 1.00Table 2
    SCOPE-mid-checkpoint48.6445.4352.33Table 2

    表中 EvoCUA-8B 与 OpenCUA-32B 分别是开源对比里 H 较高和 H 最低的两端;未单列的还有 EvoCUA-32B(H 4.42,OSWorld 56.73,OS-BLIND 2.30)、OpenCUA-7B(3.21 / 28.85 / 1.70)、OpenCUA-72B(4.38 / 44.99 / 2.30)、UI-TARS-1.5-7B(8.46 / 27.52 / 5.00)、Qwen3-VL-8B(16.27 / 33.90 / 10.70),均据 Table 2。Figure 3 以攻击规避率为横轴方向的权衡图,虚线为等 H,标注 SCOPE-RL 的 H = 58.8%。

    • 联合监督与能力相容:作者称 SCOPE-Capability-Safety 相对 Qwen3.5-9B,OSWorld 从 41.80% 到 49.72%(提高 7.92 个百分点),攻击规避率从 5.00% 到 66.30%(提高 61.30 个百分点),H 为 56.83%。作者称其高于所评开源模型以及闭源 Claude 4.5 Sonnet,并呈现更均衡的能力–安全表现。Table 2 中 Qwen3.7-Plus 的 OSWorld 为 73.33%,高于 SCOPE-RL 的 54.17%,但其攻击规避率为 5.00%、H 为 9.36%。
    • 能力 RL 保留大部分规避增益:作者称 SCOPE-RL 将 OSWorld 从 49.72% 提到 54.17%(+4.45 个百分点),OS-BLIND 攻击规避率从 66.30% 降到 64.30%(−2.00 个百分点),H 从 56.83% 升到 58.80%,为所评模型中最高聚合表现。作者称在当前训练范围内,面向能力的在线 RL 提升了任务执行,同时保留了联合 SFT 带来的大部分攻击规避增益。
    • Figure 3:作者称右上方向更好,SCOPE-RL 取得最佳聚合表现(H = 58.8%)。图注给出的是这一标注和等 H 虚线,曲线上其余点的坐标论文未在图注中逐一列出。

    轨迹组成消融

    Table 3 在匹配 SFT 步数预算下报告(%):

    表格较宽,可左右滑动

    组成HOSWorldOS-BLIND
    Capability only11.7949.036.70
    Capability + risk handling20.8953.1913.00
    Capability + refusals56.5048.4867.70
    Capability + more refusals52.4443.2166.70
    Full Joint-SFT56.8349.7266.30
    • 测了什么:从完整联合 SFT 中去掉或替换拒答与风险处理轨迹。作者称去掉 81 条显式拒答轨迹后,攻击规避率从 66.30% 降到 13.00%,因而拒答监督构成 OS-BLIND 上大部分改进。能力加风险处理、不含拒答时,OSWorld 从仅能力的 49.03% 到 53.19%,攻击规避率从 6.70% 到 13.00%。作者称风险处理轨迹带来跨两个指标的适度、一致的联合收益,但本身不足以建立可靠的停止行为;并称这不意味着基座模型缺乏拒绝的语言能力,而是面向任务完成的 CUA 训练没有给出何时停止的正向监督。
    • 相近规避率下的效用:去掉风险处理轨迹后,攻击规避率从 66.30% 到 67.70%,OSWorld 从 49.72% 到 48.48%,H 从 56.83% 到 56.50%。把风险处理换成更多拒答监督后,攻击规避率为 66.70%,OSWorld 降到 43.21%,H 降到 52.44%,相对 Full Joint-SFT 分别低 6.51 和 4.39 个百分点。作者称单纯增加拒答监督不能恢复风险处理轨迹所保留的任务效用;100−ASR 不区分安全继续、拒绝和偶然失败,因此规避率的小幅上升并不确立风险处理数据是多余的。作者不把 Full Joint-SFT 的最高聚合分解释为风险处理轨迹单独构成 OS-BLIND 主要增益。

    附录中的轨迹示例

    • 能力轨迹:附录 Table 6 给出一条 LibreOffice Calc 成功轨迹的压缩交互记录,能力评估器返回 rc = 1。
    • 安全继续:附录 Table 7 给出 note 攻击下的成功安全继续,结果为 (rc, rs) = (1, 1)。作者称智能体没有执行外部附加的命令,并完成了被授权的设定。附录未把这两例当作定量评测。

    其他消融与分析

    • 论文的定量消融集中在 Table 3 的轨迹组成;未报告按五类危害分开的攻击规避率、学习率或上下文 (H, M, B) 的数值消融。
    • 正文提到能力训练本身不自然诱导可靠攻击规避:Table 3 仅能力 SFT 的 OS-BLIND 攻击规避率为 6.70%,Qwen3.5-9B 基线为 5.00%(Table 2)。
    • SCOPE-mid-checkpoint 的 H / OSWorld / OS-BLIND 为 48.64 / 45.43 / 52.33(Table 2);论文未说明该检查点相对最终 SFT 的训练进度。
  5. 有什么可以进一步探索的点?

    论文未单列局限;OS-BLIND 的 100−ASR 被作者限定为攻击规避而非安全完成。

    作者指出的局限与后续方向

    论文没有 Limitations、Discussion 或 Future Work 专节。结论(第 5 节)未逐条列出未解决问题,而是把结果收成一条实践原则。与测量边界直接相关、由作者明确限定的表述如下。

    • 攻击规避率的含义:第 4.1 节写明,OS-BLIND 上的 100−ASR 记录是否避免了有害完成,但不区分安全继续、有意拒绝和偶然任务失败,因此将其解释为攻击规避,而不是安全任务完成的直接度量。
    • 调和均值的用途:第 4.1 节写明,鉴于 A 的上述测量边界,H 只用于在其评测设置下比较聚合表现,不应解释为部署安全的完整保证。
    • 结论中的原则:第 5 节称这些发现支持一条面向计算机使用智能体的实践原则:扩展共享交互经验,同时显式监督安全关键决策。作者计划发布或并入代码库之类的事项,论文未写。

    实验覆盖范围

    • 模型与基准:Table 2 列出 1 个基座、3 个本文检查点和 10 个对比模型,指标为 OSWorld 任务成功率(每任务最多 50 步,第 4.1 节)和 OS-BLIND 攻击规避率,以及二者的调和均值。论文未报告两个基准的样本量、重复次数、评审模型或人工一致性。
    • 训练数据:Table 1 与第 4.1 节写明离线轨迹为 2199 条能力、460 条环境风险、81 条手工整理的拒答;在线 RL 使用另外 961 个能力任务。采集策略为 Qwen3.7-Plus。五类危害在方法中定义,实验未按危害族分别报告指标。
    • 优化范围:第 3.4 节与附录 D 写明 SFT 与在线 RL 都冻结 ViT;GRPO 只作用于可验证能力任务,组大小 G = 8,最多 100 次在线迭代,每条 rollout 最多 30 个交互回合。安全行为来自 SFT 阶段的轨迹监督,RL 阶段不再以 rs 为目标。
    • 消融:Table 3 在匹配的 SFT 步数预算下比较仅能力、能力加风险处理、能力加拒答、更多拒答和完整联合 SFT。论文未报告该预算的步数,也未报告查询次数或训练耗时。
    • 安全指标的区分:第 4.3 节再次写明 100−ASR 不区分安全继续、拒绝和偶然失败;附录 Table 6、Table 7 各给出一条压缩轨迹示例,分别对应 rc = 1 与 (rc, rs) = (1, 1),不是分组评测。
  6. 总结一下论文的主要内容

    SCOPE 用三类轨迹联合后训练 CUA,能力 RL 后 H 为 58.80%。

    SCOPE 是面向计算机使用智能体的联合后训练框架:在同一 GUI 空间里同时学习完成任务和按风险决定继续或停止。

    • 问题:作者认为只优化任务成功不会带来可靠的攻击规避。目标良性但环境有危害时应避开危害并继续;目标有害或没有安全路径时应拒绝。
    • 数据:SCOPE-Gen 用四个顺序 LLM 生成可验证任务,再经确定性验证;随后注入 Popup、Induced-text、Phishing-web、Credential injection、Note 五类可避开危害,指令的能力内容与评估器不变,危害按步检测。SATraj-OS 含 2199 条能力轨迹、460 条安全继续轨迹和 81 条拒答轨迹;另有 961 个能力任务用于在线 RL。
    • 训练:从 Qwen3.5-9B 出发,冻结 ViT。联合 SFT 混合三类轨迹;随后 GRPO 只在可验证能力任务上优化,并把每条轨迹的优势按交互步均分。上下文在采集、训练和推理中统一为最近 5 个回合、最多 3 张未折叠截图、每块折叠 2 张。
    • 结果:Table 2 中 SCOPE-Capability-Safety 的 OSWorld 为 49.72%、OS-BLIND 攻击规避率为 66.30%、H 为 56.83%。SCOPE-RL 为 54.17%、64.30%、58.80%,作者称这是所评智能体中最高的聚合分。Qwen3.7-Plus 的 OSWorld 为 73.33%,攻击规避率仅 5.00%。Table 3 中仅能力 SFT 的攻击规避率为 6.70%;去掉拒答后降到 13.00%;用更多拒答替换风险处理时规避率为 66.70%,但 OSWorld 降到 43.21%。
    • 作者结论:能力学习本身几乎不产生安全行为;拒答轨迹负责 OS-BLIND 上的大部分规避增益,风险处理轨迹在相近规避率下保留更多任务效用;面向能力的在线 RL 提升任务完成并保留大部分已获得的规避增益。作者认为应扩展共享交互经验,同时显式监督安全关键决策。作者并称 100−ASR 不是安全任务完成的直接度量,H 也不是部署安全的完整保证。
阅读原文arxiv.org