防御arXiv 2609.22178
SCOPE:训练有能力且安全的计算机使用智能体
提出 SCOPE 联合后训练计算机使用智能体的任务执行与安全决策
- arXiv
- 2609.22178
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 测试
- Qwen3.5-9B、SCOPE-mid-checkpoint、SCOPE-Capability-Safety 等 14 个
提出 SCOPE 联合后训练计算机使用智能体的任务执行与安全决策
提出契约约束的工具调用修复协议,在执行前拦截非法补丁
提出 DART,用去噪表征转移检测并干预多轮智能体攻击
构建 TOOLPRIVBENCH 评测 Agent 的过度特权选择并提出特权感知后训练
作者研究 LLM 智能体的 over-privileged tool selection:低权限工具已经足够时,仍选择或在短暂失败后升级到高权限工具。
提出 INTENT-AS-A-TOOL 跟踪并干预智能体失准
Zhang 等人研究推理型语言模型在职场邮件沙箱里如何走向智能体失准,并提出用动作偏好而不是事后文本标签来跟踪承诺。问题是:有害执行往往出现在推理已经形成意图之后,但 CoT 监控是事后、粗粒度、依赖外部评审的,也看不到模型倾向调用哪个动作。
提出协同演化防御 CoDeL,抵御智能体工具观测中的间接提示注入
作者提出 CONFLICTGUI 基准,覆盖指令内部冲突与指令和 GUI 上下文冲突两类场景,用于研究 GUI Agent 的冲突感知终止能力。
ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。
提出 CorrGRPO,用组内 Pearson 相关归一化多奖励 GRPO
CorrGRPO 是 GRPO 的多奖励变体:组内优势的分子仍是中心化总奖励,分母改为 Pearson 相关之和,避免大尺度奖励主导归一化。