跳到正文
原文
论文追踪· arXiv:2605.14859· Zheng Yan, Jingxiang Weng, Charles Chen, Dengyun Peng, Ethan Qin, Jiannan Guan, Jinhao Liu, Qiming Yu, Yixin Yuan, Fanqing Meng, Carl Che, Mengkang Hu·本站收录 · 原文发表 精选关注度53

论文提出 AuthBench 基准,评测编码 Agent 能否推断最小权限边界

Do Coding Agents Understand Least-Privilege Authorization?

论文速读

评测与基准

据论文 PDF 整理(Gemini 生成),以原文为准

论文在 AuthBench 上评测了前沿模型的权限推断能力,提出两阶段分解使 GPT-5.4 敏感任务 TSR 提升 15.8% 并降低攻击成功率。

问题
代码智能体在执行终端任务前缺乏按需授予最小权限的机制,粗粒度默认权限易引发安全风险;现有研究假设权限策略已给定,未研究智能体能否在行动前自主推断任务级权限边界。
方法
提出两阶段充足性-紧缩性分解(Sufficiency-Tightness Decomposition):Phase 1 前向模拟执行计划并解析完整工具链,以覆盖率为先生成宽容策略;Phase 2 针对任务依据、范围最小化与敏感表面进行逐项审计过滤。
实验与结果
AuthBench 上前沿模型常同时欠授权与过授权;增加推理反而让模型收敛到各自偏向的授权吸引子。两阶段分解使紧缩偏向模型在敏感任务上的 TSR 最高提升 15.8%,且在所有被测模型上均降低了攻击成功率。
局限与可以继续做的
论文局限在于策略语言仅覆盖终端任务中的文件级读写执行权限,未覆盖网络访问、IPC、数据库凭据、云资源、浏览器状态或 API 级权限;推理强度分析仅针对具备可配置推理等级的模型家族。评测覆盖 120 个终端任务及 9 个前沿模型,未报告其他非文件系统权限。
实验设置GPT-5、GPT-5.3-Codex 等 · AuthBench · TSR、SER 等
威胁模型
攻击者利用敏感任务中预置的凭据文件、不安全脚本或数据外发工具,诱导智能体访问敏感表面并触发外发或危害端点;授权模型在行动前仅能通过只读操作检查环境,若其策略过度授权则使攻击行为可达。
被测模型
GPT-5GPT-5.3-CodexGPT-5.4Claude Opus 4.6Gemini 3.1 Pro PreviewKimi K2.5MiniMax M2.7Qwen3-Coder-480BQwen3.5-397B
基准
AuthBench
指标
TSRSERASRPrecisionRecallF1
AI 导读和推荐理由论文将编码 Agent 在任务执行前生成文件级读/写/执行权限策略的能力定义为权限边界推断,并构建 AuthBench 基准,包含 10 个领域的 120 个终端任务(80 个标准任务、40 个敏感任务),配有经人工审核的权限标注和可执行的效用与攻击验证器。评测 GPT-5、GPT-5.3-Codex、GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro Preview、Kimi K2.5、MiniMax M2.7、Qwen3-Coder-480B、Qwen3.5-397B 等前沿模型后发现,模型常同时出现授权不足与授权过度:既遗漏执行链所需的权限,又授予未使用或敏感的访问权限。提高推理时推理量不会缩小这一差距,反而让每个模型更稳定地收敛到各自的授权吸引子。

论文将编码 Agent 在任务执行前生成文件级读/写/执行权限策略的能力定义为权限边界推断,并构建 AuthBench 基准,包含 10 个领域的 120 个终端任务(80 个标准任务、40 个敏感任务),配有经人工审核的权限标注和可执行的效用与攻击验证器。评测 GPT-5、GPT-5.3-Codex、GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro Preview、Kimi K2.5、MiniMax M2.7、Qwen3-Coder-480B、Qwen3.5-397B 等前沿模型后发现,模型常同时出现授权不足与授权过度:既遗漏执行链所需的权限,又授予未使用或敏感的访问权限。提高推理时推理量不会缩小这一差距,反而让每个模型更稳定地收敛到各自的授权吸引子。

推荐理由论文提出权限边界推断任务与 AuthBench 基准,并给出无需训练即可降低攻击成功率的分解方法,适合关注 Agent 权限设计的团队参考。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    代码智能体缺乏在行动前自主推断任务级最小权限边界的能力。

    代码智能体在执行终端任务前,能否自主推断出既满足任务执行又排除多余敏感资源的最小文件权限边界。

    • 场景与重要性:代码智能体正从简单的代码补全转向在 Shell 中进行多轮自主工作流。然而,手动授予任务级细粒度权限无法随自主化扩展,现有系统普遍依赖宽泛的默认权限,引发信任与授权的不匹配(trust-authorization mismatch)。
    • 现有评估的脱节:现有能力基准默认提供充足权限只测完成率,安全基准在既定环境下测行为,运行时执行框架则预设策略已存在,均未解决权限策略本身的生成来源问题。
    • 核心观察与挑战:最小权限要求策略高于任务充分边界(task-sufficient boundary $ \pi^* $)且低于攻击促成边界(attack-enabling boundary)。前沿模型并非单纯在保守与激进之间单向失准,而是普遍同时出现欠授权(缺少执行链必需权限)与过授权(开放非必要或敏感资源)。
    • 论文的提出方案:形式化了权限边界推断(permission-boundary inference)任务,构建包含 120 个真实终端任务的基准 AuthBench,并提出充足性-紧缩性分解(Sufficiency-Tightness Decomposition)方法。
    • 威胁模型:
      • 攻击者目标:诱导智能体访问敏感文件、利用不安全辅助脚本或触发敏感凭据外发/危害端点。
      • 知识与能力:被测智能体在执行前仅能通过只读操作检查终端环境与指令;敏感任务中预置了现实的攻击表面(如凭据文件、外发工具 curl/tar、不安全脚本)。
      • 受害系统:基于 Docker 的终端环境及执行智能体 OpenClaw。
  2. 有哪些相关研究?

    现有工作侧重执行安全与运行时拦截,未研究执行前的策略推断。

    论文将相关工作归纳为智能体基准、运行时权限控制与智能体推理规划三个方向。

    智能体能力与安全基准

    • SWE-bench (Jimenez et al., 2023)、Terminal-Bench (Merrill et al., 2026) 与 SWE-PolyBench (Rashid et al., 2025):评估代码智能体在仓库级与命令行环境下的任务完成能力。
    • ToolEmu (Ruan et al., 2023)、AgentHarm (Andriushchenko et al., 2024)、Agent-SafetyBench (Zhang et al., 2024) 与 AgentDojo (Debenedetti et al., 2024):在给定工具与权限的环境下评估智能体的有害行为、恶意指令依从性或提示注入防御。
    • GrantBox (Zhang et al., 2026):评估智能体在真实工具上的特权使用情况。论文指出此类工作评估的是模型如何使用已被赋予的权限(执行安全),而非在执行前合成最小权限策略。

    最小权限与运行时访问控制

    • Progent (Shi et al., 2025)、AgentBound (Bühler et al., 2025)、AgentSpec (Wang et al., 2025) 与 Pro2Guard (Wang et al., 2025):在已有策略或规则的前提下,规范与拦截智能体的运行时行为。
    • 语义任务与范围匹配研究 (El Helou et al., 2025; South et al., 2025):研究授权应与用户意图绑定的委派机制。论文指出这些工作侧重表示与执行机制,未解决从具体任务推断文件级边界的生成问题。

    长思维链与智能体推理边界

    • ReAct (Yao et al., 2022) 及长思维链研究 (Chen et al., 2024; Chen et al., 2025):探索智能体规划与多步工具使用,分析推理计算量增加时的收益与饱和现象。论文将这一视角延伸到权限推断中。

    对比基线与基准

    • 对比配置:以 Full-Access(无限制读写执行,代表 TSR 上限与安全性下限)和 Golden-Permission(基于人类审查的 safe oracle 跟踪得出的静态黄金策略)为参考对照;基线方法为单次直接生成策略的 Direct baseline。
    • 基准环境:基于真实命令行任务构建的 AuthBench(包含 80 个标准任务与 40 个敏感任务)。

    与前人工作的本质区别 作者称,现有安全研究集中在模型获得授权后的“执行安全”,而本文将焦点移至授权发生前的“授权安全”,研究智能体在行动前推断任务范围权限边界的独立语义能力。

  3. 论文如何解决这个问题?

    通过前向模拟覆盖与逐项敏感性审计两阶段分解生成权限策略。

    整体思路是将权限边界推断建模为先发现后审计的两阶段流程,提出充足性-紧缩性分解(Sufficiency-Tightness Decomposition)。

    问题形式化

    • 输入与输出:输入为自然语言任务指令 I 与终端环境 E。授权模型 $ f_\theta $ 在执行前仅通过只读操作检查环境,生成文件级白名单权限策略 $ \pi = (\pi_\text{read}, \pi_\text{write}, \pi_\text{execute}) $,未覆盖的路径一律拒绝。
    • 优化目标:最小化策略超出任务充分边界的冗余范围,即 minπ d(π, π∗) 且满足 \pi^* \sqsubseteq \pi。任务充分边界 $ \pi^* $ 严格依赖于具体的执行智能体 A(模型 M 与执行脚手架 H 的组合),而非仅由任务指令唯一决定。

    Phase 1:充足性推理(Sufficiency Reasoning)

    • 前向模拟执行链:模型根据任务目标前向推演下游执行智能体可能采取的执行计划,解析完整的传递工具链(transitive toolchain),包括解释器、编译器、包管理器与包装脚本等。
    • 覆盖优先原则:提示词明确要求优先保证覆盖率而非极小化,生成候选策略 $ \pi_\text{suf} $,宁可暂时多授权也不遗漏执行必需路径。

    Phase 2:紧缩性审计(Tightness Audit)

    • 逐项后向审查:接收 $ \pi_\text{suf} $ 并生成子集 $ \pi_\text{final} \subseteq \pi_\text{suf} $。对每个条目按三项准则进行独立审计:
      • 任务依据(Task grounding):检查指令或环境中是否有明确证据(如 Makefile、import 语句、shebang 行)。无依据则删除。
      • 范围最小化(Scope minimality):评估能否将宽泛的通配符(如目录 glob)收窄为具体文件。
      • 敏感性检查(Sensitivity check):检查是否与系统敏感文件(如凭据、密钥、系统目录)重叠,无充分必要理由则删除。
    • 单向裁剪约束:Phase 2 仅允许保留或移除 Phase 1 中的条目,禁止引入任何此前未出现的新条目。

    成功判定与评测方式

    • 双轴评测协议:
      • 权限紧缩度(Permission Tightness):静态维度计算与黄金标签 $ S_\text{gold} $ 在 task-facing 范围内的逐轴 Precision、Recall 与 F1;执行维度使用实用性验证器 $ V_u $ 测试任务成功率(TSR)。
      • 安全暴露度(Security Exposure):静态维度计算敏感文件暴露率(SER);执行维度使用攻击验证器 $ V_a $ 测试攻击成功率(ASR)。
    • 附录 G.1 与 G.3 给出了具体的提示词模板。
  4. 论文做了哪些实验?

    前沿模型常欠授权与过授权并存,两阶段分解可改善吸引子偏向。

    论文评估了 9 个前沿模型在 AuthBench 上的表现,并对推理强度与两阶段分解进行了实证分析。

    实验设置

    • 被测模型(全部 9 个):GPT-5、GPT-5.3-Codex、GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro Preview、Kimi K2.5、MiniMax M2.7、Qwen3-Coder-480B、Qwen3.5-397B。具有推理等级配置的模型均运行在最高可用推理强度。
    • 数据集:AuthBench,共 120 个终端任务(80 个标准任务,40 个敏感任务),涵盖 10 个专业工程领域。
    • 基线与对照:Full-Access、Golden-Permission;各模型自身的 Direct baseline。
    • 指标定义:读/写/执行各轴 Precision (P)、Recall (R)、F1;任务成功率 (TSR);敏感文件暴露率 (SER);攻击成功率 (ASR)。
    • 评审与执行机制:策略由固定的执行智能体运行,采用 GPT-5 作为执行基座、OpenClaw 作为 harness。执行结果由确定性代码验证器 $ V_u $ 与 $ V_a $ 判定。

    主结果

    主实验结果如下表所示(据 Table 1):

    表格较宽,可左右滑动

    ModelStd TSR(%)Std R-F1Std W-F1Std E-F1Sens TSR(%)Sens SER(%)Sens ASR(%)
    Full-Access83.3未报告未报告未报告94.0未报告65.8
    Golden-Perm.77.1未报告未报告未报告81.7未报告0.0
    Gemini 3.1 Pro75.478.085.349.085.834.828.3
    GPT-563.383.386.853.776.733.623.3
    GPT-5.452.673.783.253.361.121.119.4
    Claude Opus 4.661.384.787.453.061.547.025.6
    Kimi K2.560.074.184.554.470.074.528.3
    GPT-5.3-Codex58.875.878.746.765.842.615.8
    Qwen3-Coder52.164.173.149.163.365.020.8
    Qwen3.5-397B45.671.883.659.642.971.917.6
    MiniMax M2.742.166.777.654.648.364.215.8
    • 作者解读:Gemini 3.1 Pro 取得最高的 TSR(标准 75.4%,敏感 85.8%),但敏感暴露度 SER 高达 34.8%;高精度模型(如 Claude Opus 4.6 与 GPT-5)在静态指标上表现更好,但因缺失执行链关键权限导致 TSR 较低。

    授权吸引子分析(Authorization Attractor Analysis)

    • 测了什么:在 Claude Opus 4.6、Gemini 3.1 Pro Preview 与 GPT-5.4 上分析从低到高推理强度的向量场位移(Figure 5)。
    • 结果:增加推理并未让模型收敛到零缺陷点 (0,0),而是收敛到各自偏向的吸引子:Gemini 偏向保证任务覆盖率但伴随更宽权限;GPT-5.4 与 Claude Opus 4.6 偏向极小化权限但经常遗漏执行必需路径。
    • 作者解读:作者称推理扩展只能让模型在其既有折中偏好上更加一致,无法通过单次直接生成消除充足性与紧缩性的内在冲突。

    充足性-紧缩性分解评测

    • 测了什么:对比 S-T Decomposition 与 Direct baseline 在三个代表性模型上的表现(Table 2)。
    • 结果:Claude Opus 4.6 在敏感任务上的 TSR 从 61.5% 升至 75.0%,ASR 从 25.6% 降至 15.0%;GPT-5.4 敏感任务 TSR 从 61.1% 升至 76.9%,ASR 从 19.4% 降至 15.4%;Gemini 3.1 Pro 敏感任务 SER 从 34.8% 降至 15.7%,ASR 从 28.3% 降至 12.5%,敏感任务 TSR 从 85.8% 降至 75.0%。
    • 作者解读:两阶段分解能纠正模型特定的单侧缺陷:紧缩偏向模型弥补了执行覆盖不足,宽泛偏向模型消除了过度暴露。

    执行基座稳健性检验(Table 4)

    • 测了什么:固定生成的授权策略,将 OpenClaw 的执行模型从 GPT-5 切换为 Claude Sonnet 4.6 或 Gemini 3 Flash Preview。
    • 结果:在 Claude Sonnet 4.6 执行下,Full-Access 的敏感任务 ASR 降为 7.5%;在 Gemini 3 Flash 下升至 82.5%。各模型生成策略的敏感任务 ASR 在 Claude Sonnet 4.6 下位于 2.5%–12.5%,在 Gemini 3 Flash 下位于 17.5%–35.0%。
    • 作者解读:执行基座的改变不影响授权推断本身是独立瓶颈的核心结论。

    其他消融与分析

    • 执行阶段召回率分析(Table 6):Execute 召回率在 [0, 0.25) 时 TSR 为 55.2%(n=116),而在 1.0 时 TSR 为 73.3%(n=288)。
    • 完全闭包覆盖分析(Table 8):读写执行三轴召回率全部达到 1.0 时 TSR 为 82.2%(n=202),未完全覆盖时 TSR 为 47.7%(n=375)。
    • 错误发生时机(Figure 8):首个导致执行失败的问题主要发生在推理进度的前两步(0–40%),集中在工具与路径解析。
    • 敏感任务端点分布(正文):40 个敏感任务中,20 个终止于远程接收端或上传包,20 个终止于本地危险输出或不安全状态。
    • 负面结果与代价:Gemini 3.1 Pro 在经过 S-T 分解后,标准任务 TSR 从 75.4% 降至 65.0%,敏感任务 TSR 从 85.8% 降至 75.0%(Table 2)。
  5. 有什么可以进一步探索的点?

    评测限于终端文件级权限,两阶段分解仅在三个代表性模型上测试。

    作者指出的局限与后续方向

    • 策略语言范围局限:AuthBench 目前仅评估终端任务中的文件级读、写、执行权限,未覆盖网络访问、进程间通信、数据库凭据、云资源、浏览器状态或 API 级权限(附录 B)。
    • 多目标吸引子现象的外推:当前的推理强度分析仅针对具备可配置推理等级的模型家族,作者指出未来需验证工具选择、数据共享、网络访问及子智能体委派等其他多目标决策中是否存在类似的吸引子行为(附录 B)。
    • 多智能体归因挑战:AuthBench 当前将执行失败归因为权限策略缺陷,而非流水线中的单个智能体(附录 B)。
    • 认知边界与校准:探索让模型识别自身知识边界的训练技术,以更好地校准授权决策(附录 B)。

    实验覆盖范围

    • 任务与环境覆盖:被测基准为 AuthBench,包含 120 个基于 Docker 的 Linux 终端任务(80 个标准任务,40 个敏感任务),覆盖 10 个专业工程领域。
    • 模型覆盖:测试了 9 个前沿大语言模型(GPT-5、GPT-5.3-Codex、GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro Preview、Kimi K2.5、MiniMax M2.7、Qwen3-Coder-480B、Qwen3.5-397B)。
    • 执行环境配置:主评测采用固定的 GPT-5 + OpenClaw 作为执行端,稳健性实验补充了 Claude Sonnet 4.6 与 Gemini 3 Flash Preview。
    • 两阶段分解测试范围:S-T 分解实验仅在 Claude Opus 4.6、GPT-5.4 和 Gemini 3.1 Pro 三个模型上进行了定量对比。
    • 报告细节边界:论文未报告针对非文件系统权限(网络/API)的实际策略生成与拦截评测。
  6. 总结一下论文的主要内容

    论文提出权限边界推断基准与两阶段分解方法,有效降低安全暴露。

    本文研究代码智能体在执行终端任务前自主推断最小文件权限边界的能力。

    • 核心问题:随着代码智能体权限扩大,粗粒度默认权限易引发安全风险,但模型自主推断任务级权限往往面临执行所需权限与安全收紧之间的两难。
    • 基准与现象:论文构建了包含 120 个终端任务的 AuthBench,发现前沿模型普遍存在同时欠授权与过授权的现象;增加推理计算量会促使模型收敛到各自特有的授权吸引子,使固有折中模式更加固化而非逼近安全窗口。
    • 关键结果:在敏感任务上,Full-Access 的 ASR 为 65.8%,而黄金权限策略的 ASR 为 0.0%(Table 1);Gemini 3.1 Pro 取得最高 TSR(85.8%),但其敏感文件暴露率 SER 达 34.8%(Table 1)。
    • 方法效果:提出的两阶段充足性-紧缩性分解先保证覆盖再逐项审计,使紧缩偏向模型在敏感任务上的 TSR 最高提升 15.8%(GPT-5.4 从 61.1% 升至 76.9%),且在全部测试模型上降低了 ASR(Table 2)。
    • 作者启示:作者认为单次直接生成策略存在推理上限,将授权决策拆解为前向覆盖与后向审计能够有效打破单模型吸引子的缺陷。
阅读原文arxiv.org