跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 6 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 3 篇还没打标签,不在筛选结果里。

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv:2610.04375 ·

    论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案

    提出IEC协议与IntAct,定位并修复工具调用执行路径的静默篡改

    测试
    qwen3-coder-plus、Qwen2.5-Coder-32B、Qwen2.5-72B 等 4 个应用层
    摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。
    • 研究定位:针对大语言模型智能体工具调用在底层执行路径中的保真度问题,论文界定了意图-执行对应性概念,提出了无执行偏离检测协议 IEC 与跳级修复框架 IntAct。
    • 核心问题:命令在宿主包装器、Shell解析、进程接口等多跳传输中常遭隐蔽篡改,现有评测默认调用按原样执行,导致大量路径缺陷被系统性误归因于大语言模型。
    • 方法设计:IEC协议利用无害见证探针与接收端自身解析器,在不执行命令的前提下定位首偏离跳;IntAct根据定名跃点采用无解析通道(如文件注入、参数转义、Base64编码)进行针对性渲染交付,或对超域调用予以安全拒绝。
    • 关键实验结果:
      1. 生产会话中10.0%的暴露Shell调用被路径篡改,Claude Code的Bash工具在传输长文本或代码时篡改率达12.0%,且80.7%的反斜杠合并故障未报任何错误(Figure 3a、Figure 3b)。
      2. 传统轨迹评测将95.1%的生产失败误判为模型责任,而IEC协议与人工归因的一致性达到 Cohen's kappa 0.77(Table 5)。
      3. 在固定动作回放下,IntAct恢复了IEC-Bench中79.2%发生调用变更的失败任务(Table 1);带智能体闭环测试中,将通过任务的平均Token消耗降低2.4倍(Table 7)。
    • 作者结论与启示:作者认为工具调用能否正确执行主要取决于启动路径而非大模型本身,智能体框架必须按跃点顺序开展逐跳工程测试,同时基准评测应固定并报告启动路径以保证模型评分的公平性。
    完整解读
  2. 防御arXiv:2609.12001 ·

    Pheo 提出 OATS:用确定性解析器在运行时治理 Agent 技能动作

    提出OATS,用确定性解析器在运行时治理技能动作

    测试
    Claude Sonnet 5、GPT-5.5、gpt-5-mini 等 4 个应用层
    摘要论文论证了发布时恶意扫描无法替代运行时动作许可控制,提出了轻量确定性控制门OATS,展示了双层防御组合的必要性。
    • 定位与核心问题:本研究针对AI智能体技能生态中“发布时恶意检测”无法解决“具体机器上运行时权限许可”的问题,论证了动作级运行时控制的必要性并设计了轻量级防御系统。
    • 方法架构:作者设计了OATS运行时控制门,核心包含一个67.6 ms端到端延迟的确定性解析器(将shell命令映射到33个后果类,对无匹配项兜底拦截,决策路径无模型),一个基于(资源,后果类)二元组的分车道信任账本(13个高危类永不晋升),以及基于零失误二项分布反演的操作员风险容忍度晋升阈值模型。
    • 关键发现一:良性与许可的正交性:在ClawHub的66,192个技能中,29,257个被所有扫描器和法官评为clean的技能里,有705个技能(来自135家独立发布商)包含CIS Control 2.7等规范禁止的未授权或远程执行指令,人工审计显示其精确率为92.0%且无恶意意图标记。
    • 关键发现二:静态审查与动态执行脱节:在Claude Sonnet 5实机运行的39个clean技能中,仅1.4%的执行命令与文档字面完全一致,34.7%的命令后果类别从未在文档代码块中出现;在53个包含违规指令的clean技能中,智能体在23个技能里实际发起了违规操作,OATS对这23次动作实现了100%拦截或挂起。
    • 关键发现三:单命令防御的边界:在语义保持重写对抗基准上,解析器对包装与链式调用的识别率为100%,但在跨命令拆解、引号混淆等手段下整体宏平均解析率仅为52%,显示出无状态单命令匹配的局限。
    • 作者结论与启示:作者认为发布前制品扫描与运行时动作控制属于正交互补层,分别回答“制品是否恶意”与“操作是否许可”,任何一层均无法单独解决智能体安全问题;应将注册表扫描结果作为运行时账本的输入而非竞争替代品。
    完整解读
  3. 防御arXiv:2610.02664 ·

    论文提出 GHOST:长程智能体在良性对话中遗忘早期安全约束,GPT-5.5 发生率 11.5%

    提出STAR-Guard双层防御缓解长程智能体遗忘安全约束

    测试
    GPT-5.5、DeepSeek-V4-Pro、GLM-5.2 等 7 个应用层
    场景
    AI Agent
    摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。
    1. 针对长程工具使用智能体在多轮良性交互中遗忘先前安全约束的失效现象,形式化定义了跨轮安全约束忽略治理危害(GHOST),并构建了可执行评测基准 SCARBench。
    2. 核心问题在于智能体在多轮对话中能够恢复历史任务,但早先设定的前置要求或操作禁令容易脱离治理,导致不可逆的违规执行。
    3. 理论分析表明,若残留条件违规风险存在非可和下界,智能体轨迹几乎必然进入危险区域;据此提出 STAR-Guard 防御框架,耦合在线约束解析语义恢复与运行时确定性审计拦截。
    4. SCARBench 评测显示,在良性长上下文中 GPT-5.5 的严格 GHOST 率达 11.5%,Qwen3.5-4B 达 27.8%(Table 1);长历史在所有模型上均放大了安全约束恢复损失(Figure 3)。
    5. 引入 STAR-Guard 后,GPT-5.5 的安全完成率从 76.3% 提升至 94.0%,且未出现任何违规完成与 GHOST 事件(Table 2);在 Qwen3.5-4B 上将安全完成率由 47.0% 提高到 81.2%,显著超越各非 Oracle 基线。
    6. 作者认为,上下文增长会实质性削弱长程智能体对历史安全约束的治理效能,仅靠通用大模型检索或提示提醒难以保障安全,需将概率性语义恢复与执行前确定性规则屏障相结合。
    完整解读
  4. 防御arXiv:2609.33039 ·

    TACIT:从 LLM 内部状态检测 Agent 轨迹危害

    提出TACIT,读取冻结隐藏状态以检测智能体有害轨迹

    测试
    Qwen3Guard-4B、LlamaGuard3-8B、AgentDoG-4B 等 9 个应用层
    场景
    AI Agent
    摘要提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。
    • 研究定位:该研究针对工具调用智能体的轨迹安全检测难题,从表征分析出发,系统探讨了 Guard 模型在识别“不安全工具使用”时的内部机制与输出失效现象,并据此设计了基于内部表征读取的安全检测方法 TACIT。
    • 核心问题:现有开源 Guard 模型主要面向单轮文本内容审核,而在多步智能体轨迹中,不安全行为往往取决于动作与上下文/工具模式的不匹配;此类不安全工具调用在现有 Guard 模型的输出端难以被有效区分(Section 1、3.1)。
    • 方法要点:通过受控实验发现不安全工具使用与有害内容在中间隐藏层线性可读且几何方向近乎正交;TACIT 利用冻结骨干网络单次前向传递提取各层表征并进行池化,通过在中间层训练轻量线性探针、集成或多层显著特征聚合分类器输出安全评分,无需更新骨干参数且完全不产生自回归解码(Section 3、4.1)。
    • 核心实验结果:
      • 在 6 个主流轨迹安全基准测试中,Qwen3-4B 骨干上的 TACIT Multi-layer 取得 86.2% 的平均 macro-F1,大幅超越专用的 AgentDoG-4B(62.3%)与内容 Guard 基线(Table 1)。
      • 在完全排除目标基准的留一泛化测试中,Qwen3-4B 的 Multi-layer 取得 65.7% 的平均 macro-F1,依然领先于基线(Table 2)。
      • 在相同数据和骨干控制下,冻结表征读取的效果与全量参数微调(84.2%)相当,且在微调模型上叠加 Multi-layer 读取可进一步提升至 86.5%(Table 6)。
      • TACIT 线性探针训练参数量仅 5,121 个,单条轨迹检测耗时仅 40ms,较 Qwen3Guard(215ms)延迟降低 82%(Figure 4)。
    • 启示与结论:作者称内部表征为检测智能体轨迹危害提供了实用的基础;未来需构建系统覆盖工具使用与有害内容两类正交风险的专用基准,并深入探索动作边界上的流式干预机制(Section 5.3、6)。
    完整解读
  5. 防御arXiv:2609.38983 ·

    论文提出 Approval Laundering 分类,实测 Claude Code 审批与执行绑定失败

    提出Approval Token绑定编程智能体的审批与执行

    测试
    Claude Code (v2.1.197, opus[1m] / claude-sonnet-5-ccmax)、Codex CLI (@openai/codex v0.154.0)应用层
    摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。
    • 核心定位:该研究系统分析并测试了 AI 编程智能体套件中人类审批与底层工具执行之间的凭证绑定完整性断裂问题。
    • 问题剖析:当前套件假定人类批准动作与实际执行动作等价,但在六个凭证表面(范围、参数、会话、工具、委托身份及审批渲染)上,这一假设会因套件匹配逻辑或系统级副作用被静默破坏,导致无需重新审批即可派发越权操作。
    • 核心设计:作者构建了审批洗白六维分类学,提出基于 HMAC-SHA256 的七字段带密钥权能凭证 Approval Token,通过 PreToolUse 钩子对准入字段进行调用级拦截与重验。
    • 关键实验结果:
      • 基线评测中,Claude Code 在 Scope、Temporal(BGR 均为 1.000)和 Delegation(BGR = 0.947)上表现出高频洗白失效,Argument 洗白发生率为 0.450,PATH 劫持工具洗白达到 1.000,仅跨工具名替换被原生拦截(BGR = 0.000)。
      • 防御评估中,Approval Token 在 118 次离线重放中将 Delegation 和 Temporal 洗白降至 0.000(p < 0.0001),并在 6/6 实时测试中完成拦截;但因仅检查字段记录,对通过子进程和钩子触发的效果偏离(Scope 和 Argument)完全无法消除。
    • 启示与结论:作者指出单纯依赖工具调用边界的字段比对无法防范环境级副作用引起的执行偏离,工具安全机制必须向执行环境初始效果验证深化;同时对 Codex CLI 的探测揭示部分无头套件完全缺乏调用级审批抽象。
    完整解读
  6. 评测与基准arXiv:2609.08258 ·

    研究实测五套 Agent 记忆系统均不执行撤销标记

    评测智能体记忆软撤回是否生效,并提出陈旧检索防护

    测试
    GPT-5.5、Grok-4、DeepSeek-V4-Flash 等 9 个应用层
    场景
    AI Agent
    摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。
    • 研究定位:该研究首次系统性实证评估了多款主流大语言模型智能体记忆框架在软撤回机制下的运行时安全边界与撤回执行有效性。
    • 核心问题:现代记忆系统普遍采用将陈旧知识标记为无效而非物理删除的软撤回设计,但默认检索机制是否会在读取时拦截失效记录、避免智能体依据作废策略采取危险操作,此前未有深入验证。
    • 评测与防御设计:研究在直接与间接两种插入模式下向 5 款记忆系统写入作废与替代策略,跨越 9 个模型评估其检索暴露与不安全决策表现;针对系统未默认过滤的现状,提出了在检索返回路径进行元数据校验与成对冲突检测的 Stale-Retrieval Guard 组件。
    • 主要实验发现:直接写入且无防御时,两款暴露系统(Graphiti与mem0 exp.)将作废记录全部返回且排在首位,导致智能体平均在 43.1%(699/1,620)的试验中执行不安全行动(Table 6);即使提示词明确禁止危险操作,模型不安全率仍有 12.9%(Table 8);存储级过滤虽能在单次交互中将不安全率归零,但在智能体将决策回写记忆库后,3 跳内的不安全率迅速反弹至 83.1%(Table 14)。
    • 作者结论与启示:作者指出记忆系统的安全盲区并非源于外部投毒或数据来源伪造,而是内部合规生命周期中缺乏检索时有效性校验;仅依赖写入来源证明或模型提示词无法抵御作废策略,必须在读取管道上强制实施严格的陈旧记录过滤。
    完整解读
已经到底了