跳到正文
10月8日 · 周四

Anthropic · 论文

找到 2 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 分析与理论arXiv:2610.04375 ·

    论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案

    提出IEC协议与IntAct,定位并修复工具调用执行路径的静默篡改

    测试
    qwen3-coder-plus、Qwen2.5-Coder-32B、Qwen2.5-72B 等 4 个应用层
    摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。
    • 研究定位:针对大语言模型智能体工具调用在底层执行路径中的保真度问题,论文界定了意图-执行对应性概念,提出了无执行偏离检测协议 IEC 与跳级修复框架 IntAct。
    • 核心问题:命令在宿主包装器、Shell解析、进程接口等多跳传输中常遭隐蔽篡改,现有评测默认调用按原样执行,导致大量路径缺陷被系统性误归因于大语言模型。
    • 方法设计:IEC协议利用无害见证探针与接收端自身解析器,在不执行命令的前提下定位首偏离跳;IntAct根据定名跃点采用无解析通道(如文件注入、参数转义、Base64编码)进行针对性渲染交付,或对超域调用予以安全拒绝。
    • 关键实验结果:
      1. 生产会话中10.0%的暴露Shell调用被路径篡改,Claude Code的Bash工具在传输长文本或代码时篡改率达12.0%,且80.7%的反斜杠合并故障未报任何错误(Figure 3a、Figure 3b)。
      2. 传统轨迹评测将95.1%的生产失败误判为模型责任,而IEC协议与人工归因的一致性达到 Cohen's kappa 0.77(Table 5)。
      3. 在固定动作回放下,IntAct恢复了IEC-Bench中79.2%发生调用变更的失败任务(Table 1);带智能体闭环测试中,将通过任务的平均Token消耗降低2.4倍(Table 7)。
    • 作者结论与启示:作者认为工具调用能否正确执行主要取决于启动路径而非大模型本身,智能体框架必须按跃点顺序开展逐跳工程测试,同时基准评测应固定并报告启动路径以保证模型评分的公平性。
    完整解读
  2. 防御arXiv:2609.38983 ·

    论文提出 Approval Laundering 分类,实测 Claude Code 审批与执行绑定失败

    提出Approval Token绑定编程智能体的审批与执行

    测试
    Claude Code (v2.1.197, opus[1m] / claude-sonnet-5-ccmax)、Codex CLI (@openai/codex v0.154.0)应用层
    摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。
    • 核心定位:该研究系统分析并测试了 AI 编程智能体套件中人类审批与底层工具执行之间的凭证绑定完整性断裂问题。
    • 问题剖析:当前套件假定人类批准动作与实际执行动作等价,但在六个凭证表面(范围、参数、会话、工具、委托身份及审批渲染)上,这一假设会因套件匹配逻辑或系统级副作用被静默破坏,导致无需重新审批即可派发越权操作。
    • 核心设计:作者构建了审批洗白六维分类学,提出基于 HMAC-SHA256 的七字段带密钥权能凭证 Approval Token,通过 PreToolUse 钩子对准入字段进行调用级拦截与重验。
    • 关键实验结果:
      • 基线评测中,Claude Code 在 Scope、Temporal(BGR 均为 1.000)和 Delegation(BGR = 0.947)上表现出高频洗白失效,Argument 洗白发生率为 0.450,PATH 劫持工具洗白达到 1.000,仅跨工具名替换被原生拦截(BGR = 0.000)。
      • 防御评估中,Approval Token 在 118 次离线重放中将 Delegation 和 Temporal 洗白降至 0.000(p < 0.0001),并在 6/6 实时测试中完成拦截;但因仅检查字段记录,对通过子进程和钩子触发的效果偏离(Scope 和 Argument)完全无法消除。
    • 启示与结论:作者指出单纯依赖工具调用边界的字段比对无法防范环境级副作用引起的执行偏离,工具安全机制必须向执行环境初始效果验证深化;同时对 Codex CLI 的探测揭示部分无头套件完全缺乏调用级审批抽象。
    完整解读
已经到底了