跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 4 篇

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv:2610.04375 ·

    论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案

    提出IEC协议与IntAct,定位并修复工具调用执行路径的静默篡改

    测试
    qwen3-coder-plus、Qwen2.5-Coder-32B、Qwen2.5-72B 等 4 个应用层
    摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。
    • 研究定位:针对大语言模型智能体工具调用在底层执行路径中的保真度问题,论文界定了意图-执行对应性概念,提出了无执行偏离检测协议 IEC 与跳级修复框架 IntAct。
    • 核心问题:命令在宿主包装器、Shell解析、进程接口等多跳传输中常遭隐蔽篡改,现有评测默认调用按原样执行,导致大量路径缺陷被系统性误归因于大语言模型。
    • 方法设计:IEC协议利用无害见证探针与接收端自身解析器,在不执行命令的前提下定位首偏离跳;IntAct根据定名跃点采用无解析通道(如文件注入、参数转义、Base64编码)进行针对性渲染交付,或对超域调用予以安全拒绝。
    • 关键实验结果:
      1. 生产会话中10.0%的暴露Shell调用被路径篡改,Claude Code的Bash工具在传输长文本或代码时篡改率达12.0%,且80.7%的反斜杠合并故障未报任何错误(Figure 3a、Figure 3b)。
      2. 传统轨迹评测将95.1%的生产失败误判为模型责任,而IEC协议与人工归因的一致性达到 Cohen's kappa 0.77(Table 5)。
      3. 在固定动作回放下,IntAct恢复了IEC-Bench中79.2%发生调用变更的失败任务(Table 1);带智能体闭环测试中,将通过任务的平均Token消耗降低2.4倍(Table 7)。
    • 作者结论与启示:作者认为工具调用能否正确执行主要取决于启动路径而非大模型本身,智能体框架必须按跃点顺序开展逐跳工程测试,同时基准评测应固定并报告启动路径以保证模型评分的公平性。
    完整解读
  2. 分析与理论arXiv:2610.06191 ·

    研究:工具型智能体判断结果无用却仍继续检索,强制整合步骤可纠正

    分析检索智能体判定结果无用后仍不停止检索的整合失败

    测试
    Qwen2.5-7B、Llama-3.1-8B、Qwen3-8B 等 7 个应用层
    场景
    AI Agent
    摘要论文揭示智能体判定工具失效却无法转化为停止行动,证实通过框架规则强制整合判定可提升表现。

    本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。

    完整解读
  3. 分析与理论arXiv:2610.06001 ·

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    提出AgentSpy,在系统调用层观测编程智能体并检测技能注入攻击

    测试
    gpt-5.6-terra、deepseek-v4-flash、glm-5.3-flash 等 4 个应用层
    摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。

    本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。

    完整解读
  4. 可解释性arXiv:2610.02702 ·

    研究:LLM 智能体顺从多数时内部仍保留原有前提

    用J-lens检测屈从多数的智能体是否仍表征原前提

    测试
    Qwen3.5-4B、Qwen3.6-27B、Gemma-4-E4B-it 等 4 个模型层
    摘要揭示LLM智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。
    • 定位与核心问题:论文通过机械可解释性方法,研究多智能体辩论中向多数屈从的大语言模型是否在内部仍然表征其原始推导前提(静默异见,Silent Dissent),从而检验辩论收敛是否夸大了群体真实认同。
    • 方法要点:设计双跳事实阿施式同伴压力任务,使中间实体(bridge)在对话全程不出现;采用预注册协议,在回答起始 token 处通过 Jacobian lens(J-lens)与 logit lens 从残差流中提取 bridge 的词表投影排名,并配合消融实验与激活方向注入。
    • 主要发现 1(静默异见现象):在 3 个同伴施加错误答案压力下,Qwen3.5-4B、Qwen3.6-27B 和 Gemma-4-E4B-it 中屈从多数的智能体在预注册层仍表征原 bridge,J-lens 读出值分别为 0.852、0.223 和 0.237,而同一记录下 logit lens 读出值均在 0.06 以下(Table 2)。
    • 主要发现 2(前提计算的独立性):当把智能体历史回答隐藏时,4 款模型中屈从多数的智能体均读出原 bridge(读出值 0.254 至 0.434,Table 3),表明该前提可由输入问题独立推导,无需回读自身陈述;同时隐藏回答使 Qwen3.5-4B 的屈从率从 8% 升至 89%。
    • 主要发现 3(因果干预与潜在投票):沿 J-lens 方向注入原 bridge 特征可使 Qwen3.5-4B 和 Qwen3.6-27B 恢复原答案的比例分别达 41% 和 19%,但在 Gemma 和 Llama 上未见恢复(Figure 3);在自由辩论中,基于 J-lens 潜在表征的多数投票准确率并未普遍优于直接表态投票。
    • 作者结论与启示:作者认为多智能体辩论达成的表态共识可能会夸大真实一致性,智能体在屈从多数时内部仍可能计算正确前提;协议是否向智能体展示其历史发言会影响共识的稳定性,但潜在表征读取更适合用于监测异见而非替代表态投票规则。
    完整解读
已经到底了