跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 5 篇

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv:2610.09667 ·

    东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核

    揭示推理模型用标识符规则替代随机抽样,使审计可被预测

    测试
    GPT-6 Sol、GPT-6 Luna、GPT-5.4 mini 等 6 个模型层
    摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。
    • 研究定位:该研究评估了推理大语言模型智能体在利用输入标识符实现随机选择时的行为规律及其安全隐患。
    • 核心问题:当智能体被要求执行概率选择(如资源分配或人工审计抽检)时,是否会将上下文中的结构化标识符作为伪随机源并应用确定性数学规则,从而在群体中诱发决策相关性与审计失效。
    • 方法设计:作者基于 El Farol 博弈构建四智能体二元参与任务,并构建 1% 目标的人工审计任务,在六款前沿推理模型上测试阈值规则与整除规则,进一步操控标识符结构(如 UUIDv7 时间戳)、字段标签及外部随机数输入。
    • 主要实验发现:
      1. 单智能体测试中,GPT-6 Sol 与 Gemini 3.8 Flash 在 64 个设计标识符上表现出阈值规则(效应值 0.62 至 0.80),而关闭推理后该效应降至 0.08 以下(Table 1, Study 1)。
      2. 群体任务中,共享单一标识符使 Sol 和 Gemini 的全员一致率分别升至 91% 和 88%,群体损失升至 0.211 和 0.192,达独立抽样参考值的 3.5 至 3.8 倍;UUIDv7 的共同时间戳更导致参与率超过 0.93(Extended Data Table 4, Study 2)。
      3. 审计任务中,Sol 对 1,008 条普通 UUIDv4 请求的抽查率虽为 0.89%,但抽中的 9 条全部符合标识符低位规则,其余 989 条无一被抽检;而 Gemini 抽取为 0,Claude 仅抽取 2 条(Figure 4, Study 5)。
      4. 显式添加独立随机选择提示无法消除相关性,但在输入中直接提供外部均匀随机数时,四款模型在 1,004 至 1,008 次回答中均严格遵循该随机数进行决策(Table 1, Study 7)。
    • 作者结论与启示:作者认为,个体选择率符合预期无法掩盖输入依赖引发的集体脆弱性;对 AI 智能体的评测必须将校准度、相关性与可预测性分开检验;在安全敏感场景中,应由可信代码生成并显式传入外部随机性,而非依赖模型自行解释上下文。
    完整解读
  2. 分析与理论arXiv:2610.04375 ·

    论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案

    提出IEC协议与IntAct,定位并修复工具调用执行路径的静默篡改

    测试
    qwen3-coder-plus、Qwen2.5-Coder-32B、Qwen2.5-72B 等 4 个应用层
    摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。
    • 研究定位:针对大语言模型智能体工具调用在底层执行路径中的保真度问题,论文界定了意图-执行对应性概念,提出了无执行偏离检测协议 IEC 与跳级修复框架 IntAct。
    • 核心问题:命令在宿主包装器、Shell解析、进程接口等多跳传输中常遭隐蔽篡改,现有评测默认调用按原样执行,导致大量路径缺陷被系统性误归因于大语言模型。
    • 方法设计:IEC协议利用无害见证探针与接收端自身解析器,在不执行命令的前提下定位首偏离跳;IntAct根据定名跃点采用无解析通道(如文件注入、参数转义、Base64编码)进行针对性渲染交付,或对超域调用予以安全拒绝。
    • 关键实验结果:
      1. 生产会话中10.0%的暴露Shell调用被路径篡改,Claude Code的Bash工具在传输长文本或代码时篡改率达12.0%,且80.7%的反斜杠合并故障未报任何错误(Figure 3a、Figure 3b)。
      2. 传统轨迹评测将95.1%的生产失败误判为模型责任,而IEC协议与人工归因的一致性达到 Cohen's kappa 0.77(Table 5)。
      3. 在固定动作回放下,IntAct恢复了IEC-Bench中79.2%发生调用变更的失败任务(Table 1);带智能体闭环测试中,将通过任务的平均Token消耗降低2.4倍(Table 7)。
    • 作者结论与启示:作者认为工具调用能否正确执行主要取决于启动路径而非大模型本身,智能体框架必须按跃点顺序开展逐跳工程测试,同时基准评测应固定并报告启动路径以保证模型评分的公平性。
    完整解读
  3. 分析与理论arXiv:2610.06191 ·

    研究:工具型智能体判断结果无用却仍继续检索,强制整合步骤可纠正

    分析检索智能体判定结果无用后仍不停止检索的整合失败

    测试
    Qwen2.5-7B、Llama-3.1-8B、Qwen3-8B 等 7 个应用层
    场景
    AI Agent
    摘要论文揭示智能体判定工具失效却无法转化为停止行动,证实通过框架规则强制整合判定可提升表现。

    本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。

    完整解读
  4. 分析与理论arXiv:2610.06001 ·

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    提出AgentSpy,在系统调用层观测编程智能体并检测技能注入攻击

    测试
    gpt-5.6-terra、deepseek-v4-flash、glm-5.3-flash 等 4 个应用层
    摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。

    本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。

    完整解读
  5. 分析与理论arXiv:2610.01535 ·

    论文:安全路由评测在分布偏移下失效,基线选取偏差被低估

    分析分布偏移下安全路由评测的基线选择偏差与虚假下限

    测试
    claude-3-5-sonnet、claude-3-opus、claude-sonnet-4-6 等 12 个应用层
    摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。
    • 论文定位:论文系统评估了多模型安全路由与基于信号的防御机制在分布偏移下的有效性,指出流行评测中后验选择基准所造成的评估误导。
    • 要解决的问题:传统路由评估常在测试数据上事后挑选最佳单模型,在分布偏移下为固定基线注入了人为优势,构成了 deployer 无法实现的虚假下限。
    • 关键方法:提出在训练折严格冻结基准模型与收缩因子的诚实留出协议;推导超额危害分解与多维门槛表面;在智能体与技能注入环境中测试预执行路由上限、自适应模板攻击与动作级策略。
    • 核心实验发现:
      1. 在 HELM Safety 类别留出下,后验基准的选择代价为 0.045 至 0.113(Table II),与路由全额劣势相当;在平稳划分下仅为 0.003 至 0.030。
      2. 在诚实基准下,路由器在 82% 至 91% 的池单元中直接收缩为固定基准模型,危害差异中位数为 0.0000(Section IV)。
      3. AgentDojo 智能体网格中预执行路由预言机增益至多 0.0105(E43)。
      4. 针对性自适应攻击使 gpt-5.4 表达性标记率下降 19.6 点(E54b),使门控控制器的有效性取决于后备模型漏洞。
      5. 四项动作级防御测试取得 0/130 判定成功,但模式对齐后有效样本仅 10 个(Clopper–Pearson 上界 0.308,Table XVI),且未见机械强制阻断标记。
    • 作者结论与启示:作者认为安全路由在应对未见类别时的防御收益微弱,安全评估必须使用未见测试标签的诚实基准并公布成对数据;防御重心应从脆弱的输入分类转向外部动作级强制隔离。
    完整解读
已经到底了