跳到正文
10月8日 · 周四

Agent 安全 · 论文

精选论文 133 篇
  1. 分析/可解释性arXiv:2610.09667 · 58

    东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核

    作者测试六款推理模型发现,模型依据ID数值或整除规则决策,导致共享ID时群体决策相关且审计审查具有可预测性。

    • 0.211GPT-6 Sol在群体任务共享agent_id时的群体损失(Study 2)
    • 0.385GPT-6 Sol在群体任务UUIDv7条件下的群体损失(Study 2)
    • 0.89%GPT-6 Sol在审计任务普通UUIDv4下的审查率,目标1%(Study 5)
    6 问速览探讨推理智能体在随机选择中利用标识符确定性规则,如何引发群体决策相关与审计预测漏洞。
    1. 这篇论文试图解决什么问题?

      探讨推理智能体在随机选择中利用标识符确定性规则,如何引发群体决策相关与审计预测漏洞。

    2. 有哪些相关研究?

      涵盖大语言模型随机性偏差、算法单一文化与隐式协调,以及系统标识符规范和 AI 监督控制协议。

    3. 论文如何解决这个问题?

      通过形式化群体损失、测定单智能体阈值与余数规则,设计标识符结构与审计任务检验输入依赖性。

    4. 论文做了哪些实验?

      测试了六款模型在群体与审计任务下的表现,共享标识符使损失上升数倍,外部随机数可规范决策。

    5. 有什么可以进一步探索的点?

      作者指出研究仅停留在闭源模型单次运行的行为层面,未测试自适应攻击者与实际系统环境。

    6. 总结一下论文的主要内容

      研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。

    完整解读
  2. 分析/可解释性arXiv:2610.04375 · 59

    论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案

    作者提出IEC协议与IntAct,发现工具调用经执行路径多跳易被静默篡改,修复对应跳后在IEC-Bench恢复79.2%失败。

    • 12.0%生产会话中Claude Code Bash工具传输代码/转义/长文本时的changed-call rate(Table 2)
    • 80.7%生产会话中反斜杠对被合并的Bash调用中未报错静默执行错误动作的比例(Figure 3b)
    • 0.77IEC协议在102个生产调用失败归因中与人工标注的一致性Cohen's kappa(Table 5)
    6 问速览工具调用在执行路径各跳中常遭隐蔽篡改,现有分析误将路径故障归咎于模型,缺乏跨跳观测与修复机制。
    1. 这篇论文试图解决什么问题?

      工具调用在执行路径各跳中常遭隐蔽篡改,现有分析误将路径故障归咎于模型,缺乏跨跳观测与修复机制。

    2. 有哪些相关研究?

      现有工作集中于轨迹级失败归因、自纠错与单跳包装器分析,缺乏对多跳执行路径的无执行观测与系统性跳级修复。

    3. 论文如何解决这个问题?

      定义意图-执行对应性,利用见证机制与接收端解析器无执行定位首偏离跳,通过IntAct在对应跳实施通道渲染与拒绝。

    4. 论文做了哪些实验?

      覆盖生产会话、公共基准与注入测试,所测10种框架均出现跳级篡改,IntAct在固定动作下恢复79.2%的变更失败。

    5. 有什么可以进一步探索的点?

      作者指出需扩展终端键入测量与兼顾框架权限系统,当前实验主要覆盖具备解析器的跃点类型与特定评测配置。

    6. 总结一下论文的主要内容

      论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。

    完整解读
  3. 分析/可解释性arXiv:2610.06191 · 56

    研究:工具型智能体判断结果无用却仍继续检索,强制整合步骤可纠正

    在检索失效实验中,7个智能体判定结果无用达97–100%却多耗尽预算,框架强制连续5次无用即答使各模型成功率上升。

    • 97–100%7个模型在HotpotQA与FEVER侧信道将失效结果判为无用的比例(正文§3)
    • 1/292HotpotQA持续失效下,无干预Qwen3-8B连续5次判为无用后作答的问题比例(Figure 1)
    • +0.097HotpotQA test300上,强制规则相比无干预使Claude Haiku 4.5 mean6提升值(Table 15)
    6 问速览探究工具检索连续失效时,智能体能否识别无效证据并将判定转化为停止检索动作。
    1. 这篇论文试图解决什么问题?

      探究工具检索连续失效时,智能体能否识别无效证据并将判定转化为停止检索动作。

    2. 有哪些相关研究?

      梳理不可靠工具、搜索停止机制、智能体弃权及知行差距四类相关工作与对比。

    3. 论文如何解决这个问题?

      通过受控失效环境分离判定、信念与动作,设计时间匹配对比量并引入框架强制整合规则。

    4. 论文做了哪些实验?

      实验表明智能体准确判定失效却鲜少主动停止,框架强制整合规则使多模型成功率上升。

    5. 有什么可以进一步探索的点?

      作者指出合成替换失效、阈值设定、自报告测量及记忆错误等局限,未来需探索真实自然失效。

    6. 总结一下论文的主要内容

      论文揭示智能体判定工具失效却无法转化为停止行动,证实通过框架规则强制整合判定可提升表现。

    完整解读
  4. 分析/可解释性arXiv:2610.06001 · 57

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    AgentSpy 在微虚拟机中监控智能体系统调用与流量,在通过测试的任务中发现 18.2% 存在无关活动。

    • 92.2%同任务重复运行集合相似度高于混入异任务集合的比例(全部 3 个模型,RQ1)
    • 18.2%通过全部测试的任务中被判定存在与任务无关活动的比例(RQ2,Table 3)
    • 17.0%通过全部测试的任务中被判定未遵循技能指导达成结果的比例(RQ2,Table 3)
    6 问速览智能体轨迹记录不完整且缺乏底层可见性,提出系统级外部监控框架以分析行为合规与安全。
    1. 这篇论文试图解决什么问题?

      智能体轨迹记录不完整且缺乏底层可见性,提出系统级外部监控框架以分析行为合规与安全。

    2. 有哪些相关研究?

      梳理了轨迹分析、系统级可观测性以及技能安全检查,定位为免 LLM 介入的系统级运行时分析。

    3. 论文如何解决这个问题?

      利用 Firecracker 微虚拟机记录系统调用,构建资源星型图与确定性安全规则进行离线分析。

    4. 论文做了哪些实验?

      在 77 个任务及 5 类注入攻击上验证,发现 18.2% 全通任务有无关行为,安全检测精确率 1.00。

    5. 有什么可以进一步探索的点?

      作者指出了高频调用排除、规则偏通用及框架模型数量有限等局限;实验未覆盖其他执行框架。

    6. 总结一下论文的主要内容

      提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。

    完整解读
  5. 分析/可解释性arXiv:2610.04125 · 55

    研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制

    研究表明大模型风险自述与行为由近正交表征控制,反向组合向量在四模型中诱导 69–89% 言行不一。

    • 32%任务指令向量在消除表面捷径特征后的行为效应保留率(DerSimonian-Laird 池化)
    • 42.1自身决策向量在 16 个行为单元格中的中位数摆幅(对照 SD)
    • 69–89%四模型反向组合向量诱导抗连贯状态的比例区间
    6 问速览探究大模型自我报告与实际行为的脱节是提示词表象还是内部表征事实。
    1. 这篇论文试图解决什么问题?

      探究大模型自我报告与实际行为的脱节是提示词表象还是内部表征事实。

    2. 有哪些相关研究?

      梳理大模型人格心理测量、激活导向与概念擦除三类相关研究并确立对比基线。

    3. 论文如何解决这个问题?

      设计 4 类 9 种导向向量,配合正交投影消融与正负加权混合实现因果分析。

    4. 论文做了哪些实验?

      多模型实验证实特质导向无法改变行为,正交组合可诱发 69–89% 言行不一。

    5. 有什么可以进一步探索的点?

      作者指出局限在于单一构念、单步决策及中型开源模型,未覆盖多步智能体。

    6. 总结一下论文的主要内容

      论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。

    完整解读
  6. 分析/可解释性arXiv:2610.02702 · 56

    研究:LLM 智能体顺从多数时内部仍保留原有前提

    用J-lens检测辩论中屈从多数的LLM,发现多模型内部仍表征原bridge(如Qwen3.5-4B读出达0.852)。

    • 0.852Qwen3.5-4B测试集屈从智能体原bridge的J-lens读出均值(Table 2)
    • 0.223Qwen3.6-27B测试集屈从智能体原bridge的J-lens读出均值(Table 2)
    • 0.237Gemma-4-E4B-it测试集屈从智能体原bridge的J-lens读出均值(Table 2)
    6 问速览探究多智能体辩论中向多数屈从的LLM是否在内部仍表征其原始推理前提。
    1. 这篇论文试图解决什么问题?

      探究多智能体辩论中向多数屈从的LLM是否在内部仍表征其原始推理前提。

    2. 有哪些相关研究?

      涵盖多智能体辩论收敛性、LLM从众与阿施效应、以及机理解释与J-lens潜在推理分析。

    3. 论文如何解决这个问题?

      通过双跳事实隐藏中间实体,用J-lens从残差流读取未表述前提,结合预注册层区间与激活干预。

    4. 论文做了哪些实验?

      在4款模型上测试预注册假设,3款模型证实静默异见,隐藏回答使全部模型读出原前提。

    5. 有什么可以进一步探索的点?

      作者指出因果干预局限、样本仅占已知事实3%–9%等局限;实验覆盖4个开源模型及特定双跳事实。

    6. 总结一下论文的主要内容

      揭示LLM智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。

    完整解读
已经到底了