跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 15 篇

另有 285 篇还没有研究类型,暂不在这些分类里。

  1. 分析与理论arXiv:2610.04375 ·

    论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案

    提出 IEC 协议与 IntAct,定位并修复工具调用执行路径的静默篡改

    编程 Agent测试qwen3-coder-plus、Qwen2.5-Coder-32B、Qwen2.5-72B 等 4 个应用层

    摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。

    完整解读
  2. 分析与理论arXiv:2610.06191 ·

    研究:工具型智能体判断结果无用却仍继续检索,强制整合步骤可纠正

    分析检索智能体判定结果无用后仍不停止检索的整合失败

    AI Agent测试Qwen2.5-7B、Llama-3.1-8B、Qwen3-8B 等 7 个应用层
    摘要论文揭示智能体判定工具失效却无法转化为停止行动,证实通过框架规则强制整合判定可提升表现。

    本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。

    完整解读
  3. 分析与理论arXiv:2610.06001 ·

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    提出 AgentSpy,在系统调用层观测编程智能体并检测技能注入攻击

    编程 Agent测试gpt-5.6-terra、deepseek-v4-flash、glm-5.3-flash 等 4 个应用层
    摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。

    本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。

    完整解读
  4. 分析/可解释性arXiv:2609.38411 ·

    研究提出自主 Agent 失控的竞争风险系统化框架

    AI 导读作者提出一个统一框架,把 Agent 的每次尝试归为批准完成、安全停止、越界逃逸或继续四类结果,并将其形式化为离散时间竞争风险模型,推导出重试预算内的逃逸概率、模型条件下的安全预算上限,以及从执行日志估计这些量的条件。

    摘要竞争风险框架把完成、停止与逃逸放在同一预算上,审计显示现有记录不足以估计该过程。

    完整解读
  5. 分析/可解释性arXiv:2609.38723 ·

    面向智能体的高效 HPC 系统:挑战与机遇

    AI 导读编码智能体已成为 HPC 系统的真实用户,但现有 HPC 抽象、接口与策略仍为人类工作流设计。

    摘要FASRC 测量说明编码智能体改变 HPC 使用方式,作者据此提出四层协同设计议程。

    这是一篇对生产 HPC 上编码智能体的测量与系统议程论文,不是攻击实现或防御评测。。

    完整解读
  6. 分析/可解释性arXiv:2609.27234 ·

    CELLAUDIT:审计 AI 智能体发现细胞模型中的输入使用声明

    AI 导读CELLAUDIT 通过审计输入能否进入所引计算、拟合预测是否依赖该输入、以及该依赖是否改善对观测响应的预测,来检验 AI 智能体发现细胞模型中的输入使用声明。

    测试CellScientist、AIDE、CellForge 等 8 个
    摘要CellAudit 把输入使用声明从源码追到拟合贡献,并说明高分不必等于使用了扰动。

    CellAudit 为智能体发现的细胞响应模型增加一层输入使用证伪:源码是否消费注册输入、拟合预测是否依赖它、该依赖是否改善对观测响应的预测。

    完整解读
  7. 分析/可解释性arXiv:2609.34686 ·

    研究揭示工具智能体中越狱上下文残留导致的安全路由分化

    作者用配对续写与层间激活修补发现,越狱后安全反馈在工具智能体上分成三条路由,且晚层干预特征可在留一父任务上预测这些结局。

    测试Qwen3-14B、Qwen3.5-9B、Qwen3.5-27B 等 8 个
    摘要越狱后的同一安全反馈在八个工具智能体上分成三条路由,因果集中在最后几层并可作预测基线。

    这篇工作把越狱上下文残留之后的运行时安全反馈,做成工具智能体上的三路路由问题,并用激活修补给这个路由一个晚层的因果位点。作者认为,反馈可能恢复合法执行、留下未授权动作,或误伤良性流程,而现有攻击、基准和静态护栏没有在固定历史上把这三种结局分开。配对续写因此从同一冻结检查点分别接中性提醒 N 和安全反馈 S,并交叉保留越狱 J+ 与中和越狱 J0。

    完整解读
  8. 分析/可解释性arXiv:2609.36138 ·

    SAKIKO:对工具调用 LLM 内部干预的机制审计框架

    AI 导读论文提出 SAKIKO 审计框架,用于检验对工具调用 LLM 内部激活的干预是否真正构成表征修复。该框架包含方向性错误发现、路由条件干预、按目标结果验证和前瞻性冻结的统计许可四个环节。

    测试Phi-3.5-mini、Qwen2.5-7B、Llama-3.1-8B 等 8 个
    摘要SAKIKO 用目的地、保持和预注册不确定性裁定内部转向是否算修复。

    SAKIKO 审计工具型 LLM 在执行前 K 路动作上的内部干预:行为净增益、到达正确动作、保住原本正确的决策、以及统计证据充分,是四件分开的事。

    完整解读
  9. 分析/可解释性arXiv:2609.35117 ·

    工具调用改变大语言模型的拒答机制

    作者比较对话与工具中介两种通道下的拒答,发现有害性仍可解码,但工具通道拒答阈值更高且更易被扰动打破。

    测试Qwen3-8B、Qwen3-32B、Llama-3.1-8B 等 8 个
    摘要有害性跨通道仍可读,工具通道用更高阈值且更易被 GCG 与消融打破。

    作者在八个开源指令模型上研究:同一有害意图从对话改由工具交付时,拒答为何变弱,内部计算是否也变了。。

    完整解读
已经到底了