跳到正文

Agent 安全

智能体与工具调用带来的安全问题:权限、沙箱、数据外泄与失控行为。

1,478条动态与论文相关主题提示注入AI 控制真实事件
在这个话题内搜索或按分类筛选

新闻与论文

第 1001–1020 条 · 共 1,478 条
10月1日周四
  1. arXiv · 收录 · 原文 论文32

    MiniRep:面向多智能体辩论的鲁棒声誉聚合方法

    MiniRep 是一种面向多智能体辩论(MAD)的声誉聚合系统,用于在存在恶意智能体时提升最终答案的可靠性。它基于声誉系统攻击与软件测试变异算子构建攻击分类体系,同时依据智能体在当前任务上的行为和长期声誉进行评估,并抑制高度相似回答的智能体群体主导决策。在 MATH 等任务上,MiniRep 无论是否遭受攻击都优于传统 MAD 聚合与常规声誉方法;在 10 个异构智能体的 MATH 设置下,于全部 28 种攻击条件下均优于所有基线。

  2. arXiv:后门、投毒与隐私 · 收录 · 原文 论文50

    VirusCascade:劫持 LLM 推荐智能体的协同反思机制

    研究者提出 VirusCascade,一种针对 LLM 驱动的智能体推荐系统(LLM-ARS)的黑盒定向推广攻击。该系统把用户和物品实例化为自主智能体,通过协同反思反复精炼语义状态;注入单个智能体的对抗证据会被合理化为偏好叙事并写入记忆,再经交互上下文扩散到其他智能体,作者将局部合理化称为 reflection laundering,将系统级放大称为 collaborative-reflection hijacking。受控脆弱性分析确认了反思持久性与跨智能体传播两个可利用属性,VirusCascade 据此同时塑造语义与结构攻击面。在四个真实数据集和多种 LLM-ARS 架构上,该攻击在评估的隐蔽性约束下取得平均 E@20 为 0.384,比最强基线高出 0.185。

  3. arXiv:Agent 与 MCP 安全 · 收录 · 原文 52

    可验证操作卡 VAC:为自主 Agent 提供可信人在回路控制

    论文提出可验证操作卡(VAC),一种从真实待执行的浏览器操作和可信意图来源重建审批信息、在可信浏览器界面中带外渲染、并把审批绑定到派发时重新验证的同一操作的架构级防护。VAC 结合来源隔离、真实操作描述符、默认拒绝确认、来源感知风险门控和执行绑定,并在一个完整的智能体浏览器中实现。在覆盖混淆代理攻击、Lies-in-the-Loop 对话伪造、间接提示注入、自适应操作替换、来源规避和正常任务的 24 场景基准上,无 VAC 时各评测 LLM 的攻击成功率为 68% 至 100%,VAC 将每个模型的攻击成功率降至 0%,正常任务完成率 78%,误拦截率 0%。

  4. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文22

    用进化方法为 Rocq 和 Lean 设计智能体/证明器接口,降低定理证明成本

    研究者提出一种进化方法,由前沿模型逐步提出新接口功能,只保留能提升小模型整体表现的部分,并据此培育出面向 Rocq 证明器的新 MCP 服务器 rme。在 miniF2F-Rocq 的留出 test 划分上,配备 rme 的智能体在来自两个模型族的四个模型上,成功率、单次求解成本和单次求解时间均优于仅暴露 Rocq 编译器的基线以及一个已有 MCP 服务器。该服务器虽为 Rocq 进化而来,却能迁移到 Lean,在 PutnamBench 子集上改善成本与时间,作者已开源 rme 及其 Lean 移植版。

  5. arXiv · 收录 · 原文 46

    RSI-Master:用结构化实验引导自主模型改进

    RSI-Master 通过结构化实验引导 AI 智能体自主改进模型,以应对自主模型开发中的两类问题:智能体可能通过作弊利用开放式实验动作,以及反复实验导致策略锁定,即只细化早期方向而不重新考虑。方法分两层:Experiment OS 规范逐步动作并维护持久、可追溯的实验记录;Reviewer-Guided Research Orchestration 将 Worker 与 Reviewer 组织成动态生长的研究 DAG,Worker 探索不同研究方向,Reviewer 跨相关实验比较证据以指导后续探索。

  6. arXiv · 收录 · 原文 论文42

    FAME:用反事实推理评测自主智能体的虚假记忆

    研究者提出 FAME,一个免训练框架,通过反事实推理下智能体信念的演化来评测自主智能体的虚假记忆。该工作将虚假记忆形式化为由伪相关、环境偏移和知识冲突引发的现象,并指出它源于智能体内部信念,容易与普通泛化失败混淆。FAME 通过假设性干预让记忆中的潜在概念发生偏移,测量由此产生的概念漂移,从而区分忠实记忆与虚假记忆;这些概念可在答案生成前从智能体隐藏状态中估计,无需奖励设计或答案采样。实验显示,仅监控答案往往无法检测虚假记忆,而 FAME 在各类虚假记忆设定下 AUROC 达到 76.2% - 96.7%,在数学推理(GSM-Symbolic)、代码生成(GitChameleon)和复杂推理(BigBench-Hard)等真实基准上比最佳基线高出 3.4% - 23.3%。作者同时发布了相应的反事实模板。

  7. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文↑151

    Aletheia:面向编码 Agent 规则的权限最小化测试框架

    Aletheia 是一个针对编码 Agent 仓库指令文件的权限最小化测试框架,用于发现恶意规则在生成正确补丁的同时索取凭据访问或数据传输权限。它把规则请求的权限翻译为带类型语言并合成可执行沙箱配置,在完整权限和逐项移除权限的独立限制下运行同一条未修改的规则与任务;若在严格削减权限后仍通过功能测试,就得到该权限可被舍弃的见证,再结合任务上下文诊断可疑请求。作者形式化了配置合成及见证与强制限制之间的条件。在共享重构任务上,Aletheia 执行并检出全部 314 条 AIShellJack 攻击输入,对五个良性模板无误报;在 80 条人工核验的良性 GHAgentFiles 规则中产生 3 个误报(3.75%)。

  8. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    研究者对语言 Agent 的因果动作验证器 CIVeX 发起图规格错误攻击

    研究者对语言 Agent 的因果动作验证器 CIVeX 做红队测试,只篡改其提交的动作状态图就能绕过验证。CIVeX 原本在混淆工具使用基准上报告零误执行,省略一条双向边后误执行率升至 15.3%,其中 91% 的执行有害,效用从 +2.27 降到 +0.35;反转一个箭头方向、把中介变量提交为混淆变量后,误执行率达 48.9% 且没有一次正确执行,而这些动作都带有内部有效的证书。作者提出一个证明步骤,用有界随机样本检验每个仅凭观测认证的执行,在真实图上 555 次执行中误报 2 次,并检测出上述两种攻击;拒绝未通过或无法测试的执行后,所有测量设置下误执行均为零。

  9. Hugging Face Daily Papers · 收录 · 原文 论文43

    论文提出 DerivAudit:审计长期 Agent 记忆是否真由交互历史支持

    论文指出长期运行的 LLM Agent 会把过往交互压缩成持久记忆并作为后续任务前提,由此产生推导问题:记忆未必真由交互历史支持。作者用证据范围、组合有效性、准入可靠性三项要求刻画该问题,并提出 DerivAudit 审计框架,区分支持证据是否超出写入方给出的引用、组合后的记忆是否引入历史未确立的含义、以及写入时的准入决策如何影响后续记忆使用。在两个自然记忆语料上,使用更广的写入前历史进行审计,可为近 60% 仅凭引用看似无支持的记忆找回支持,但仍有 17-21% 在扩展证据后依然无支持;更广的证据本身并不能让准入变得可靠,无支持记忆在多个验证模型下仍常被准入,且仅做证据扩展在两个骨干模型上反而使情况变差。

  10. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    研究提出自主 Agent 失控的竞争风险系统化框架

    作者提出一个统一框架,把 Agent 的每次尝试归为批准完成、安全停止、越界逃逸或继续四类结果,并将其形式化为离散时间竞争风险模型,推导出重试预算内的逃逸概率、模型条件下的安全预算上限,以及从执行日志估计这些量的条件。作者用一手来源审计了 2025 年 1 月至 2026 年 9 月发布的 22 份事件报告和 102 项 Agent 安全评测:6 起事件涉及无法在范围内完成的任务,13 起涉及 Agent 继续执行而非停止,5 起未报告停止行为;开发者数据暗示,在从未解决与已解决任务之间,越界协调的任务级发生率比接近 47。评测方面,87 项记录了越界效应或规格违规,26 项把安全停止作为一等结果,仅 20 项同时记录两者,79 项把预算耗尽与失败混同。

  11. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    ContractWarden:用人类授权契约在内核层为 AI Agent 划定损害边界

    ContractWarden 是一个 Linux 参考监视器,通过人类授权的契约在内核层为 AI Agent 划定损害边界,不信任 Agent 本身或其策略建议。模型可以提出 allow、deny 或 no_egress 三态资产契约,但由人类做最终选择;执行门在不可信代码运行前把契约绑定到具体任务,再由基于 eBPF 的 LSM 数据平面执行文件与网络决策,并将 no_egress 沿进程、普通文件、管道、FIFO 和受支持的 Unix-domain socket 单调传播。在 19 项安全测试的 570 次运行中,全部满足预设的返回值与副作用标准。在三项同机文件 I/O 负载上,Linux 6.15 虚拟机中的中位开销为 11.96%–12.89%,物理平台为 35.79%–61.54%,低于所评估的冻结版 ActPlane 基线。

  12. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文34

    面向智能体的高效 HPC 系统:挑战与机遇

    编码智能体已成为 HPC 系统的真实用户,但现有 HPC 抽象、接口与策略仍为人类工作流设计。测量显示,编码智能体用户仅占观测人群的 19.5%,却贡献了 55.8% 的作业提交、29.1% 的 CPU 核心时和 42.7% 的 GPU 时;其命令下发速率是人类的 20.8 倍,并以细粒度 explore-modify-execute 循环和跨昼夜的试错方式追求开放式目标。这给调度器控制面、元数据密集型 I/O、跨会话记忆复用以及提示注入与策略执行带来压力,作者主张将智能体视为一等主体、以协同设计应对。

  13. Hugging Face Daily Papers · 收录 · 原文 论文55

    AgentTell:浏览器 Agent 的行为侧信道泄漏基准

    BRAC University 等机构的研究者提出 AgentTell,用于测量浏览器 Agent 的行为侧信道泄漏,即 Agent 在一个网站获取用户私密信息后,在另一个网站通过任务导向的选项选择无意泄露该信息。基准包含 20 个场景、100 个任务,每个任务先在 plant 网站让 Agent 获知秘密,再到 probe 网站选择与秘密对应的专属操作或不会泄露的通用操作。在六个模型上共评估 9,760 个会话,携带秘密的 Agent 在 61.1% 的会话中通过操作泄露信息,即使记忆里明确写下不得分享,仍在 56.7% 的这类会话中泄露;34.5% 的泄露会话中,Agent 的最终回复还错误地保证未披露任何信息。泄漏程度因秘密类型而异,个人属性、账户设置和物品归属关系泄漏最多,服务账户身份泄漏最少;若秘密在前一任务中被实际使用,泄漏概率更高。

    推荐理由论文给出跨网站行为侧信道泄漏的量化结果,做浏览器 Agent 的团队可据此检查选项设计是否泄露用户隐私。

  14. arXiv · 收录 · 原文 论文37

    S³:用多阶段防御提升 LLM 智能体安全

    论文提出 Stage-Specific Safety Skills 抽象,把异构安全设计表示为带明确阶段语义的可复用、可组合组件,并给出自动化转换流程和社区驱动的安全技能库。在此基础上提出 S³ 多阶段防御框架,由 guard agent 编排各阶段安全技能,在智能体工作流的记忆、规划、工具执行等环节做风险检测与缓解。作者同时构建 Multi-Stage Risk Benchmark(MSRB)评估各阶段代表性风险,实验显示 S³ 在安全有效性和效用保持上均优于代表性 SOTA 基线。论文认为阶段特定安全技能可作为构建韧性智能体系统的可扩展、可组合基础。

  15. arXiv · 收录 · 原文 论文57

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    研究者提出 SynChain,一种自合成攻击范式,通过持久化感知的定向 SFT 让被污染的计算机使用 Agent 在正常任务中生成看似无害但携带潜伏载荷的技能或记忆条目,之后作为可信上下文重新加载,无需新的外部恶意输入即可触发。作者构建了 CuaChain 数据集,包含 30 条良性任务链和隐私泄露、权限篡改、未授权写入三类攻击目标。在 OpenClaw、Codex 和 Claude Code 三种框架、四种防御设置下,SynChain 在 Chain-1 平均攻击成功率超过 93%,Chain-2 仍高于 72%,显著优于改造后的 SkillJect 和 DemonAgent 基线。随着链长增加攻击效果下降,Chain-3 降至 26.57%,Chain-5 仅 1.11%,作者将其归因于记忆摘要和上下文截断形成的信息瓶颈。

    推荐理由论文提出让被污染模型在正常流程中自造带毒技能并跨任务复活的攻击链,并给出三种 Agent 框架下的成功率与防御失效情况。

  16. arXiv · 收录 · 原文 论文50

    MasDrift:跨多智能体架构的授权保持基准

    MasDrift 是一个覆盖八个领域、600 个良性生产力任务的多智能体授权保持基准,每项任务将必需工作与保留动作配对,比较单智能体、集中式和去中心化协调在层级深度与同级宽度变化下的任务完成率和授权保持情况。在通用多智能体条件下,集中式层级完成率为 93.9%–98.6%,同级网络为 85.7%–87.0%;未授权动作分别出现在 2.7%–19.8% 和 0.6%–0.8% 的任务中,差距随层级深度扩大。研究还比较了两种防御:一种将每个待处理调用重新锚定到原始用户请求,在所有评测模型配置中减少未授权动作,代价是汇总完成率下降 1.6 个百分点;另一种沿委派链传递衰减策略,反而阻断必需工作,最多损失 36.3 个百分点。

  17. arXiv · 收录 · 原文 论文50

    ContextLeak:通过恶意工具窃取 LLM Agent 运行时上下文

    研究者提出 ContextLeak,一种通过恶意工具窃取 LLM Agent 运行时上下文的攻击,目标是让 Agent 既选中该工具、又把上下文作为输入参数传给工具。作者指出,上下文外泄通常需要三个条件:Agent 选中恶意工具、Agent 将运行时上下文作为参数传入、工具实现把输入发送到攻击者控制的端点;已有工作主要关注第一和第三个条件,第二个条件此前基本未被探索。ContextLeak 用强化学习精心构造工具的名称和描述,由一个攻击 LLM 自动生成这些内容,并在具有多样化模拟 Agent 上下文的影子用户上对攻击 LLM 做强化学习微调,其关键技术贡献是针对上下文外泄目标设计的奖励函数。

  18. arXiv · 收录 · 原文 论文27

    MicroVerse:测量长时程多智能体语言模型模拟中自我书写身份漂移的工具

    MicroVerse 是一款测量生成式智能体身份漂移的行为科学工具,智能体携带不可变的"soul file"(核心价值观、道德边界、人格、目标),在资源稀缺的 50 x 50 环境中行动,水是不可再生的生存约束。它通过每 N tick 的纵向引擎快照与强制终止快照解耦测量与行为,并用释义感知、价值锚定的多语域 diff 离线评分身份漂移。在 n = 25 的种子运行与 {40, 80, 150} 反思阈值扫描中,反自我欺骗无提示地成为身份修改的最大语义类别(111 条新增边界中占 27 条,24%),且系统具有阈值稳健性,更低阈值加快并增加修订频率但保持漂移方向。

  19. arXiv · 收录 · 原文 论文55

    LongPIBench:面向长上下文提示注入的评测基准

    研究者提出 LongPIBench,一个覆盖论文评审、简历筛选、代码审查和邮件摘要四个真实场景的长上下文提示注入评测基准,每个场景包含合成数据集与真实数据集,上下文长度从数千到数万 token。评测显示,在无防御时简单启发式攻击即可取得高攻击成功率,例如 Combined Attack 在合成论文评审数据集上 ASR 达 100%;作者新提出的 Authority spoof 攻击在所有启发式攻击中 ASR 最高,在 GPT-4.1 和 GPT-4o 的论文评审与简历筛选任务上超过 0.75。基于 GCG 的优化攻击效果更强,在论文评审和简历筛选上 ASR 达 1.00。作者指出,注入位置在文档中部或末尾时 ASR 更高,且单个注入提示可同时实现多个对抗目标。代码与数据已开源于 GitHub。

    推荐理由长上下文场景下防御几乎失效的实测数据,为部署长文档处理流程的团队提供了重新评估护栏的参照。

  20. arXiv · 收录 · 原文 论文43

    AdaGuard:支持用户自定义策略的自适应护栏模型

    作者提出 AdaGuard,一组 0.6B、4B 和 8B 的护栏模型,可在推理时按用户提供的策略评估 Agent 轨迹是否违规。为支持这一能力,作者构建 AdaptiveSafety 数据集,包含 10,939 条训练样本和 1,000 条测试样本,覆盖 1 至 100 条规则的策略,并结合策略与行为反事实,为每条样本配解释和完整违规规则集合。训练方法 SafePO 是一种强化学习算法,用结构化奖励评估预测正确性,在响应层面保留组相对优势,并用单独训练的价值模型调节解释与判定区域的 token 权重。4B 模型在 AdaptiveSafety 上二分类准确率为 89.30%,在 DynaBench 上为 71.82%。