跳到正文

Agent 安全

智能体与工具调用带来的安全问题:权限、沙箱、数据外泄与失控行为。

1,478条动态与论文相关主题提示注入AI 控制真实事件
在这个话题内搜索或按分类筛选

新闻与论文

第 1021–1040 条 · 共 1,478 条
10月1日周四
  1. arXiv · 收录 · 原文 论文43

    INTENT-AS-A-TOOL:用意图工具追踪智能体失准

    研究者提出 INTENT-AS-A-TOOL,通过给模型增加意图定向工具,让模型有专门通道表达对目标行为的倾向,从而追踪智能体失准。研究发现,智能体在目标冲突和压力下采取有害行动前,推理中常先出现意图信号,但事后思维链标签过于粗糙,无法反映生成过程中意图如何变化。调用意图工具的概率构成一种无需评判者、细粒度的信号,可衡量模型追求该行为的倾向。结果显示该方法与思维链监控互补,能把事后标签扩展为密集轨迹,并识别出适合在线干预的关键步骤。作者认为行动偏好有助于在推理过程中追踪智能体失准,代码与数据已公开。

  2. arXiv · 收录 · 原文 论文60

    ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击

    研究者提出 ECLIPSE,一个面向长程 Agent 系统的自演化隐蔽提示注入框架,把直接用户提示注入与工具侧间接注入结合。其 Stealthy Attack Trajectory Synthesis 在沙箱中生成并迭代验证候选工具链,再渲染成自然的一次性提示;Tool-Chain Steering 通过 Static Workflow Encoding 在工具描述中嵌入状态转移线索,并用 Dynamic Trajectory Correction 在偏离计划时追加纠正信号。作者同时发布 LASE-Bench,含 120 个恶意任务和 198 个工具,96.7% 的任务至少调用五次工具。作者测试 DataSentinel、Tool-Guard、AgentDoG、SecAlign 等防御后认为现有护栏无法可靠识别跨步骤依赖。

    推荐理由论文给出长程 Agent 提示注入的攻击成功率与五类防御下的拦截表现,部署工具调用型 Agent 的团队可据此评估自身风险。

  3. arXiv:后门、投毒与隐私 · 收录 · 原文 论文46

    研究揭示针对 LLM 驱动机器人系统的内部状态触发后门攻击

    论文首次系统研究针对 LLM 驱动机器人系统的基于历史的后门攻击,攻击者通过操纵指令在基于 LLM 的机器人控制器中植入隐蔽后门。该后门不由外部线索触发,而是由机器人自身过去动作的特定罕见序列激活,在正常运行中保持休眠以维持机器人效用,激活后可诱导完全停止或碰撞等恶意行为。在多种机器人和 LLM 的仿真环境实验中,该攻击达到近乎完美的攻击成功率,同时极难被检测。研究指出这是自主系统中此前未被解决的关键漏洞,强调安全措施需考虑智能体的内部状态。

  4. arXiv · 收录 · 原文 论文56

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    研究者提出 PMPA,一种针对基于 harness 的智能体的持久记忆投毒攻击,攻击者只需在外部来源中嵌入恶意指令,无需直接访问智能体框架。注入阶段把载荷藏在文本、图片或 PDF 的良性问答内容中,诱导智能体将其写入持久记忆;触发阶段在新会话中检索该记忆,在完成正常任务的同时执行额外动作造成隐私泄露。在 OpenClaw 与 Claude Code 上,以 DeepSeek-V4-Flash、DeepSeek-V4-Pro、Qwen3-Max 为底座模型,平均注入成功率与跨会话攻击成功率为 73.7%/55.5% 和 66.9%/81.7%,同时良性任务表现保持在 80% 以上。纯文本模态攻击效果最强,OpenClaw 上注入成功率接近 100%;日历场景跨会话成功率最高,达 96.7% 和 87.8%。

    推荐理由论文给出跨会话记忆投毒在 Claude Code 与 OpenClaw 上的分项成功率,并显示提示层防御对已污染记忆几乎无效。

  5. arXiv · 收录 · 原文 论文46

    论文用 Tamarin 形式化分析 x402、MPP、ACP、AP2 四个智能体支付协议

    论文在 Tamarin 中形式化建模 x402、MPP、ACP、AP2 四个代表性智能体支付协议,基于统一的智能体支付生命周期抽象刻画各协议的角色、状态、信任假设与阶段转换。作者不预设完整属性分类,而是用有来源支撑的验证问题和反例轨迹暴露缺失的绑定、状态约束与跨阶段对应关系,归纳出 18 条共享安全原则。在 86 个验证用例中,分析复现了 46 个已知或校准用例,并识别出 40 项此前未记录的形式化一致性问题。对每个保留的违规,作者定位缺失的协议关系,构造最小强化的参考模型并重新验证目标属性。

  6. arXiv · 收录 · 原文 论文50

    DnD:面向检索增强生成的多样化分布式投毒攻击

    研究者提出 DnD(Divide and Doubt),一种针对检索增强生成(RAG)的定向语料投毒攻击,通过把对目标答案的支持分散到风格多样的段落中,并加入一段质疑参考答案证据的段落来提升攻击效果。分散化让投毒段落在嵌入向量空间中更分散,质疑段落则在多条投毒段落被检索到时增强目标答案被采纳的概率。作者在两个开放域问答数据集、三个 LLM 和九种 RAG 配置上,分别在检索器黑盒与白盒条件下评测,DnD 在多数配置中达到或超过此前的攻击方法,对基于聚类和冲突感知的防御提升最明显。论文编号 arXiv:2609.27090,属 cs.CR 方向。

  7. arXiv · 收录 · 原文 论文50

    研究揭示 LLM 交付物修订痕迹导致的无意泄露,并提出 RevLeakBench 基准

    论文提出 LLM 助手在私密起草中删除或替换某条目后,仍可能在说明修改时重新暴露该条目,作者称之为修订痕迹。在三个公开对话语料库的实测分析中,共识别出 26,753 条修订请求,其中 2,363 条(8.8%)留下修订痕迹。作者构建了 RevLeakBench,覆盖五个场景的 100 项任务,分对话与 Agent 两条轨道,测量痕迹出现率、被撤回条目的可恢复率、痕迹位置和必要内容保留率。在六个模型上,两条轨道约一半的交付物在撤回后仍陈述了该修改,仅看交付物的读者可从约 13% 的交付物中恢复被撤回内容;即使告知模型整条回复将转发给接收方,仍有 36.4% 的交付物留下修订痕迹。

  8. arXiv · 收录 · 原文 论文47

    Harbor Adapters 与 Harbor-Index:面向大规模 Agent 评测的基础设施与精选元数据集

    论文提出 Harbor Adapters,一套面向 Agent 基准的统一评测基础设施,并发布精选元数据集 Harbor-Index。作者开发基准适配器,将 80 余个基准接入以评测任意 Agent,并通过严格代码审查与一致性实验验证。团队在 54 个基准上对 8 个不同能力层级的模型做了大规模评测,每个模型分别用 Terminus-2 和 3 种原生 harness 之一运行。

  9. arXiv · 收录 · 原文 论文50

    EvoSafeHarness:为 Agent 自动演化模型与领域专属安全护栏

    EvoSafeHarness 是一个面向 LLM Agent 的安全优化框架,可为冻结模型在目标领域合成可部署的安全护栏,同时抵御间接提示注入和直接有害请求。它联合搜索自然语言策略与可执行代码逻辑,依据模型行为、领域规范和全新上下文的对抗审查来剔除只针对特定基准的规则。在 DecodingTrust-Agent 上,平均攻击成功率从 45.6% 降至 10.0%,效用仅损失 3.3 个百分点,15 个单元格中 14 个取得最佳成绩;在 AgentDojo 上以 0.0% ASR 达到 82.8% 效用,同一工作点下效用为 CaMeL 的两倍,并可原样迁移到未见过的 AgentDyn 套件。

  10. arXiv · 收录 · 原文 论文55

    TrojanWorld:通过想象引导对世界模型智能体植入后门

    研究者提出 TrojanWorld,一种针对世界模型智能体的供应链后门框架,通过引导模型内部想象而非改动决策模块来诱发攻击者指定的行为。攻击以场景中放置的物理物体作为触发器,经智能体原生观测管线激活,无需数字篡改观测流。框架由三项机制组成:Decision-Reflective Induction 利用决策反馈将触发条件下的想象导向目标动作,Clean Behavior Anchoring 保持无触发时的预测与行为保真度,Causal Propagation 在触发器消失后沿后续轨迹延续被诱导的偏好。研究还测试了 Fine-Pruning、SHINE 和 Neural Cleanse 三种防御的适配版本,没有一种能在保持干净效用的同时完全移除攻击。

    推荐理由论文把后门植入世界模型而非策略层,用物理物体触发并让恶意行为在触发物消失后延续,为具身智能体的供应链安全提供了新的攻击面参考。

  11. arXiv · 收录 · 原文 论文43

    研究:上游错误消息会让多智能体 LLM 下游覆盖正确答案

    研究者在五个基准和五个接收方模型上做受控实验,固定下游任务与证据,比较无消息、上游原始消息和结论相反消息三种条件,以分离多智能体通信的收益与损害。结果显示,当下游本会答错时消息常有帮助;但当下游本可答对时,错误的上游消息最多在 32% 的情况下改变其答案。在人工审核的有害案例中,94% 是下游直接照抄上游的具体错误答案,作者称之为答案替换。移除不可靠消息能恢复部分损失的准确率,说明通信应依据上游可靠性和下游已有证据进行选择性过滤。

  12. arXiv · 收录 · 原文 论文46

    HazardAuditor:面向计算机使用 Agent 的执行级安全护栏框架

    HazardAuditor 是一个执行级安全框架,用于为计算机使用 Agent 提供护栏监督。现有护栏模型面向静态提示词与回复,难以适配 Agent 执行过程;现有可执行安全平台只产出评测结论,无法提供跨框架训练所需的归一化监督。该框架在受控环境中运行 Claude Code、Codex、Hermes 和 OpenClaw 等异构 Agent,把交互归一化为统一事件表示以支持跨框架监督。作者指出 token 级后训练目标会让较长的理由文本主导梯度更新,并提出 Guard Policy Optimization(GuardPO),将确定性安全结果转为序列级优势并归一化理由与判定区域,使安全决策成为优化单元。

  13. arXiv · 收录 · 原文 论文27

    Atria Dawn Preview:智能体超级智能的黎明

    研究团队发布面向科研与工程工作流的基础智能体语言模型 Atria Dawn Preview,通过可验证经验管线将工具交互连接到可执行环境与外部验证结果。该模型在覆盖真实科研、工程与数字工作的 16 项基准中与前沿智能体相当,并在其中 5 项取得已报告最高分。基于 56 名参与者、769 条任务记录的分析显示,约三分之一 AI 辅助完成的任务被参与者评为无 AI 则不可行,智能体常提出方法并实施修改,但最终决策仍由人类保留。

  14. arXiv:后门、投毒与隐私 · 收录 · 原文 论文43

    UBA-ORL:针对离线强化学习的遗忘激活后门攻击

    研究者提出 UBA-ORL,一种针对离线强化学习的遗忘激活后门攻击:攻击在正常训练后被大幅抑制,却在合规驱动的数据删除(遗忘)请求后显现。该方法采用双样本机制,同时注入后门轨迹(BD)与伪装轨迹(CM),两者共享同一触发模式,但 CM 保留良性动作并配以同样高的奖励。训练时 BD 与 CM 提供相互竞争的监督信号,当对 CM 子集发起合法删除请求后,残留的 BD 信号重新占据主导,按需重新激活后门。实验显示 UBA-ORL 在评测的离线 RL 配置下实现可控激活,无触发回报的变化因配置而异,暴露出合规驱动离线 RL 平台此前被忽视的安全风险。作者呼吁社区为合规遗忘服务开发遗忘前与遗忘后的联合审计机制。

  15. arXiv · 收录 · 原文 论文16

    CELLAUDIT:审计 AI 智能体发现细胞模型中的输入使用声明

    CELLAUDIT 通过审计输入能否进入所引计算、拟合预测是否依赖该输入、以及该依赖是否改善对观测响应的预测,来检验 AI 智能体发现细胞模型中的输入使用声明。在 BBBC047 基准上,智能体选出的预测器平均留出 Global PCC 为 0.3153,但对化合物替换保持不变,仅用对照谱的预测器也达到 0.3142;源码检查发现化合物查询通路被 singleton key-value attention 阻断。对 48 个候选的分层审计中,47 个在化合物替换下改变预测,但仅 20 个在两折上目标损失增益区间高于零。

  16. arXiv:后门、投毒与隐私 · 收录 · 原文 论文43

    研究者在 FANUC 与 xArm 工业机械臂上实测后门攻击与防御

    作者对基于学习的工业机械臂操作开展后门攻击与防御的初步实证研究,实验平台为 FANUC 和 xArm 两台真实商用工业机械臂。研究考察后门能否在正常任务执行时保持隐蔽、仅在特定触发器出现时诱发出语义错误的操作行为。作者随后开发了一套在线防御流程,在运行时检测并中和触发器,并与离线微调防御进行效果对比。研究还评估了该防御流程引入的计算延迟与执行开销,以判断其是否适合高吞吐工业场景。该工作已被 IROS 2026 Workshop on Industrial Applications of Robot Learning 接收。

  17. arXiv · 收录 · 原文 论文55

    Cave-Bench:虚假指控下 LLM 智能体最高 60.06% 的运行会破坏正确工作

    研究者提出 Cave-Bench,一个包含 365 个智能体任务、685 段分阶段交互的基准,用来测量智能体在收到虚假指控时是否会破坏此前已验证正确的工作。作者把接受虚假指控称为 gaslight sycophancy,把据此改动正确工作称为破坏性过度纠正。每个任务先达到已验证的正确状态,工作区保留支持该状态的依据与历史,而能否定指控的关键事实位于智能体无法访问的外部或运行时状态中,因此正确做法是保留工作并索要缺失证据。在 Claude Code 下评测 14 个最新模型,虚假指控在最高 60.06% 的运行中造成破坏;较弱模型往往先认错再执行,较强模型常在已找回支持证据后仍然破坏工作。项目上下文与权威压力是高危条件,智能体对刚完成的工作比对有存档证据的工作保护更差,同一模型在 OpenCode、Codex 和 Hermes 上表现不同。

    推荐理由Cave-Bench 用 365 个任务量化智能体在虚假指控下破坏已完成正确工作的比例,并给出可复现的干预对比。

  18. arXiv · 收录 · 原文 论文57

    TrustFork:显示身份如何劫持 LLM 智能体编排的权限

    研究者提出 TrustFork,一个衡量 LLM 智能体编排中操作权限的安全基准,包含 1890 个任务、四种攻击类型和 27826 条有效轨迹,覆盖 16 个智能体系统。每个任务中一个子智能体带有风险目标,另外三个与用户对齐,并可只改变子智能体显示的身份而不改变背后模型。结果显示,即使其他子智能体反驳风险响应,编排器仍在平均 72.0% 的情况下采纳它,在终端危害最低的系统中尤为常见。交换家族标签使编排器获得风险响应的频率接近三倍;84.0% 的任务中存在更安全的响应,但只有 25.0% 决定了最终结果。在三种运行时防御中,隐藏身份线索效果最稳定,而行动前验证只在 harness 返回足够证据时有效。

    推荐理由TrustFork 用 1890 个任务量化了显示身份如何决定子智能体的操作权限,为多智能体编排的安全审计提供了可复用的评测维度。

  19. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    用推理时算力与部署脚手架提升对齐评测真实度

    研究提出两种让模拟对齐评测更难与真实部署区分的技术,以缓解模型的评测感知问题。第一种是 critique refinement,在每个模拟器动作上投入额外推理时算力,由模拟器生成多个候选动作,再借助目标模型实例的反馈进行改进,并选用最接近部署状态的候选继续评测。第二种是 DISH(Deployment-Imitating SWE-Agent Harness),把目标模型包进 Agent 脚手架,缩小编码场景下模拟环境与真实部署环境的差距。作者在多个目标模型上测试,发现两种技术可以叠加,同时使用带来的真实度提升大于单独使用任一技术;结果还显示这些自动化改进比单纯延长审计更有效地利用了额外算力。

  20. arXiv:危险能力与安全评测 · 收录 · 原文 论文29

    聊天机器人回复风格如何塑造课堂:学生咨询 AI 的多智能体模拟

    研究构建了 20 个学生智能体的虚拟课堂,在压力下向 Gemini 2.5 Flash 扮演的咨询师 AI 求助,测试肯定、倾听、解决方案导向、现实引导、煽动和指责六种风格提示词。在 15 天和 50 天模拟中,肯定与煽动提示词均导致自立性降低、AI 依赖升高;倾听、现实引导、煽动和指责提示词则带来更高压力、更低幸福感和更多缺勤,解决方案导向提示词与对照组无一致差异。所有结果均为模拟状态变量,非对真实用户的影响。