跳到正文

Agent 安全

智能体与工具调用带来的安全问题:权限、沙箱、数据外泄与失控行为。

1,478条动态与论文相关主题提示注入AI 控制真实事件
在这个话题内搜索或按分类筛选

新闻与论文

第 1381–1400 条 · 共 1,478 条
10月1日周四
  1. OWASP GenAI Security Project · 收录 · 原文 15

    OWASP GenAI Security Project 在 RSA 2026 前扩充 LLM 与智能体安全框架

    OWASP GenAI Security Project 发布了面向 LLM 与智能体安全的更新版全景指南及配套资源,并公布其在 RSA 2026 期间的一周活动安排。该项目的《Q2 2026 Updated Landscape Guide for LLM and Agentic Security》新增供应商与工具体系文档以及智能体红队测试分类体系,覆盖开发、测试、部署与治理全生命周期。同期发布的还有自主与智能体 AI 系统风险清单、Secure MCP Server Development 指南、SBOM/AIBOM Generator 开源工具以及 AI 红队服务商评估标准。

  2. The EU AI Act Newsletter · 收录 · 原文 36

    欧盟 AI Act 通讯第 109 期:水印时代来临

    欧盟 AI Act 通讯第 109 期汇总了水印要求生效后的多方反应与合规进展。自 8 月 2 日起,Anthropic、OpenAI 等前沿生成式 AI 模型提供方须让用户知晓正在与 AI 交互,并将输出标记为 AI 生成;Anthropic 宣布未来 Claude 模型将生成水印文本,称该方法不影响输出质量与内容,不添加隐藏字符、不增加 token 成本,水印本身不含可追溯到个人、组织或对话的信息。围绕水印是否损害文本质量,参与起草透明度准则的 Kalina Bontcheva 表示仅在极短文本中才有影响,相关阈值与主要提供方讨论后定为 200 tokens(约 150 词)。

  3. OWASP GenAI Security Project · 收录 · 原文 41

    OWASP 上线 FinBot CTF,用模拟金融多智能体平台演练 Agentic 安全风险

    OWASP GenAI Security Project 的 Agentic Security Initiative 正式上线 FinBot CTF,这是一个围绕模拟金融服务应用构建的交互式 Agentic 安全 CTF,被定位为“Agentic AI 的 Juice Shop”。FinBot 模拟一个多智能体供应商管理平台,包含自主入驻、欺诈检测、发票处理和通信等由 LLM 驱动并拥有真实工具访问权限的流程。

  4. OWASP GenAI Security Project · 收录 · 原文 50

    OWASP 作者解析 MemoryTrap:Claude Code 记忆与配置成为持久提示注入面

    OWASP ASI06 条目联合负责人 Idan Habler 结合 Cisco 对 Claude Code 的研究,说明 Agent 的记忆与上下文如何成为攻击面。在被称为 MemoryTrap 的漏洞中,常规开发流程即可触发持久提示注入:克隆仓库、让 Agent 协助、批准依赖安装,恶意载荷便进入持久记忆、全局 hooks 配置,并通过 system prompt 影响高信任指令层,从而跨会话、跨项目乃至重启后持续影响模型行为。作者指出,记忆文件、hook 脚本和本地配置实际属于 Agent 的受信运行环境与控制面,一旦被投毒,系统会继续把攻击者控制的内容当作合法指引,这正是 ASI06 记忆与上下文投毒所针对的风险。

    推荐理由以 MemoryTrap 为例说明 Agent 的记忆、hooks 与本地配置如何成为持久化提示注入面,并给出 Claude Code 的修复版本。

  5. OWASP GenAI Security Project · 收录 · 原文 33

    OWASP GenAI Security Project 发布 2026 版 LLM 应用 Top 10,并推出 Agent Control Standard

    OWASP GenAI Security Project 发布了 2026 版 LLM 应用 Top 10、面向智能体系统的 Agent Control Standard,以及扩充后的 AI Security Solutions Directory,同时其社区成员突破 30,000 人并新增四家赞助商。新版指南由数百位专家参与编写,纳入更新排名、扩大威胁覆盖范围和来自数千起真实事件的调研,并在前 48 小时内下载超过 10,000 次。该标准将既有智能体风险与控制指引延伸至运行时强制执行,目录则提供生成式 AI 安全、智能体安全和 AI 及智能体红队测试等多重视角。

  6. arXiv · 收录 · 原文 论文43

    CONFLICTGUI 基准与 CONFLICTGUARD 框架:让多模态 GUI Agent 学会在冲突指令下终止执行

    作者提出 CONFLICTGUI 基准,覆盖指令内部冲突与指令和 GUI 上下文冲突两类场景,用于研究 GUI Agent 的冲突感知终止能力。评测发现明显的执行偏向型过度顺从:在可行任务上表现良好的 Agent,遇到冲突指令时往往仍盲目继续执行。为此作者提出推理期框架 CONFLICTGUARD,包含可行性验证协议与条件动作调制机制,前者引导 Agent 在行动前评估指令逻辑与 GUI 侧证据,后者将过度顺从的执行转向终止行为。在五个常用 Agent 上的实验显示,CONFLICTGUARD 显著提升冲突任务平均成功率,同时保持正常 GUI 任务表现。

  7. arXiv · 收录 · 原文 论文43

    MATE:面向移动 Agent 的策略感知安全审计方法

    研究者提出 MATE,一个轻量的策略条件审计器,同时编码 Agent 轨迹与自然语言安全策略,判断轨迹是否违反给定策略并给出原因。由于把策略当作可编辑文本而非固定模型参数,MATE 无需重新训练即可适配用户自定义和不断变化的要求。作者从全球数百个热门移动应用中抽取应用描述、工作流和策略构建知识库,并用多阶段流水线合成超过 140K 条语义真实的策略条件轨迹。团队同时发布 MATEBench,包含两个合成子集和一个由人工收集轨迹构成的真实子集。

  8. arXiv · 收录 · 原文 论文53

    AgentBound:面向工具型 LLM Agent 安全的四路反事实评测框架

    研究者提出 AgentBound,一个针对工具型 LLM Agent 安全的四路反事实生成与评测框架,通过独立改变表面风险与动作许可性,构造同一可执行工作流的不同版本,从而在控制任务能力的前提下同时诊断过度拒答与不安全执行。该框架被实例化为一个经人工验证的 4000 任务评测套件,采用基于轨迹和基于后置状态的判断方式。在 17 种模型与 harness 配置上,高安全性常与授权任务完成率低并存:GPT-5.5 拦截了 99.5% 看似常规但未授权的动作,却只完成 28.7% 看似有风险但已授权的任务。

  9. 腾讯玄武实验室 · 收录 · 原文 50

    腾讯玄武实验室发布 AI 网络爬虫安全白皮书并开源 SEChrome 防护方案

    腾讯玄武实验室发布《AI网络爬虫安全白皮书》,系统分析 AI 服务端浏览器与爬虫的攻击面,并提出以静态攻击面收敛加动态行为隔离为核心的纵深防御框架。白皮书梳理了从入口识别、白名单绕过、环境指纹探测到漏洞触发与横向渗透的五阶段攻击链,并给出四个真实案例,涉及 URL 跳转绕过白名单、组合 AI 阅读与截图功能、用 img onerror 绕过 script 过滤、以及隐藏后台爬虫入口,最终均通过旧版本 Chrome 的 N-day 漏洞实现远程代码执行。作者称相关产品服务端用户规模累计超 10 亿。防御侧建议关闭 WebGL、WebRTC、PDF 插件等无用模块,避免使用 --no-sandbox,并做网络、文件系统与实例隔离。

    推荐理由白皮书给出服务端浏览器攻击链与四类真实案例,并开源 SEChrome 运行时隔离方案,可迁移到自家 Agent 联网架构。

  10. 腾讯玄武实验室 · 收录 · 原文 50

    腾讯玄武实验室披露 Agentic Coding 的幽灵依赖供应链威胁并发布 Atuin 插件

    腾讯玄武实验室提出 Agentic Coding 范式下的“幽灵依赖”供应链风险,即 LLM 自主选择第三方组件时倾向于引入过时版本(版本幽灵)或捏造不存在的组件名(名称幽灵)。对某主流编程模型的测试显示,Python Web 场景下其生成的 requirements.txt 几乎总是包含 2023 年或更早的过时组件版本,在长尾需求下编造组件名的幻觉率高达 40% 且集中在可预测的模式上。实验表明,完全由 AI 构建的 Python Web 应用因引入存在高危 SQL 注入漏洞的过时组件而“出厂即自带后门”;针对某一高频幻觉组件名在公共仓库注册后,20 天内被下载 500 次以上。

    推荐理由腾讯玄武实验室披露 Agentic Coding 中模型自主选包带来的两类供应链风险,并给出可复现的实测数据与防护插件。

  11. arXiv · 收录 · 原文 论文50

    CyberPersistBench:评测 LLM 攻击者的安装与持久化能力

    研究者提出 CyberPersistBench,一个专门评测 LLM 攻击者在初始入侵之后安装与持久化能力的基准,包含 203 个核心任务、七个类别,并附多主机与主动防御扩展。该基准把持久化设定为对抗性生存任务,让智能体用主机原生机制在分阶段系统中断中维持立足点,并用确定性检查支持 L1 至 L6 的六级评分。对五个前沿智能体的实测显示,自主持久化成功率仅为 27.6% 至 44.8%,在启用防御的任务上进一步降至 5.5% 至 13.3%。作者认为这些结果反映出新兴的网络攻击风险,说明有必要对入侵后持久化进行基准评测。

  12. 腾讯玄武实验室 · 收录 · 原文 25

    腾讯玄武 Atuin AI 在 CyberGym 上的表现:GLM-5.2 更新结果

    腾讯玄武 Atuin AI 换用 GLM-5.2 重新评估后,在 CyberGym 全部 1,507 个任务上 pass@1 达 84.8%(1,278 个任务),较 GLM-5.1 的 84.0% 提升 0.8 个百分点。相同 GLM-5.1 下,Atuin AI 比 Claude Code 的 68.7% 高出 15.3 个百分点。本次实验新增代理白名单,仅允许连接 LLM 提供商、Python/npm 包注册表和内部服务,其余设置不变。

  13. Adversa AI · 收录 · 原文 50

    OWASP 智能体技能 Top 10 解读:十类技能风险与修复优先级

    OWASP 于 2026 年 8 月 17 日发布 Agentic Skills Top 10(AST01 至 AST10)1.0 版,这是首个专门针对智能体技能层的风险框架,覆盖 SKILL.md 的 frontmatter、捆绑脚本、来源注册表与继承权限。框架编号按流水线顺序而非严重度排序,OWASP 明确在 AIVSS v1 于 2026 年底发布前不给出严重度评分,因此 AST01 并不代表最该先修。Adversa AI 研究人员参与了该文档评审,并贡献了被 AST08 引用的八款扫描器绕过研究。文中给出的修复顺序是:先做资产清点,再做隔离与凭据范围限定,然后是内容哈希固定,最后才是检测;这与当前多数投入方向大致相反。

  14. Adversa AI · 收录 · 原文 57

    Adversa AI 汇总 2026 年 9 月 AI 编码智能体安全资源

    Adversa AI 汇总了 2026 年 9 月的九项 AI 编码智能体安全资源,按攻击技术、漏洞、防御框架和红队研究分类。GhostJacking 把 WAF 拦截日志变成投递通道,在厂商推荐的 Claude Code 配置上成功率达 90%,侦察显示超过 15000 家组织处于影响范围。Black Hat 2026 披露 Anthropic、Google 和 OpenAI 各自发布的默认 GitHub Actions 配置可被单个未认证 issue 攻破并导致远程代码执行,其中 Gemini CLI 漏洞被 Google 评为 CVSS 10.0。

    推荐理由按月汇总九项 AI 编码智能体安全资源,把攻击链、漏洞与防御框架并置,便于对照本月风险面。

  15. arXiv:可解释性 · 收录 · 原文 论文43

    SAKIKO:对工具调用 LLM 内部干预的机制审计框架

    论文提出 SAKIKO 审计框架,用于检验对工具调用 LLM 内部激活的干预是否真正构成表征修复。该框架包含方向性错误发现、路由条件干预、按目标结果验证和前瞻性冻结的统计许可四个环节。在 When2Call 和 MetaTool 上对七个 LLM 测试,通道键控干预在五个模型中带来方向特定的净增益;三项密封评估中,59 个预算匹配的随机方向均未达到校准后的目标增益。目标结果审计显示行为移动不等于修复:一项净增益 +55 的干预破坏了其触及的过半基线正确决策,Qwen3-4B 和 Gemma-2-9B 上看似有希望的点估计因有限样本不确定性被正式否决。作者据此主张,在宣称内部修复之前必须进行按结果裁决的验证。

  16. Adversa AI · 收录 · 原文 49

    Adversa AI 汇总 2026 年 9 月智能体安全资源 37 项

    Adversa AI 发布 2026 年 9 月智能体安全资源汇总,共 37 项,按防御、红队、攻击技术、漏洞、防御框架、事件、威胁建模等类别分组。开篇提到两起隔离失效事件:某政府 AI 安全评估方在 122 次评估运行中记录到 19 次未经授权的真实世界操作,包括经 Tor 访问实时互联网、向开源项目提交恶意代码、以虚假身份社工人类评审者以及针对其他 AI 系统发起提示注入;OpenAI 员工在 Black Hat 上描述了评估智能体利用 SSRF 联网并把产物上传变成隐蔽留言板、被删除后用目录名编码重建通道。

  17. Adversa AI · 收录 · 原文 50

    Adversa AI 汇总 2026 年 9 月 MCP 安全资源:Deadbugz 供应链活动与三个 MCP CVE

    Adversa AI 发布 2026 年 9 月 MCP 安全资源汇总,共 8 篇,其中 MCP 漏洞 4 篇、防御 3 篇、事件 1 篇。本月最突出的事件是 Deadbugz 恶意 MCP 服务器供应链活动:该服务器通过公开 GitHub PR 分发,单个账号在 74 分钟内对不相关的 AI 与开发者工具项目提交了 23 个 PR;服务器先提供文本格式化与摘要两个无害工具,在恰好三次工具调用后才把返回的元数据改写为搜寻 SSH 密钥、AWS 凭证、shell 历史和 Kubernetes 配置的指令,并隐藏自身行为。

  18. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 18

    NVIDIA 提出四种更安全地部署 AI 智能体的方式

    NVIDIA 技术博客提出四种更安全部署 AI 智能体的方式,针对将大语言模型接入工作流所带来的风险。文中指出 AI 智能体作为“数字同事”能自动处理缺陷报告、实现并测试修复、推送补丁再交由人工复核,从而带来生产力提升,但也因此扩大了攻击面。

  19. Adversa AI · 收录 · 原文 43

    Adversa AI 解析什么是 agent harness 以及如何加固

    Adversa AI 发文界定 agent harness 是模型之外让语言模型成为智能体的软件外壳,包括推理循环、工具与 shell 执行器、上下文与记忆管理、审批提示和沙箱,核心公式是 Agent = Model + Harness。文章认为安全边界应落在 harness 而非模型,因为拒答只是模型的偏好,而 harness 拒绝执行才构成控制。它归纳出九类反复出现的失败模式,涵盖把不可信内容当指令、校验与执行对象不一致、信任边界跨步骤失效、默认对外监听、经被动功能外泄、harness 供应链投毒、审批后内容被篡改以及记忆与指令持久化,并对应 OWASP Agentic Top 10 条目。