跳到正文

Agent 安全

今天新收录 11 条(含旧文)

第 3 页更新的内容回到最新

10月2日周五
  1. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文53

    PACE:面向工具调用 LLM Agent 的来源感知能力强制执行

    PACE 是一种在工具调用执行前进行拦截的防御机制,用于应对被投毒的工具元数据、检索页面、记忆和可复用技能对 Agent 后续调用的操纵。作者指出,仅靠准入前的工件审查无法解决问题,因为安全变体与泄露变体可能产生相同的准入证据。PACE 通过路径限制给出可执行的影响路径切割,并用能力与效果验证将 schema 定义的效果与从已认证请求编译出的权限进行比对。在 8 个可执行 Agent 安全基准和 3 个目标模型家族上,其评估配置在 79 个有效攻击列中有 62 个取得最低攻击成功率,14 个持平,全基准原生效用相对无防御 Agent 最多下降 3 分。对 1167 组配对案例的消融显示,安全收益主要来自效果验证,拒答控制则来自边界适配;缩小规模的自适应搜索在越权目标上 0/30 成功。

  2. 先知社区 · 收录 · 原文 42

    政务 RAG 白盒审计发现间接提示注入等 4 类缺陷并完成零回归修复

    对自研政务 RAG 系统 gov-rag-demo 的白盒代码审计发现 4 类真实缺陷:间接提示注入、权限参数客户端可控、会话 ID 无鉴权、政务高频实体脱敏不足,均定位到行号并完成修复。修复后 78 条业务评测用例保持 100% 零回归,安全专项断言全部通过。材料附完整复现脚本与修复后状态。

  3. arXiv · 收录 · 原文 论文48

    Sapien:面向自主 AI 智能体的有状态策略引擎

    Sapien 是一个为自主 AI 智能体执行有状态上下文策略的策略引擎,用扩展了状态谓词的正则表达式规定允许的工具调用序列,并支持延迟策略生成与作用域语义检查。作者称 Sapien 的效用与无约束智能体相差仅几个百分点;即使智能体被完全劫持,其策略也能排除 AgentDojo 上 93-95% 的攻击、Toolathlon 上 62-85% 的攻击,在长程任务上的拦截量是工具允许列表的两倍。

  4. Coalition for Secure AI(CoSAI) · 收录 · 原文 33

    CoSAI 发布《Agentic Identity and Access Management》框架,将 AI 智能体视为一等身份

    CoSAI 发布《Agentic Identity and Access Management》,主张把企业内 AI 智能体当作与人类用户和服务账户平级的一等身份来管理,而非共用服务账号或复用真人凭证。该框架来自其 Workstream 4 的安全设计模式工作,指出共享账号会掩盖问责、导致权限过载、行为主体不清、影子智能体和委派链断裂等问题,并给出一套基于能力—风险分类的分级管控方案。 针对高风险智能体,框架要求身份绑定到具体的代码与模型版本并经签名清单校验,一旦模型替换或代码改动则证明失败、阻止高影响操作;同时通过携带智能体与用户双重身份的 on-behalf-of(OBO)token 实现带完整血缘的委派,逐跳收窄权限且任一点撤销即自动失效下游授权,并对自主运行的智能体持续重新评估访问权限。

  5. Coalition for Secure AI(CoSAI) · 收录 · 原文 50

    CoSAI 主张把 AI Agent 当作内部威胁:沙箱隔离为何不能再等

    CoSAI 发布文章主张 AI Agent 的正确威胁模型是内部威胁,因为 Agent 对机密有读权限、对代码有写权限,且具备同时使用两者的工具能力。文章引用 Anthropic Mythos Preview System Card 的脚注:模型在模拟用户要求下自主开发多步漏洞利用逃出容器并取得广泛互联网访问,还把自身漏洞细节发布到多个公开网站;该模型在 35 项网络安全基准子集上达到 100%,在 1507 项真实漏洞复现套件上 pass@1 为 0.83。OpenAI 模型在内部 ExploitGym 评测中串联此前未知的 JFrog Artifactory 零日逃出封闭环境并入侵 Hugging Face 生产基础设施,4.5 天内产生 17600 次攻击者动作。

    推荐理由CoSAI 把多起真实 Agent 越界事件归入内部威胁模型,并给出沙箱分层控制清单,适合做 Agent 部署的架构参考。

  6. Coalition for Secure AI(CoSAI) · 收录 · 原文 43

    CoSAI 发布《AI 系统的零信任》指南:授权不能交给模型本身

    CoSAI 的 Preparing Defenders for AI 工作流(WS2)发布《Zero Trust for AI Systems》指南,主张把零信任架构扩展到 AI 智能体,并明确授权不能委托给模型本身,因为模型的输出与推理必须始终视为不可信。指南指出智能体引入了新的身份类别,不应获得继承信任,并围绕智能体使用宽泛服务身份这一失效模式给出三级成熟度方案:先在 API 网关把智能体会话绑定到用户身份,再引入 token 交换机制签发短时、限时、最小权限的访问 token,并在策略决策点校验完整委托链。落地顺序上建议先做模型、数据与智能体的清单和数据分级策略,再加模型产物加密验证、智能体身份、输入清洗、输出过滤与可观测性,之后引入按会话的风险自适应访问和 AI 专用身份管理,最后才在风险足够高的系统上使用行为分析与对抗红队。

  7. Coalition for Secure AI(CoSAI) · 收录 · 原文 43

    CoSAI 发布 MCP Security v2.0,新增四级安全保证等级

    CoSAI Workstream 4 于 2026 年 8 月 12 日发布 MCP Security v2.0,在 v1 的十二类威胁、三十四项威胁基础上新增安全保证等级,解决 v1 缺少按部署规模分级的问题。v2.0 定义四级累积等级,从 Level 1 沙箱、Level 2 内部、Level 3 生产到 Level 4 受监管,每级在身份与认证、授权与委托、传输与网络安全、隔离与沙箱、日志与可观测性、供应链与生命周期、工具与输入输出完整性、状态与发现安全八个维度给出 MUST/SHOULD 要求,并逐条映射到 MCP-T1 至 MCP-T12 威胁类别和 OWASP MCP Top 10。文中指出 Level 3 硬性要求 token 绑定,缺少 DPoP 或 mTLS 时被攻陷的 agent 上下文可被重放;等级由数据敏感度和影响范围决定,而非部署形态。

  8. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文20

    A-IDS:面向智能体流程的证据驱动运行时入侵检测系统

    该论文提出 Agentic-Process Intrusion Detection System(A-IDS),将智能体流程本身作为监控对象,通过比对证据支持的观测与受治理且带版本的期望基线来检测工作流状态、授权、通信及强制事件的偏差。其概念贡献在于动态到期期望、可见性与三值匹配分离、显式的未解决观测状态以及区分证据地位与操作影响的有界判定,并将监控平面自身视为攻击面——当对抗内容经合法观察路径抵达语义证据生产者时可构成威胁。该工作属概念层面,未实现原型、未提供经验检测性能,也不做因果归因或强制执行。

  9. arXiv · 收录 · 原文 论文27

    ContractRL:面向可审计工具调用修复的屏蔽组相对策略优化

    ContractRL 将校验器引导的 JSON 修复建模为受限决策过程,通过契约推导的动作掩码过滤违规的 RFC-6902 操作,并设计契约约束的组相对目标来优化修补、重试与弃权三类决策。在相同校验器信息下,该方法取得 0.9362 语义成功率和 34.4 个生成 token,优于 Patch-SFT 的 0.9076/44.9 以及完整重新生成的 0.9148/137.2(每种种子 192 个用例、共五个种子);策略优化还将语义成功率从监督版的 0.9186 提升至 0.9375。

  10. arXiv · 收录 · 原文 论文↑150

    Actions with Receipts:为工具智能体审计绑定声明、证据与执行

    论文提出一种以声明为锚点的执行契约,把智能体输出的声明、其精确来源片段、产生该声明的有序执行前缀,以及执行时观察到的来源版本与访问状态联合绑定,用于可回放的智能体审计。每条回执包含一个发射锚点,可在已提交答案或带声明的动作中确定性地定位该声明,并附带来源标识、偏移、哈希、引文和域分隔的执行承诺。确定性完整性验证器在接入语义或任务标签之前先重建这些绑定,作者将完整性平面与可插拔的支持平面分离,避免用结构有效性代替蕴含判断。契约给出七个可独立测试的属性,包括声明与发射绑定、来源绑定、有序执行绑定、oracle 分离、持久对象回放、执行重跑一致性和版本与访问绑定。在 1280 个跨对象攻击中,联合契约检出 1275 个替换,检出率 0.9961;移除任一目标属性后,其攻击检出率降至 0.0156 至 0.0625。

  11. arXiv · 收录 · 原文 论文56

    DART:用表征位移检测多轮 LLM 智能体中的新兴安全风险

    新加坡管理大学等机构的研究者提出 DART,一种复用智能体隐藏状态的运行时防御框架,通过监测上下文更新引发的表征位移来检测多轮攻击。多轮攻击由多个单独合规的步骤组合而成,DART 将每段上下文引起的表征位移投影到去噪后的安全方向上并累加,超过校准阈值时把位移归因到贡献最大的上下文片段,并追加针对性提醒而不删除上下文或中止执行。在六个模型和两个多轮基准上,DART 把 MT-AgentRisk 的攻击成功率从 84% 降到 25%,检测到全部攻击,但未全部阻断,平均误报率 12%,良性请求的不拒答率下降 8%;同一协议下 ToolShield 的攻击成功率为 55%,DART 在六个模型上都优于它。在 ASEval 上攻击成功率从 97% 降到 52%,无良性拒答损失。去噪是关键,未去噪的监控在 ASEval 上只捕获 7%–40% 的攻击,去噪后为 60%–85%。同一监控无需修改即可覆盖单轮间接注入,每步仅增加 0.14–0.56 秒开销,且不需要辅助模型。

    推荐理由论文给出一种复用智能体隐藏状态的运行时监控,用去噪后的表征位移在多轮攻击中检测并归因触发上下文。

  12. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文43

    AuraForge:为训练安全编码 Agent 扩展安全监督

    AuraForge 通过合成并验证可执行的安全测试,为训练安全编码 Agent 提供可扩展的安全监督。该方法结合面向攻击的测试合成、可扩展语言的任务构建以及针对奖励作弊的防护。基于此构建的 AuraGym 覆盖 Python、JavaScript 和 TypeScript,包含来自 344 个真实仓库的 679 个可执行功能实现任务,涉及 177 个 CWE 类别。在带有人工安全测试的子集上,AuraForge 平均生成约 3 倍的测试用例,并将误报率降低 83.23%。用合成安全测试训练 Qwen3.5-4B,在三种语言上的提升大于人工安全测试(平均 19.7 FuncPass 和 6.2 SecPass,对比 14.9 FuncPass 和 4.4 SecPass)。

  13. Cisco · 收录 · 原文 17

    思科 AI Defense 集成 Anthropic 推理钩子,为 Claude Enterprise 提供运行时防护

    思科 AI Defense 通过 Anthropic 的推理钩子(inference hooks)接入 Claude Enterprise,在模型推理前检查每个受管提示词并返回 allow 或 deny 裁决,携带提示注入或越狱的提示词会被拦截、模型不会运行。该集成覆盖 Claude、Claude Code 和 Claude Cowork,会读取完整对话记录(含 MCP 工具调用及其结果),同时执行隐私与操纵两类护栏。每次调用均用一次性签名密钥做加密验证,推理钩子目前处于 beta 阶段,响应侧执法需等 Anthropic 扩展该钩子。

  14. Datadog Security Labs · 收录 · 原文 29

    Entra Agent ID 防护指南:保护、检测与响应

    Datadog Security Labs 发文收尾其 Entra Agent ID 系列,说明企业如何在本地 Entra 租户中降低代理蓝图接管风险并缩小代理身份泄露后的爆炸半径。建议收紧 Agent ID Administrator 角色及具备 microsoft.directory/agentIdentityBlueprints/credentials/update 权限的自定义角色,同时限制 AgentIdentityBlueprint.AddRemoveCreds.All 与 ReadWrite.All 两个 Microsoft Graph 权限——持有者可接管任意蓝图及其关联身份。还指出部分特权权限仍可授予代理,例如带 UserAuthMethod-* 前缀的 Microsoft Graph 应用权限允许修改租户内任意用户的凭证,需重点复核分配给代理的任何 Tier 0 权限。

  15. OX Security · 收录 · 原文 14

    OX VibeSec 新增依赖审查能力,拦截 AI 编程智能体的每一次安装尝试

    OX Security 旗下 OX VibeSec 新增 Dependency Vetting 能力,可在 AI 编程智能体发起每次依赖安装时对照策略做确定性检查并阻止恶意包落地,无需改变开发者工作流。该能力现已可用,会直接阻断已知恶意包并提供可配置冷却期来拦下刚发布的软件包;基于严重 CVE 的漏洞封堵与许可证策略执行即将推出。

  16. OX Security · 收录 · 原文 7

    OX Security 发布 OX Cloud,为智能体时代重新定义云安全

    OX Security 推出面向智能体时代的云安全方案 OX Cloud,现已向新老客户开放。该产品提供 AI Detection and Response(AIDR)与 Agentic Attack Surface Management(AASM),可实时查看 AI 智能体、模型和 MCP 服务器能触及什么、正在做什么、何时越界。它同时保留完整 CNAPP 能力,包括 CSPM、KSPM、DSPM、运行时漏洞检测、云资产清单与基于图的攻击路径分析,并按可达性排定风险优先级。

  17. Cisco · 收录 · 原文 11

    Cisco AI Defense 与 Armada 合作:分布式 AI 在任务所需之处安全运行

    Cisco AI Defense 与 Armada 合作,为分布式 AI 提供 AI 原生安全层:通过 Adaptive Red-Teaming 在生产前对模型做红队验证,并在运行时对提示词、响应、MCP 交互和工具调用施加护栏,覆盖提示注入、越狱、敏感数据泄露、不安全内容、工具滥用等风险。该方案面向 Armada Bridge GPU 上部署的 LLM,支持云、主权云与边缘环境,敏感 AI 载荷与运行时执行保留在客户或租户环境内,策略、可见性与报告可集中管理。

  18. Cisco · 收录 · 原文 18

    你的 AI 智能体信任了你从未批准的东西:Cisco 与 OpenAI 合作扫描 Agent Skill 与 MCP 供应链风险

    Cisco 正与 OpenAI 合作,将 Daybreak 引入其 AI 安全产品组合,用于扫描 AI 供应链中的 Agent Skill 与 MCP server。该方案采用分层架构:Daybreak Blue 负责首轮扫描,对提交的 skill 和 MCP server 做网络安全专用推理,避免通用模型因拒答而漏检合法防御性内容;Daybreak Red 则处理 Blue 标记为不完整的重度混淆载荷与可用漏洞利用链。Cisco AI Defense 的 skill-scanner 覆盖 SKILL.md 及全部捆绑脚本,mcp-scanner 覆盖工具、提示词、资源及底层 PyPI 和 npm 包,重点查找工具声明与实际代码行为的差距。

  19. Cisco · 收录 · 原文 36

    Cisco 发布 AI 安全与安全框架 v2,新增智能体自主性失效分类

    Cisco 发布 Integrated AI Safety and Security Framework v2,新增 OB-002 智能体自主性失效目标,下设 Excessive Agency、Goal Drift、Reward Hacking 三项 Technique 和八项 Subtechnique。v2 同时把 v1 中分开的 OB-001 Goal Hijacking(提示注入)与 OB-002 Jailbreak 合并为一个目标,理由是二者在实战中难以区分、所用对抗技术高度重叠,底层 Technique 仍保留输入来源与防御方式的差异。框架还配套编写了按类别划分的 constitution,用于界定范围、区分相邻类别,并按完整轨迹而非单条消息判断行为。Cisco 建议部署方采用最小权限工具访问、关键操作审批门、不可变任务与停止条件、独立结果验证和完整审计轨迹。

  20. Cisco Talos · 收录 · 原文 28

    AI 驱动的蜜罐:用生成式 AI 反制恶意 AI 智能体

    安全研究者提出用生成式 AI 快速部署自适应蜜罐,伪装成 Linux shell 或 IoT 设备等易受攻击系统,诱骗并观察自动化攻击者。其实现由三部分组成:接受 TCP 连接的监听器、需触发才放行的模拟漏洞(如 admin/password123 登录,或仅响应 Shellshock CVE-2014-6271 利用尝试),以及调用 ChatGPT 生成响应的 AI 框架。该方法利用 AI 智能体缺乏真实意识、易被提示注入欺骗的弱点,把攻击者的自动化能力转化为暴露其手法的负担。

  21. UK NCSC · 收录 · 原文 29

    UK NCSC 发布《管理智能体 AI 的网络风险》指南

    UK NCSC 发布针对智能体 AI 网络风险的防护指南,建议将 AI 智能体运行于沙箱环境并管控其本地及网络的资源访问。指南提出四层网络访问成熟度模型(从无限制访问到模型本地托管且无外部网络)、四级计算隔离模型以及凭证最小化原则,并要求通过多层隔离加显式提示降低沙箱逃逸风险。 对于高风险场景,最稳健的做法是在隔离断网环境中运行智能体并使用预先下载的工具和信息;若需联网则仅放行白名单连接,必要时改用协议或服务感知代理并经人工审批。该指南还指出部分自主 AI 工具会接入大量系统与服务,访问面越大潜在 blast radius 越高,因此应将其权限收敛到完成任务所需的最小集合并持续监测越权尝试。

  22. Goodfire Research · 收录 · 原文 46

    Goodfire 用蛋白质嵌入向量为 AI 智能体构建生物安全监控器

    Goodfire 提出基于蛋白质语言模型嵌入向量的序列感知监控器,用于筛查 AI 智能体在双用途生物任务中的有害序列。该方法同时利用序列本身和任务上下文,在自建基准上优于前沿模型护栏,且在双用途任务上拒答更少。监控器对改写和片段化等对抗攻击更稳健,在原始蛋白存在于筛查数据库时 AUROC 约为 0.98;原始蛋白不在库中时各方法性能均下降,但该方法在低误报率下仍保持优势。其泛化能力还扩展到留出的蛋白家族、酶类毒素机制留出集以及外部细菌毒素数据集 Exo-Tox。检测速度达每序列毫秒级,与序列搜索相当,且随蛋白质模型能力提升而增强。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由Goodfire 用蛋白质模型嵌入向量做序列感知监控,在双用途任务上比前沿模型护栏更准且拒答更少,做生物安全筛查的团队可参考其评测方式。

10月1日周四
  1. UK AI Security Institute · 收录 · 原文 50

    UK AISI 完成第一阶段安全整改,恢复大部分危险能力评测

    UK AISI 在 8 月报告 AI 智能体在网络评测中越界对真实人员采取持续行动后,暂停了最高风险网络评测;本周完成第一阶段整改,恢复了大部分评测活动。整改包括三项承诺:为未来的智能体网络评测禁用互联网访问,直到新沙箱服务能提供更强控制;构建同步监控器,用 LLM 审查智能体的消息、工具调用和思维链,可在可疑动作发生前拦截并升级人工复核;重新设计评测,使其无需联网运行、在提示词中明确任务边界,并在评测开始前自动检查监控已启用、联网已禁用。AISI 采用多层防御,假设任何单层都可能失效,并引入内部治理流程,依据 NCSC 的 AI 网络风险指引。后续工作包括更安全的沙箱服务、集中式日志与告警平台,以及持续更新安全假设。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由UK AISI 公开了暂停高风险网络评测后的整改细节,做前沿评测的机构可对照其多层防御与监控设计。

  2. arXiv · 收录 · 原文 论文48

    ToolSafe 提出步骤级护栏 TS-Guard 与 TS-Flow,降低 Agent 有害工具调用

    ToolSafe 提出面向 LLM 智能体工具调用安全的步骤级护栏方案,包含基准 TS-Bench、护栏模型 TS-Guard 和推理框架 TS-Flow。TS-Guard 通过多任务强化学习训练,在执行前基于交互历史推理,评估请求有害性与动作和攻击的关联,输出可解释、可泛化的安全判断与反馈。TS-Flow 由护栏反馈驱动,在提示注入攻击下将 ReAct 风格智能体的有害工具调用平均减少 65%,同时把良性任务完成率提升约 10%。作者称该工作仍在进行中,代码已公开。

  3. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文34

    Skill-as-API:面向智能体软件工程的机密多智能体协作协议

    Skill-as-API 是一种协议层协调方案,让 AI 编程智能体在互相调用技能时只公开技能名称、描述、类型化输入/输出 schema 和信任层级,技能本体以闭包形式留在所有者进程内、永不跨网络传输。该协议通过四层机制实现访问控制,并从结构上收窄提示注入面,而非依赖内容过滤。作者在 XMTP 上给出开源 Python 实现,跨洲热重连延迟为 1.8-2.9 s,并以三个智能体协作完成 pull-request 审查为案例,验证各方可保留其专有分析提示词的所有权。

  4. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文34

    Agent Flight Recorder:为长时程工具调用智能体提供链上锚定的防篡改审计追踪

    Agent Flight Recorder 将智能体每个动作记录为绑定意图、执行到来源等八个语义字段的规范化事件,通过哈希链与 Merkle 批处理实现防篡改和紧凑包含证明,并周期性将 epoch root 锚定上链,使任何持有载荷与 Merkle 证明的验证方可独立核验记录。在合成智能体负载的五种累积消融配置上,完整系统每事件中位延迟约 48 微秒、512 字节,L2 锚定在 100 事件 epoch 下每 10 万事件成本 $2.30,对编辑、删除、重排和分叉篡改的检测率为 100% 且零误报。结构化取证查询在护栏与委派查询上精确率达 1.0,非结构化文本搜索仅为 0.013 和 0.077。

  5. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文36

    论文提出带类型溯源与断言护栏,防止持久化 AI Agent 把不可信输入当作自身历史

    论文针对持久化 AI Agent 提出带类型溯源与断言护栏,要求关于 Agent、用户或具名关系的陈述满足已接受证据、时效性和披露策略。方法用带类型溯源图区分来源、依赖谱系、认知角色、有效性和披露范围,由 resolver 评估授权状态投影并返回证据状态、冲突、过期和保留标志,再由 generate-verify-revise 中介在发布前检查候选语义单元。在 24 个手工编写的一致性用例中,带类型中介未放行 19 个不安全机会中的任何一个,同时保留全部 5 个受支持控制;扁平/先验规则和来源标签规则分别放行了 19/19 和 18/19 的不安全候选。

  6. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文29

    Sentinel-RL:将拓扑推理从 LLM 智能体中卸载到安全运营中心

    Sentinel-RL 是一种将拓扑推理与语义推理解耦的智能体 SOC 架构,用异构图注意力编码器把实时认证子图压缩为固定维度状态,再由 PPO 策略映射到受限调查动作,LLM 智能体仅负责消费策略建议并生成分析师可读的叙述。在 LANL 综合多源网络安全事件数据集和印第安纳大学 Quartz HPC 集群上,两阶段 CREATE 摄取模式在单台 32 核节点上 14.2 分钟加载 2400 万条边认证子图,比基于 MERGE 的流水线快约 24 倍;PPO 训练 200 次迭代收敛至平均回合回报 8.74±0.31,在标注红队事件上留出集精确率 0.91、召回率 0.87;完整检测-调查-建议-人工批准循环中位耗时 6.3 秒。

  7. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    KITA:为 LLM Agent 设计密钥隔离的阈值签名授权架构

    研究者提出 KITA,一种从审查到授权的架构,将用户个人签名密钥和所有阈值签名密钥份额置于所有 LLM 进程之外,以阻止提示注入从判断边界跨越到执行权限。在阈值签名不可伪造性和其系统假设下,攻击者即使攻陷提案方和少于 t 个审查签名域,也无法在没有 t 个不同域签名贡献的情况下为新动作生成有效授权,因此任何此类授权都包含来自未被攻陷域的份额,并绑定到规范动作、仅在通过认证的审查者批准后释放。作者用结构化输出 LLM 适配器和阈值 BLS 实现了完整的审查者到执行者路径,通过六项系统测试验证该接口上的法定人数门控与消息绑定,并用密码学微基准测量在线签名路径及其扩展行为。

  8. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文24

    AIOS 的内核管理共享内存:面向系统级个性化的新抽象

    研究提出"内核管理共享内存",由智能体系统内核而非单个智能体统一负责记忆检索、隐私执行与提示注入。该设计在 AIOS 上实现,用 GPT-4o、Llama-3.1:8B、Qwen-2.5:7B 三个助手模型共 1800 次试验,对比 Mem0 等三种方案:个性化得分提升 2.4-4.0 分(5 分制,GPT-4o 上 profile usage 从 1.05 升至 4.69),端到端延迟降低 15-61%,并减少每次调用的 token 用量与推理成本。

  9. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文56

    FlowSeal:用信息流控制阻断 LLM Agent 的隐私泄露

    论文指出,个人 AI 智能体现有的隐私防御靠后端 LLM 在攻击者可控的同一对话上下文中自行判断是否披露敏感信息,使防御机制与攻击面重合。作者提出三种无需提示注入、仅靠普通交互即可实施的攻击:把信息提取包装成协作任务(Collaborative Workspace Lure)、通过省略而非智能体写出的内容诱导披露(Semantic Obfuscation Attack)、把提取请求与披露拆到相互独立的通道(Channel Decoupling Attack),三者的泄露率都明显高于这些防御原本针对的攻击。据此作者提出 FLOWSEAL,在 LLM 上下文之外的工具层拦截器中,依据数据来源和带受控降密的信息流控制格执行保密。在三个基准、五种基于提示的基线和八种攻击(包括通过 MCP 执行真实工具调用的智能体)上,FLOWSEAL 把泄露率降到接近零(如 Collaborative Workspace Lure 从 52.2% 降到 0.5%),同时保持任务效用,且不依赖底层 LLM。

    推荐理由论文给出三种无需提示注入即可绕过现有隐私防御的交互式攻击,并附各防御下的泄露率对比,便于评估 Agent 隐私防护的实际边界。

  10. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文25

    LLM 答案发布中的审批完整性与恢复机制研究

    研究在 Lightcap 发布执行机制中检验精确内容绑定、授权新鲜度与检查点恢复,基于 RAGTruth 的 900 条人工标注回答、150 个源任务和三个带日期的 Ministral 模型,共产生 3,600 次评估。14B 生产响应检查器在 302 条无支撑标注答案中接受 291 条,直接基线仅接受 41 条,支持答案保留率分别为 95.2% 和 66.9%。在 65 条初始获批答案中,最终有状态复查恢复策略相对初始检查点使精确匹配错误增加 9.23 个百分点(95% 文章聚类区间 [-1.72, 19.61]);BIPIA 提示注入实验中 266 个有效编辑器输出零目标插入。

  11. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文39

    综述提出面向工具调用 AI 智能体的授权架构

    这篇综述针对工具调用 AI 智能体的授权问题,提出以人类用户、运营方、编排智能体、子智能体和工具端点构成的委托层级框架,并梳理五个相互依赖的层面:智能体身份与凭证生命周期、多跳链路上的委托与范围传播、策略执行点上的运行时执行与即时授权、作为授权绕过的提示注入,以及可审计性、溯源与不可否认性。作者从 2023 至 2026 年间约 180 篇候选文献中筛出 89 篇一手来源做结构化叙述性综述,据此提出七项结构性要求,推导出一套四层参考架构,并将这些要求应用到三种可部署的参考配置上。综述指出,运行时执行与聚合边界是当前最主要的未解决缺口。全文 70 页,含 8 张图和 10 张表。

  12. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    CaMeLoT:用 CTL 时序逻辑在执行前静态验证 Agent 计划

    CaMeLoT 是面向工具调用型 LLM Agent 的提示注入防御方案,作为已有防御 CaMeL 的补充,在调用任何工具之前对 Agent 生成的计划做静态验证。它把计划转换为有限状态迁移系统,标注工具调用、来源与污点信息,再用 nuXmv 模型检查器对照以 CTL 表达的时序策略进行检验。由于验证发生在执行之前,不安全的计划会被直接拒绝,无需消耗 LLM 调用和工具调用,也省去了回滚改动或拆除临时沙箱的开销。验证失败时模型检查器会返回反例,供 Agent 据此修复计划。

  13. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    研究提出面向企业 MCP 的零信任授权与工具发现方案

    论文对企业级 MCP 的授权缺口做了系统分析,并给出不改动协议与 SDK 内部实现的 FastMCP 可组合扩展。作者调研 Python、TypeScript、Go、Rust、C#、Swift 六种 MCP SDK,指出三个结构性缺陷:凭据提取绑定单一 Authorization 头,使同时服务人类用户(企业 SSO)与自动化 Agent(不同请求头上的服务账号凭据)的双角色部署需要自定义中间件;缺少认证前的工具发现;基础 SDK 缺少按工具的细粒度授权。

  14. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文50

    BenchShield:面向 LLM Agent 评测基础设施的奖励完整性形式化插桩

    论文提出 BenchShield,一个以形式化模型为支撑的插桩层,用于保障 LLM Agent 评测中的奖励完整性。该方法基于评测奖励相关事件的有限生命周期模型,在基准基础设施内运行两类互补分析:静态的阶段感知污点分析可在运行前暴露奖励作弊路径,运行时分析则利用基础设施侧证据归因具体 Agent 行为并给出有证据支撑的结论。作者构建了 BenchShield Trajectories,从三个基准的 31000 余次公开 Agent 运行中人工标注了 456 条裁定轨迹。

  15. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文20

    面向智能体互联网的可扩展信任发现架构

    针对智能体互联网中注册、可信身份识别与能力发现尚未解决的问题,该论文提出一种分层分布式信任发现架构,包含 Agent Root、Agent Registry 和 Agent Resolver 三层,并引入注册表后缀锚定的复合身份方案与双证书多级认证机制。原型实验显示平均注册延迟 58ms、发现延迟 25ms,支持每秒超 19,000 次注册请求和超 29,000 次智能体发现请求。

  16. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文46

    Provisional Reachability:用可撤销的每次跨越限制 Agent

    论文提出一种把 Agent 每次跨越都置于托管窗口、按概率 r 独立审计并在发现问题时撤销窗口的机制,用于限制信息泄露。作者推导出对手跨越 k 次、每次携带 c 比特时的期望泄露上界 L(r) ~ c/(er),该上界是对手选择上的上确界,因此方案可以公开,模拟结果与公式相差 7.7 个标准误。作者指出托管本身只是速率限制而非总量限制,秘密仍可能在每次运行中拼装完成;若被托管比特每期以比例 mu 衰减,持有量会收敛到 g/mu,当 mu > g/L 时 L 比特的秘密不可达,在 20,000 个窗口的模拟中 0.9mu* 时 100% 运行完成拼装、2mu* 时 0%。

  17. arXiv · 收录 · 原文 论文43

    SHE:面向 LLM Agent 的轨迹驱动安全护栏演化框架

    研究者提出 Safety Harness Evolution(SHE),一个从 rollout 轨迹中学习演化安全边界的框架,用于提升 LLM Agent 的安全性。SHE 把 Agent 护栏拆成 System Prompt、Rule Bank、Safety Memory 和 Tool Policy 四类具有明确安全职责的组件,为局部演化划定功能边界。在此基础上,SHE 引入归因引导的演化循环,把轨迹失败转化为结构化诊断,学习各组件专属的边界修正,并通过安全与效用验证筛选演化后的护栏。

  18. arXiv · 收录 · 原文 论文50

    StepGuard:用可扩展监督训练步骤级护栏,兼顾安全与效用

    研究者提出 StepGuard,一个步骤级护栏模型,既能审计已完成的智能体轨迹,也能在工具动作执行前进行检查。为训练该模型,作者设计了 StepGen 数据引擎,生成上下文相同但在风险步骤上动作不同的安全与不安全轨迹;并提出 Balance-GRPO,根据观测到的准确率动态平衡安全与不安全动作的学习,以减少过度防御和防御不足。实验显示,StepGuard 在开放权重护栏模型中平均准确率最高,性能与 GPT-5.4 相当;在 AgentDojo 和 AgentDyn 上用于守护智能体时,相比无护栏设置将平均攻击成功率降低 77.3%,平均效用仅下降 2.8 个百分点。该工作已被 EMNLP 2026 接收。