跳到正文

#防御/护栏

今天收录 2 条

第 2 页更新的内容回到最新

9月25日周五
  1. arXiv:越狱与提示注入 ·

    MetaPermit:通过 LLM 推断元属性为 AI Agent 提供可扩展可审计的访问控制

    MetaPermit 是一个基于策略的 Agent 工具访问控制框架,将语义推断与安全执行解耦,以应对工具误用和间接提示注入攻击。它通过分析 Agent 与用户的交互,提取一组紧凑且与任务无关的元属性,刻画用户意图、执行上下文与拟调用工具之间的关系,从而无需枚举用户意图即可授权工具使用。运行时由 LLM 推断每次工具调用的元属性取值,再由固定策略据此允许或拒绝调用,使每个决策都可依据推断值和策略规则审计。

  2. arXiv:越狱与提示注入 ·

    基于加密绑定身份验证能力令牌协调分布式 AI 智能体的提案

    针对自主 AI 智能体面临的提示注入攻击与凭证泄露风险,该提案提出一种基于能力安全原则的框架,利用 OAuth Agent Authorization Profile 及 W3C DID 和 VC 标准,让智能体通过加密绑定其身份与签发者身份、并限定作用域的令牌访问服务。服务方可验证委托链仅涉及权限衰减后再执行令牌操作。该安全层位于语言模型上下文窗口之外的安全模块中,使智能体能在可强制执行的安全边界内行动。

  3. arXiv:越狱与提示注入 ·

    研究者提出面向邮件 Agent 的攻击链建模提示注入检测框架

    研究者提出一种面向 LLM 邮件助手的提示注入检测框架,把攻击建模为分阶段链条,而非单纯的恶意文本二分类。该框架结合文本检测器、各阶段专用验证器、显式规则风险信号、用户意图与动作一致性分析以及 logistic 决策策略,并从提示注入数据集中推导出攻击链标签。在随机划分、时间阶段迁移、条件阶段迁移、跨数据集迁移和消融实验中,结果显示随机训练测试划分会明显高估分布偏移下的鲁棒性,框架中较晚的工具参数阶段比早期阶段更易预测。在五个二分类基准上,该框架在严格阈值策略下平均 F1 为 0.406,而五个未额外训练的预训练检测器中最强者为 0.216。研究还表明,用与攻击相似的无害邮件训练有助于降低误报,同时保留检测真实攻击的能力。

9月24日周四
  1. Google Threat Intelligence(GTIG) ·

    Google GTIG 发布 CI/CD 与代码流水线主动防御蓝图

    Google Threat Intelligence(GTIG)发布面向软件与平台架构师的 CI/CD 安全防御蓝图,围绕端点、IDE、AI 辅助安全等五个支柱给出加固措施。文中指出攻击者正通过 GitHub Actions 缓存投毒、OIDC token 提取和篡改可变 action 标签发布带合法来源证明的恶意包,并已开始向开源 MCP 包植入恶意代码、诱骗 AI 编码智能体。建议仅使用经批准的大语言模型与 AI 智能体做合并前漏洞分析,将 .env 文件排除出上下文窗口,并保留人工审核环节。

  2. Wiz Research ·

    Wiz 联合 Google DeepMind 发起 Scan for Good,用 AI 排查公共服务与关键基础设施暴露风险

    Wiz Research 启动 Scan for Good 计划,借助 AI 加人工研究员的方式,帮助公共服务、关键基础设施和非营利组织在网络犯罪分子之前发现并修复高危暴露问题。该计划由 Google DeepMind 提供合作,并与美国网络安全和基础设施安全局(CISA)协作推进。 早期成果已验证其效果:团队通过自主运行的 AI 系统发现了大量面向公网的严重暴露,并在受影响组织的配合下完成了修复,其中一起是国家档案馆管理员密钥泄露,导致 880 万个文件面临读写删除风险。

  3. arXiv:越狱与提示注入 ·

    AEGIS:用内部信号在中间层拦截大型音频语言模型越狱

    论文提出 AEGIS,一种针对大型音频语言模型(LALM)音频越狱的检测后干预防御方法。逐层探针显示,风险相关信息在中间层表示中仍可解码,但内部风险信号未能在后续层转化为拒答,作者将这一差异称为风险到拒答的缺口。AEGIS 据此在中间层设置风险门控,选择性激活下游安全适配器。在六个 LALM 和三个异构音频越狱基准上,AEGIS 将平均不安全率从 17.9% 降至 0.4%,对良性输入的过度拒答仅有小幅上升。代码已公开,论文投稿至 ICASSP 2027。

  4. arXiv:Agent 与 MCP 安全 ·

    skilder:以角色化技能包为工具型 LLM 智能体做访问控制

    作者提出 skilder 框架,把能力打包成角色,即技能、工具、指令及其边界的组合,智能体从最小角色目录起步,按任务需要学习角色,并通过单一 MCP server 获取该角色的技能、指令和工具。由于工具只在已学到的技能内到达智能体,同一 server 可确定性地执行所学范围。作者在 13 项任务、6 个模型、每个 10 次运行的设置下,将 skilder 与扁平上下文工具选择和多智能体编排对比;结果显示,当模型完成发现流程并发出受治理调用时,skilder 的模拟授权层未执行任何未授权工具调用或参数违规,例如超支。总体任务通过率还反映各模型是否遵循发现协议并通过回答质量检查,这些未通过不属于授权失败。

9月23日周三
  1. arXiv:后门、投毒与隐私 ·

    ODPure:通过集成破坏共识实现目标检测后门净化

    ODPure 是一种面向目标检测的输入阶段黑盒后门防御方法,通过破坏-重建-选择(CRS)范式净化输入,无需丢弃恶意数据或模型即可维持稳定的感知流。该方法利用多种破坏方式中和触发器、生成大量冗余候选框,再借助生成先验恢复细粒度结构线索,最后通过投票对检测结果达成共识。实验表明,ODPure 能抵御多种后门攻击与触发器类型,同时保持基线精度。

  2. arXiv:越狱与提示注入 ·

    PALS:面向全双工语音对话模型对抗鲁棒性的心理声学对齐潜空间平滑

    论文将针对全双工语音对话智能体的不可感知攻击形式化为在载体语音心理声学掩蔽阈值之下的加性扰动优化,目标包括定向语义劫持、响应抑制和策略越狱。在未防御的 Moshi 类智能体上,白盒攻击成功率最高达 91.7%。作者提出心理声学对齐潜空间平滑(PALS),在残差向量量化潜空间接口注入由局部码本协方差塑形的各向异性高斯噪声,输入噪声由掩蔽阈值塑形以约束攻击者,并用 Kullback-Leibler 一致性目标训练。PALS 无推理时开销,将劫持降至 8.3%、静音降至 11.2%、越狱降至 9.1%,干净质量损失在 2.3% 以内。其蒙特卡洛平滑变体可认证的椭球潜空间半径最高为 0.616,经验鲁棒性远超这一保证下限。

  3. arXiv:对齐与欺骗 ·

    Fed-ADR:用恶意编排服务器协同客户端梯度操纵攻击联邦学习

    研究者提出 Fed-ADR,一种由恶意编排服务器(OS)实时协调异构对抗客户端、动态调整梯度更新的联邦学习攻击框架,可绕过多种现有防御。在 MNIST、Fashion-MNIST 和 CIFAR-10 上,该攻击将全局准确率从 90% 以上压到 10% 以下。配套检测机制从历史更新估计客户端真实梯度,可在数轮内识别恶意客户端并把准确率恢复到 90% 以上,计算开销比从头重训降低至少 20 倍。

9月22日周二
  1. arXiv:越狱与提示注入 ·

    Universal Fractal Natural Language Decision Map:werr 边缘运行时实现 0 字节 VRAM 决策

    论文提出 Universal Fractal Natural Language Decision Map,通过 werr 机器原生边缘反射运行时与 answerr 平台实现,完全不存储权重张量(0 Bytes VRAM),沿 Mandelbrot 集混沌边界调制 24 字节坐标种子合成确定性决策。其语义 token 阻尼滤波器(T_desc = 0.045)实现 0.0% 提示注入绕过(95% Wilson CI: [0.0%, 27.8%]),并将迭代剪枝 45.8%、吞吐提升 2.5 倍至 3.31 ms 延迟。

  2. arXiv:越狱与提示注入 ·

    研究用 XAI 归因分析 Prompt Guard 2,同义词替换可翻转其提示注入判定

    研究以可解释性方法分析分类器护栏 Prompt Guard 2 如何区分恶意与良性提示词。作者用 Vanilla Gradient 和 SHAP 归因开展四项实验,发现其判定依赖大量 token 的累积贡献而非少数主导 token,但依据显著性做同义词替换和句子级改写,只需改动中等比例文本即可翻转预测,部分情况下还成功越狱底层大语言模型。数据集规模的显著性分析显示,未被检出的注入提示词系统性地缺少分类器依赖的词汇标记。作者据此讨论分类器护栏的设计与评估,并指出用于提升透明度的解释方法同时也会降低构造对抗绕过的成本。

9月21日周一
  1. arXiv:Agent 与 MCP 安全 ·

    ActGov:用策略约束校验治理 LLM Agent 的工具动作

    ActGov 是一个运行时执行框架,在 LLM 提出的每个工具动作产生外部影响前先做校验。它基于授权、动作、运行时上下文与安全约束的统一语义模型:ActGov-Policy 从工具规格、良性任务和已观测的失败轨迹中迭代构建策略集,每次更新都用基于 SMT 的反例检查验证;ActGov-Runtime 在运行时把每次工具调用抽象为有限策略记录,只有当调用处于任务范围内的授权边界内且满足所有适用策略时才放行。作者在 AgentDojo 和 AgentDyn 两个基准上跨多个模型和攻击配置做了评测,称 ActGov 在保持任务效用的同时持续降低间接提示注入攻击的成功率,明显优于现有防御,且不依赖底层 LLM 正确识别恶意指令。

9月20日周日
  1. arXiv:对齐与欺骗 ·

    StyleAT:用对抗训练防御人脸识别的语义攻击

    针对人脸识别模型易受对抗性语义编辑(如轻微老化或姿态变化)攻击的问题,研究者提出语义攻击 BoundStyle,在 StyleGAN 潜空间中最大化误分类率,攻击成功率高的同时比现有 SOTA 攻击快约 9.5 倍。基于 BoundStyle 构建的对抗训练方案 StyleAT 采用低预算攻击变体,却能防御更强和未见过的语义攻击。在两个训练中未见的数据集和七个模型上,StyleAT 提升了针对 SOTA 攻击的鲁棒准确率,并在多种设置下优于常见防御方法。

  2. arXiv:对齐与欺骗 ·

    VidMark:面向视频生成模型知识产权保护的高效水印方案

    研究者提出一种生成内嵌水印方案,用于视频生成模型(VGM)的合成视频验证与模型所有权验证两项取证任务。方案包含名为 VidMark 的视频水印网络,结合两级离散小波变换(DWT)分解与全局时序注意力模块(GTAB),并通过解码器引导的微调让 VGM 生成携带模型专属水印的视频。在代表性 VGM 上实验显示,水印提取准确率超过 99%,两项验证任务准确率均达 100%,且对视频级与模型级攻击具有强鲁棒性。

9月19日周六
  1. arXiv:Agent 与 MCP 安全 ·

    当智能体信任跨越组织边界:结构外化与信任证据参考模型

    论文提出 Trustworthiness as a Service(TaaS),用于解决智能体跨组织边界调用工具、服务与其他智能体时,依赖方无法仅凭生产域控制与记录评估被委托动作的问题。其分析单元为跨域依赖命题,通过三条件结构外化诊断识别需多域依赖、生产方独立验证且须在撤销、失败、记录冲突或争议后仍可复核的命题,并为此设计不可变工作流清单与仅追加、发行方可归属的信任证据信封。论文还给出拓扑中立的逻辑参考模型,并以三个分析场景和 TaaS-Eval 协议提案定义清单、独立消费者、硬门控、对抗性证据测试与指标。

  2. arXiv ·

    MATE:面向移动 Agent 的策略感知安全审计方法

    研究者提出 MATE,一个轻量的策略条件审计器,同时编码 Agent 轨迹与自然语言安全策略,判断轨迹是否违反给定策略并给出原因。由于把策略当作可编辑文本而非固定模型参数,MATE 无需重新训练即可适配用户自定义和不断变化的要求。作者从全球数百个热门移动应用中抽取应用描述、工作流和策略构建知识库,并用多阶段流水线合成超过 140K 条语义真实的策略条件轨迹。团队同时发布 MATEBench,包含两个合成子集和一个由人工收集轨迹构成的真实子集。

  3. arXiv:Agent 与 MCP 安全 ·

    可信智能体 AI:基于 LLM 的自主系统失效模式、缓解策略与 TADL 生命周期框架

    一篇 arXiv 综述梳理了基于大语言模型的智能体 AI 在安全与运维上的五类可信维度:安全与鲁棒性、对齐与人类监督、透明度与可审计性、隐私与数据治理、监管合规。文章把间接提示注入、后门触发、目标泛化错误、记忆污染和跨会话数据泄露等失效模式归入统一分类,并评估指令层级、上下文隔离、spotlighting、过程监督、受限工具使用和隐私保护记忆等缓解手段,区分有实证支持与仍属概念性的方法。作者据此提出六阶段 Trustworthy Agent Development Lifecycle(TADL),覆盖规格、设计、训练、评估、部署与监控,但该框架尚未经实证验证。

  4. arXiv:越狱与提示注入 ·

    研究提出面向企业 MCP 的零信任授权与工具发现方案

    论文对企业级 MCP 的授权缺口做了系统分析,并给出不改动协议与 SDK 内部实现的 FastMCP 可组合扩展。作者调研 Python、TypeScript、Go、Rust、C#、Swift 六种 MCP SDK,指出三个结构性缺陷:凭据提取绑定单一 Authorization 头,使同时服务人类用户(企业 SSO)与自动化 Agent(不同请求头上的服务账号凭据)的双角色部署需要自定义中间件;缺少认证前的工具发现;基础 SDK 缺少按工具的细粒度授权。

  5. arXiv:Agent 与 MCP 安全 · 84

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    特拉维夫大学研究者提出爆炸性提示词(explosive prompt),一种把恶意载荷写成条件语句、在攻击者选定的触发词出现前保持休眠的间接提示注入形式,无需训练即可在推理时植入单条检索内容。在 896 对配对样本上,同一恶意目标改为休眠条件式后,在拒绝直接指令的前沿模型上仍能触发真实工具调用,Grok-4.20 从 0.0% 升至 34.2%,Llama-3.1-70B 从 0.1% 升至 26.1%,七款模型配对均值 16.5% 对 2.4%。已部署的注入分类器 Prompt Guard 2、PIGuard、PIShield 在其工作阈值上校准失当,1% 误报预算下最多只拦住 52.7%;偏好优化模型 SecAlign 完全阻断直接注入,却仍执行 11.8% 的爆炸性提示词,且全部在触发轮触发。

    推荐理由论文把条件触发式提示注入与普通注入做了配对实测,并给出九款生产 Agent 的绕过率,部署 Agent 的团队可据此检查检索内容的摄入环节。

9月18日周五
  1. arXiv:越狱与提示注入 ·

    CASCADE 研究:跨流水线阶段的越狱防御组合评估

    论文提出 CASCADE 决策框架,在直接、黑盒、单轮攻击的统一威胁模型下,系统研究 LLM 越狱防御在流水线阶段内与跨阶段的组合效果。研究用带受控查询预算的攻击成功率公式和明确的公平性规则统一评估口径,覆盖 19 种攻击与 15 种防御。结果显示没有单一防御在所有场景下最优,但精心选择的组合能在效用损失极小的前提下取得显著安全提升,并据此给出分层防御流水线的实用建议。该工作已被 EMNLP 2026 Findings 接收。

  2. arXiv:越狱与提示注入 ·

    HE-Guardrail:面向加密大模型推理的同态护栏防御越狱攻击

    作者指出,基于同态加密的大语言模型推理存在一个安全漏洞:服务端在无法接触明文的情况下,既看不到客户端提交的提示词,也看不到模型生成的回复,因此恶意客户端的越狱攻击难以被检测或拦截,甚至可能完全不被服务端察觉。为此作者提出 HE-Guardrail 框架,在加密数据上完整执行护栏机制,并以同态方式控制目标模型的回复是否返回给客户端。该框架以 Llama Guard、JBShield 和 GradSafe 三种代表性护栏进行实例化,结果显示其在密文域中能较接近地复现对应明文护栏的判定,并在安全性、效率与可用性之间呈现不同的权衡。

  3. arXiv:越狱与提示注入 ·

    用扩散模型隐空间扰动防御视觉语言模型的地理位置隐私泄露

    研究系统考察了多模态大推理模型(MLRM)从日常照片推断用户地理位置带来的隐私泄露,发现基于拒答的防护严重不足,精心构造的越狱提示词可将模型响应率提高到 100%。作者指出,现有在像素空间注入不可见扰动的防御受结构性限制,黑盒迁移性下降且出现明显视觉伪影。为此提出一种基于扩散模型的主动防御框架,在反向采样过程中向扩散模型隐空间注入扰动,直接作用于高层语义表示,并以与 GPS 坐标对齐的 GeoCLIP 作为代理模型定位和破坏 MLRM 用于位置推断的地理信号。该方法在保持图像感知质量的同时获得更强的黑盒迁移性,便于在社交媒体平台集成。该工作已被 NDSS 2027 接收。

  4. arXiv:Agent 与 MCP 安全 ·

    Provenance-Aware Transformers:用来源感知架构分离可信边界以防御间接提示注入

    论文提出 Provenance-Aware Transformers,一种让应用提供的来源标签在模型内部生效的防御方法,用于应对大语言模型的间接提示注入问题。作者指出标准 Transformer 缺乏来源权威性的架构概念,检索文档、用户输入与系统指令都经过同一套注意力机制处理,模型只能从措辞推断该服从什么、该把什么当作数据。该方法为每个输入 token 分配编码其来源的 ring ID,并加入 origin embedding、可学习的 origin attention bias 和可学习的 origin scale,以在归一化过程中保留来源信息,从而在生成时对权威与非权威来源施加结构性边界。

9月17日周四
  1. arXiv ·

    面向旧款 GPU 的可验证差分隐私训练框架:用 CPU 侧 TEE 校验 GPU 梯度

    论文提出一种在旧款 GPU 上实现可验证差分隐私(DP)训练的框架,用 CPU 侧 TEE 配合不受信任的 GPU 完成校验。作者指出,零知识证明等密码学方案开销过大,有时高出数个数量级,而支持大语言模型训练与微调的多 GPU TEE 仅限较新平台,在旧款 GPU 上缺失或效率低下。该设计把昂贵的梯度计算卸载到 GPU,由 CPU TEE 通过概率性检查验证梯度上 DP 是否被正确执行,以缓解全在 CPU TEE 内训练过慢、无限制卸载又可能被恶意偏离 DP 的效率与安全矛盾。框架能以高概率检测频繁的完全偏离;在本文评估的面向效用的伪造梯度攻击中,稀疏偏离带来的效用收益有限,也未观察到可测量的额外成员泄露。

  2. arXiv:对齐与欺骗 ·

    面向智能体互联网的可扩展信任发现架构

    针对智能体互联网中注册、可信身份识别与能力发现尚未解决的问题,该论文提出一种分层分布式信任发现架构,包含 Agent Root、Agent Registry 和 Agent Resolver 三层,并引入注册表后缀锚定的复合身份方案与双证书多级认证机制。原型实验显示平均注册延迟 58ms、发现延迟 25ms,支持每秒超 19,000 次注册请求和超 29,000 次智能体发现请求。

  3. NVIDIA NeMo Guardrails 版本发布 ·

    NVIDIA NeMo Guardrails v0.24.1 发布

    NVIDIA NeMo Guardrails 发布 v0.24.1 补丁版本,集中修复若干缺陷。该版本修正了 benchmark 中 Locust 并发测量与扫描、content-safety 对 Nemotron 3.5 响应的解析、server 在 IORails 准入丢弃时返回过载响应,以及 rails 对组合配置加载 config.py 的问题。

9月16日周三
  1. arXiv:越狱与提示注入 ·

    CaMeLoT:用 CTL 时序逻辑在执行前静态验证 Agent 计划

    CaMeLoT 是面向工具调用型 LLM Agent 的提示注入防御方案,作为已有防御 CaMeL 的补充,在调用任何工具之前对 Agent 生成的计划做静态验证。它把计划转换为有限状态迁移系统,标注工具调用、来源与污点信息,再用 nuXmv 模型检查器对照以 CTL 表达的时序策略进行检验。由于验证发生在执行之前,不安全的计划会被直接拒绝,无需消耗 LLM 调用和工具调用,也省去了回滚改动或拆除临时沙箱的开销。验证失败时模型检查器会返回反例,供 Agent 据此修复计划。

  2. arXiv:越狱与提示注入 ·

    用 cunning questions 训练 LLM 警觉性,将九组模型基准平均 ASR 从 17.40% 降至 15.05%

    论文提出用 cunning questions 培养大语言模型的警觉性,这类问题不一定与安全相关,但包含误导性前提、非常规推理或细微不一致。作者假设学会识破这类推理陷阱可以迁移到安全关键场景。实验显示,Cunning 训练提升了对分布外越狱攻击的鲁棒性,并增强了后续安全微调的效果;将其加入现有最先进的安全对齐流程后,在九个骨干模型与基准组合上把平均 ASR 从 17.40% 降至 15.05%。匹配安全微调后的轨迹分析表明,安全判断更可能在有害规划开始前主导模型响应。论文还给出条件性理论分析,刻画从 cunning 数据学到的不变性何时能迁移到安全相关输入。

  3. arXiv:Agent 与 MCP 安全 · 78

    可验证行动卡片 VAC:为智能体浏览器提供可信人在回路确认

    论文提出可验证行动卡片(VAC),一种面向智能体浏览器的架构防御,把审批信息从真实待执行的浏览器动作和可信意图来源重建,并在浏览器 chrome 中带外渲染,将批准绑定到派发时重新校验的同一动作。VAC 由五部分组成:来源围栏(C1)、真实动作描述符(C2)、带外默认拒绝卡片(C3)、来源感知风险门控(C4)和执行绑定(C5)。作者在完整的开源智能体浏览器(Electron/Chromium 外壳加 Python agent,经 Chrome DevTools Protocol 驱动)中实现 VAC,并在 24 个场景的基准上评测,覆盖混淆代理表单、Lies-in-the-Loop 对话框伪造、间接提示注入、自适应动作替换、来源规避和合法任务。

    推荐理由论文给出可复现的浏览器端确认机制与跨模型评测,做 Agent 权限与确认界面设计的团队可参考其架构取舍。

  4. arXiv:Agent 与 MCP 安全 ·

    可验证操作卡 VAC:为自主 Agent 提供可信人在回路控制

    论文提出可验证操作卡(VAC),一种从真实待执行的浏览器操作和可信意图来源重建审批信息、在可信浏览器界面中带外渲染、并把审批绑定到派发时重新验证的同一操作的架构级防护。VAC 结合来源隔离、真实操作描述符、默认拒绝确认、来源感知风险门控和执行绑定,并在一个完整的智能体浏览器中实现。在覆盖混淆代理攻击、Lies-in-the-Loop 对话伪造、间接提示注入、自适应操作替换、来源规避和正常任务的 24 场景基准上,无 VAC 时各评测 LLM 的攻击成功率为 68% 至 100%,VAC 将每个模型的攻击成功率降至 0%,正常任务完成率 78%,误拦截率 0%。

9月15日周二
  1. arXiv:对齐与欺骗 ·

    ROSETTA:基于混合 CKKS/TFHE 的高效准确隐私保护 LLM 解码框架

    ROSETTA 是一个混合 CKKS/TFHE 框架,用于解决全同态加密(FHE)隐私推理中非线性操作开销过大的问题。它提出基于 TFHE 的自适应分段查找表协议,并设计算子选择框架自动将每个非线性算子分配给 CKKS 或 TFHE,以最小化端到端解码延迟。相比 SOTA 框架 CacheMir,ROSETTA 实现最高 4.8 倍 Softmax 加速和 1.5–2.1 倍端到端加速,论文已被 ACM CCS 2026 接收。

  2. arXiv:越狱与提示注入 ·

    综述提出面向工具调用 AI 智能体的授权架构

    这篇综述针对工具调用 AI 智能体的授权问题,提出以人类用户、运营方、编排智能体、子智能体和工具端点构成的委托层级框架,并梳理五个相互依赖的层面:智能体身份与凭证生命周期、多跳链路上的委托与范围传播、策略执行点上的运行时执行与即时授权、作为授权绕过的提示注入,以及可审计性、溯源与不可否认性。作者从 2023 至 2026 年间约 180 篇候选文献中筛出 89 篇一手来源做结构化叙述性综述,据此提出七项结构性要求,推导出一套四层参考架构,并将这些要求应用到三种可部署的参考配置上。综述指出,运行时执行与聚合边界是当前最主要的未解决缺口。全文 70 页,含 8 张图和 10 张表。

  3. arXiv ·

    RAPID:面向文生图服务的实时防未授权蒸馏防御

    RAPID 是一种针对文生图服务的实时防御方法,用于阻止攻击者通过黑盒查询收集提示词-图像对来训练未授权的替代模型。现有基于扰动的方法需要逐样本优化,带来大量计算和延迟,影响在线服务可用性;作者尝试把防御扰动集成进 VAE 解码器,但发现逐样本目标难以迁移到共享解码器场景,因为共享解码器造成的潜空间偏移明显更小。RAPID 采用自参考的潜空间最大化框架,去除外部依赖,让同一次模型更新在不同训练样本上产生一致的破坏效果,并用重建引导的颜色正则化阻断潜空间捷径。在四个文生图模型和四个数据集上,与五个代表性基线对比,RAPID 在保持服务视觉保真度的同时持续降低替代模型的生成质量。

9月14日周一
  1. arXiv:Agent 与 MCP 安全 ·

    研究者提出面向工具集成 LLM Agent 的通用对抗攻击防御方法

    研究者提出一套统一框架下的通用防御策略,用于应对工具集成 LLM Agent 面临的直接提示注入、间接提示注入、记忆投毒和后门攻击四类对抗攻击。方法包含两类基于工具的防御:Attacker Tool Filtering 用异常检测(如 Isolation Forest)识别并移除可疑工具,Normal Tool Recalling 则在规划前以白盒方式恢复 Agent 的原始工具集;同时引入 Chain-of-Thought 提示与自我反思等基于提示的防御,并通过任务改写缓解攻击。

  2. arXiv:后门、投毒与隐私 ·

    QPriv-VL:面向视觉语言模型的问题引导 token 裁剪隐私防御

    作者提出 QPriv-VL,一个面向联邦学习、拆分学习和 U 型拆分学习的问题引导隐私感知 token 裁剪框架,在传输前按任务效用与隐私敏感度裁剪视觉 token。其核心是轻量级 Dynamic Threshold Predictor(DTP),在一次前向中同时估计样本级裁剪比例和 token 级保留掩码,结合视觉 patch 与问题嵌入的跨模态相似度,以及来自冻结 DINOv2 特征的敏感度信号,无需敏感度标签即可抑制潜在敏感区域。

  3. arXiv:越狱与提示注入 ·

    LLM 答案发布中的审批完整性与恢复机制研究

    研究在 Lightcap 发布执行机制中检验精确内容绑定、授权新鲜度与检查点恢复,基于 RAGTruth 的 900 条人工标注回答、150 个源任务和三个带日期的 Ministral 模型,共产生 3,600 次评估。14B 生产响应检查器在 302 条无支撑标注答案中接受 291 条,直接基线仅接受 41 条,支持答案保留率分别为 95.2% 和 66.9%。在 65 条初始获批答案中,最终有状态复查恢复策略相对初始检查点使精确匹配错误增加 9.23 个百分点(95% 文章聚类区间 [-1.72, 19.61]);BIPIA 提示注入实验中 266 个有效编辑器输出零目标插入。

  4. arXiv ·

    HazardAuditor:面向计算机使用 Agent 的执行级安全护栏框架

    HazardAuditor 是一个执行级安全框架,用于为计算机使用 Agent 提供护栏监督。现有护栏模型面向静态提示词与回复,难以适配 Agent 执行过程;现有可执行安全平台只产出评测结论,无法提供跨框架训练所需的归一化监督。该框架在受控环境中运行 Claude Code、Codex、Hermes 和 OpenClaw 等异构 Agent,把交互归一化为统一事件表示以支持跨框架监督。作者指出 token 级后训练目标会让较长的理由文本主导梯度更新,并提出 Guard Policy Optimization(GuardPO),将确定性安全结果转为序列级优势并归一化理由与判定区域,使安全决策成为优化单元。