跳到正文

防御与护栏

安全训练、护栏、安全分类器与拒答策略,以及它们在自适应攻击下的表现。

414条动态与论文相关主题越狱与攻击安全评测工具与开源
在这个话题内搜索或按分类筛选

新闻与论文

第 221–240 条 · 共 414 条
10月1日周四
  1. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文24

    AIOS 的内核管理共享内存:面向系统级个性化的新抽象

    研究提出"内核管理共享内存",由智能体系统内核而非单个智能体统一负责记忆检索、隐私执行与提示注入。该设计在 AIOS 上实现,用 GPT-4o、Llama-3.1:8B、Qwen-2.5:7B 三个助手模型共 1800 次试验,对比 Mem0 等三种方案:个性化得分提升 2.4-4.0 分(5 分制,GPT-4o 上 profile usage 从 1.05 升至 4.69),端到端延迟降低 15-61%,并减少每次调用的 token 用量与推理成本。

  2. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文46

    HPD 与 HERALD:用跨层有害性传播轨迹检测越狱提示

    论文提出有害性传播动力学(HPD):对有害提示,最后一 token 隐状态在学得的危害方向上的投影随 Transformer 深度单调上升,而良性提示保持平坦或振荡,说明轨迹形状比单层快照更有信息量。基于此作者提出 HERALD,从跨层投影序列中提取斜率、曲率、单调性、起始层等七维特征,用 288 参数 MLP 分类;每层存一个 d 维方向(32 层、d=4096 模型约 262 KB),训练不需梯度计算,推理仅增加 2.6×10⁻⁶ 的 prefill FLOPs。

  3. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    SPARK:在 KV 记忆层对齐表征以防御视觉语言模型越狱

    SPARK 是一个两阶段框架,通过在 prefill 阶段修复多模态 KV 记忆来降低视觉语言模型的越狱风险,且不修改推理时的模型参数。第一阶段用一次性诊断适配器定位多模态 key 和 value 表征中与危害相关的方向,第二阶段将这些方向投影剔除、学习轻量残差修复,并用图像结构先验锚定修复后的 key 以保持视觉接地。方法按 head 级系数混合修复与原始记忆,该系数由干预相关子空间能量决定,推理时无需显式危害分类器。

  4. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    PIDS-Bench:在过度防御、混淆与分布偏移下评测提示注入检测器

    研究者提出 PIDS-Bench,一个冻结的多轴基准,在固定阈值下同时评测提示注入检测器的攻击检测能力与良性误报行为,覆盖分布内输入、模仿注入结构但无恶意的 hard-benign 提示、混淆攻击以及领域和结构分布偏移。评测涵盖七个检测器(学习型基线、外部提示注入分类器、广义安全对比模型)以及一个基于规则的下界参考。多轴评测暴露出聚合 F1 掩盖的失效模式:在留出集上 F1 超过 0.98 的检测器,仍会把来自公开语料、限定于安全相关内容的良性子集约三分之一误判。在完整阈值扫描和五个训练种子上,没有内部检测器能在该压力分布上同时满足 F1 >= 0.95 与 hard-benign FPR <= 0.10。

  5. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文25

    LLM 答案发布中的审批完整性与恢复机制研究

    研究在 Lightcap 发布执行机制中检验精确内容绑定、授权新鲜度与检查点恢复,基于 RAGTruth 的 900 条人工标注回答、150 个源任务和三个带日期的 Ministral 模型,共产生 3,600 次评估。14B 生产响应检查器在 302 条无支撑标注答案中接受 291 条,直接基线仅接受 41 条,支持答案保留率分别为 95.2% 和 66.9%。在 65 条初始获批答案中,最终有状态复查恢复策略相对初始检查点使精确匹配错误增加 9.23 个百分点(95% 文章聚类区间 [-1.72, 19.61]);BIPIA 提示注入实验中 266 个有效编辑器输出零目标插入。

  6. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文39

    综述提出面向工具调用 AI 智能体的授权架构

    这篇综述针对工具调用 AI 智能体的授权问题,提出以人类用户、运营方、编排智能体、子智能体和工具端点构成的委托层级框架,并梳理五个相互依赖的层面:智能体身份与凭证生命周期、多跳链路上的委托与范围传播、策略执行点上的运行时执行与即时授权、作为授权绕过的提示注入,以及可审计性、溯源与不可否认性。作者从 2023 至 2026 年间约 180 篇候选文献中筛出 89 篇一手来源做结构化叙述性综述,据此提出七项结构性要求,推导出一套四层参考架构,并将这些要求应用到三种可部署的参考配置上。综述指出,运行时执行与聚合边界是当前最主要的未解决缺口。全文 70 页,含 8 张图和 10 张表。

  7. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    SAST-IR 框架:无记忆目标下多轮说服攻击成功率高达 96%

    论文指出多轮对话红队测试存在“拒答惯性”问题:模型为保持上下文一致而延续最初的拒答,掩盖了真实脆弱性。作者提出 SAST-IR 框架,对目标模型清空记忆、保留攻击者历史,模拟最坏情况下的多轮无状态攻击,并配合诊断引导的 CP-Agent 在自建 CounterFact-Strict 数据集(N=50)上测试。结果显示简单多样的攻击策略成功率达 96%,暴露无记忆防御的严重脆弱性。论文还发现“复杂性悖论”:复杂迭代攻击虽有效,却常触发防御性顺从,而简单策略的真实说服率更高,为 84.7%。代码与数据集已在 GitHub 公开。

  8. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    用 cunning questions 训练 LLM 警觉性,将九组模型基准平均 ASR 从 17.40% 降至 15.05%

    论文提出用 cunning questions 培养大语言模型的警觉性,这类问题不一定与安全相关,但包含误导性前提、非常规推理或细微不一致。作者假设学会识破这类推理陷阱可以迁移到安全关键场景。实验显示,Cunning 训练提升了对分布外越狱攻击的鲁棒性,并增强了后续安全微调的效果;将其加入现有最先进的安全对齐流程后,在九个骨干模型与基准组合上把平均 ASR 从 17.40% 降至 15.05%。匹配安全微调后的轨迹分析表明,安全判断更可能在有害规划开始前主导模型响应。论文还给出条件性理论分析,刻画从 cunning 数据学到的不变性何时能迁移到安全相关输入。

  9. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    CaMeLoT:用 CTL 时序逻辑在执行前静态验证 Agent 计划

    CaMeLoT 是面向工具调用型 LLM Agent 的提示注入防御方案,作为已有防御 CaMeL 的补充,在调用任何工具之前对 Agent 生成的计划做静态验证。它把计划转换为有限状态迁移系统,标注工具调用、来源与污点信息,再用 nuXmv 模型检查器对照以 CTL 表达的时序策略进行检验。由于验证发生在执行之前,不安全的计划会被直接拒绝,无需消耗 LLM 调用和工具调用,也省去了回滚改动或拆除临时沙箱的开销。验证失败时模型检查器会返回反例,供 Agent 据此修复计划。

  10. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    用扩散模型隐空间扰动防御视觉语言模型的地理位置隐私泄露

    研究系统考察了多模态大推理模型(MLRM)从日常照片推断用户地理位置带来的隐私泄露,发现基于拒答的防护严重不足,精心构造的越狱提示词可将模型响应率提高到 100%。作者指出,现有在像素空间注入不可见扰动的防御受结构性限制,黑盒迁移性下降且出现明显视觉伪影。为此提出一种基于扩散模型的主动防御框架,在反向采样过程中向扩散模型隐空间注入扰动,直接作用于高层语义表示,并以与 GPS 坐标对齐的 GeoCLIP 作为代理模型定位和破坏 MLRM 用于位置推断的地理信号。该方法在保持图像感知质量的同时获得更强的黑盒迁移性,便于在社交媒体平台集成。该工作已被 NDSS 2027 接收。

  11. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    HE-Guardrail:面向加密大模型推理的同态护栏防御越狱攻击

    作者指出,基于同态加密的大语言模型推理存在一个安全漏洞:服务端在无法接触明文的情况下,既看不到客户端提交的提示词,也看不到模型生成的回复,因此恶意客户端的越狱攻击难以被检测或拦截,甚至可能完全不被服务端察觉。为此作者提出 HE-Guardrail 框架,在加密数据上完整执行护栏机制,并以同态方式控制目标模型的回复是否返回给客户端。该框架以 Llama Guard、JBShield 和 GradSafe 三种代表性护栏进行实例化,结果显示其在密文域中能较接近地复现对应明文护栏的判定,并在安全性、效率与可用性之间呈现不同的权衡。

  12. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    CASCADE 研究:跨流水线阶段的越狱防御组合评估

    论文提出 CASCADE 决策框架,在直接、黑盒、单轮攻击的统一威胁模型下,系统研究 LLM 越狱防御在流水线阶段内与跨阶段的组合效果。研究用带受控查询预算的攻击成功率公式和明确的公平性规则统一评估口径,覆盖 19 种攻击与 15 种防御。结果显示没有单一防御在所有场景下最优,但精心选择的组合能在效用损失极小的前提下取得显著安全提升,并据此给出分层防御流水线的实用建议。该工作已被 EMNLP 2026 Findings 接收。

  13. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    研究提出面向企业 MCP 的零信任授权与工具发现方案

    论文对企业级 MCP 的授权缺口做了系统分析,并给出不改动协议与 SDK 内部实现的 FastMCP 可组合扩展。作者调研 Python、TypeScript、Go、Rust、C#、Swift 六种 MCP SDK,指出三个结构性缺陷:凭据提取绑定单一 Authorization 头,使同时服务人类用户(企业 SSO)与自动化 Agent(不同请求头上的服务账号凭据)的双角色部署需要自定义中间件;缺少认证前的工具发现;基础 SDK 缺少按工具的细粒度授权。

  14. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    研究用 XAI 归因分析 Prompt Guard 2,同义词替换可翻转其提示注入判定

    研究以可解释性方法分析分类器护栏 Prompt Guard 2 如何区分恶意与良性提示词。作者用 Vanilla Gradient 和 SHAP 归因开展四项实验,发现其判定依赖大量 token 的累积贡献而非少数主导 token,但依据显著性做同义词替换和句子级改写,只需改动中等比例文本即可翻转预测,部分情况下还成功越狱底层大语言模型。数据集规模的显著性分析显示,未被检出的注入提示词系统性地缺少分类器依赖的词汇标记。作者据此讨论分类器护栏的设计与评估,并指出用于提升透明度的解释方法同时也会降低构造对抗绕过的成本。

  15. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文8

    Universal Fractal Natural Language Decision Map:werr 边缘运行时实现 0 字节 VRAM 决策

    论文提出 Universal Fractal Natural Language Decision Map,通过 werr 机器原生边缘反射运行时与 answerr 平台实现,完全不存储权重张量(0 Bytes VRAM),沿 Mandelbrot 集混沌边界调制 24 字节坐标种子合成确定性决策。其语义 token 阻尼滤波器(T_desc = 0.045)实现 0.0% 提示注入绕过(95% Wilson CI: [0.0%, 27.8%]),并将迭代剪枝 45.8%、吞吐提升 2.5 倍至 3.31 ms 延迟。

  16. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    PALS:面向全双工语音对话模型对抗鲁棒性的心理声学对齐潜空间平滑

    论文将针对全双工语音对话智能体的不可感知攻击形式化为在载体语音心理声学掩蔽阈值之下的加性扰动优化,目标包括定向语义劫持、响应抑制和策略越狱。在未防御的 Moshi 类智能体上,白盒攻击成功率最高达 91.7%。作者提出心理声学对齐潜空间平滑(PALS),在残差向量量化潜空间接口注入由局部码本协方差塑形的各向异性高斯噪声,输入噪声由掩蔽阈值塑形以约束攻击者,并用 Kullback-Leibler 一致性目标训练。PALS 无推理时开销,将劫持降至 8.3%、静音降至 11.2%、越狱降至 9.1%,干净质量损失在 2.3% 以内。其蒙特卡洛平滑变体可认证的椭球潜空间半径最高为 0.616,经验鲁棒性远超这一保证下限。

  17. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文56

    系统提示词幻觉:指令前导如何改变语言模型内部计算

    研究者在 17 个指令微调模型(8 个架构家族、1.5B–72B 参数)上,用 CKA 比较 20 条系统提示词下的逐层表征。人格与格式类指令会深度重构中间表征,安全类指令却几乎不改变表征,与最小基线在统计上不可区分;限制性安全指令与明确放开限制的指令激活近乎相同的计算路径(平均 CKA 相关 0.997),70B–72B 模型的安全渗透率仍低于 10%。线性探针显示模型每一层都编码了提示类别,但只在少数层重构计算,即安全指令被“看到”却没有被深度“执行”;因果激活修补确认这些层介导行为变化,表征深度可预测行为效应大小(Spearman ρ=0.761)。作者据此从机制上解释基于系统提示词的安全为何持续易被越狱。

    推荐理由论文用 CKA 与激活修补量化系统提示词对内部表征的改动,为系统提示词安全为何脆弱提供了机制层面的解释。

  18. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文55

    研究:任意密文攻击前沿大模型无需微调即可越狱

    McGill 大学研究者 Thomas Rivasseau 发现,前沿大模型无需微调即可通过提示和上下文学习掌握字母置换密文通信,并借此绕过对齐与有害性分类器。攻击分三步:先用提示让模型接受一套字母置换方案,再给出若干密文问答示例,最后用该方案发送有害请求;密文在分类器看来只是乱码。作者关闭模型推理,因为开启后模型会把指令解密成明文,足以绕过分类器但不足以绕过对齐。单次注入完整置换的方案在 Claude Sonnet 4 上稳定成功,可产出炸弹、生物武器制作说明和攻击代码;迭代逐级教授字母交换的方案在 Gemini 3 Flash preview 上成功。作者称对 Claude Sonnet 4 实现完全越狱、Gemini 3 完全越狱、Claude Sonnet 4.5 仅证明可行性、GPT 5.5 需结合已知越狱提示词。

    推荐理由论文给出无需微调、仅靠提示与上下文学习即可让前沿模型用字母置换密文绕过拒答与有害性分类器的完整方法。

  19. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文27

    面向联邦 LLM 微调的隐私保护拆分学习

    针对联邦拆分学习中 LLM 自回归特性导致中间激活泄露输入、现有扰动防御失效的问题,研究者提出一种可学习的混淆—恢复方案,在保护参与者私有数据集的同时仍能在服务器端训练可独立部署的模型。实验显示该方法在实现强隐私保护的同时仅带来适度的效用损失和系统开销,使基于拆分的联邦 LLM 微调具备实际可行性。

  20. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文31

    Odin:面向隐私保护 Llama 3 8B 推理的开源端到端 FHE 实现

    Odin 是首个开源的端到端 GPU CKKS 实现,可在加密状态下完成 Llama-3-8B 推理。它通过 feature-major 跨层布局统一残差连接与层接口,并为线性投影和注意力构建临时算子内布局,减少权重的冗余明文编码;注意力中 QK^T 的分数可直接被 Softmax 消费,PV 直接消费概率,避免中间重打包;非线性运算采用带输入范围控制的 minimax 多项式近似与联合误差分配。在单张 NVIDIA H100 80 GB GPU 上,输入 128 token 时评估全部 32 层耗时 366.4 s、峰值显存 58.9 GiB,相比 THOR 的 1651.9 s 提速 4.51 倍。