跳到正文

防御与护栏

安全训练、护栏、安全分类器与拒答策略,以及它们在自适应攻击下的表现。

414条动态与论文相关主题越狱与攻击安全评测工具与开源
在这个话题内搜索或按分类筛选

新闻与论文

第 241–260 条 · 共 414 条
10月1日周四
  1. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文15

    ROSETTA:基于混合 CKKS/TFHE 的高效准确隐私保护 LLM 解码框架

    ROSETTA 是一个混合 CKKS/TFHE 框架,用于解决全同态加密(FHE)隐私推理中非线性操作开销过大的问题。它提出基于 TFHE 的自适应分段查找表协议,并设计算子选择框架自动将每个非线性算子分配给 CKKS 或 TFHE,以最小化端到端解码延迟。相比 SOTA 框架 CacheMir,ROSETTA 实现最高 4.8 倍 Softmax 加速和 1.5–2.1 倍端到端加速,论文已被 ACM CCS 2026 接收。

  2. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文20

    面向智能体互联网的可扩展信任发现架构

    针对智能体互联网中注册、可信身份识别与能力发现尚未解决的问题,该论文提出一种分层分布式信任发现架构,包含 Agent Root、Agent Registry 和 Agent Resolver 三层,并引入注册表后缀锚定的复合身份方案与双证书多级认证机制。原型实验显示平均注册延迟 58ms、发现延迟 25ms,支持每秒超 19,000 次注册请求和超 29,000 次智能体发现请求。

  3. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文25

    VidMark:面向视频生成模型知识产权保护的高效水印方案

    研究者提出一种生成内嵌水印方案,用于视频生成模型(VGM)的合成视频验证与模型所有权验证两项取证任务。方案包含名为 VidMark 的视频水印网络,结合两级离散小波变换(DWT)分解与全局时序注意力模块(GTAB),并通过解码器引导的微调让 VGM 生成携带模型专属水印的视频。在代表性 VGM 上实验显示,水印提取准确率超过 99%,两项验证任务准确率均达 100%,且对视频级与模型级攻击具有强鲁棒性。

  4. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文18

    StyleAT:用对抗训练防御人脸识别的语义攻击

    针对人脸识别模型易受对抗性语义编辑(如轻微老化或姿态变化)攻击的问题,研究者提出语义攻击 BoundStyle,在 StyleGAN 潜空间中最大化误分类率,攻击成功率高的同时比现有 SOTA 攻击快约 9.5 倍。基于 BoundStyle 构建的对抗训练方案 StyleAT 采用低预算攻击变体,却能防御更强和未见过的语义攻击。在两个训练中未见的数据集和七个模型上,StyleAT 提升了针对 SOTA 攻击的鲁棒准确率,并在多种设置下优于常见防御方法。

  5. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文29

    Fed-ADR:用恶意编排服务器协同客户端梯度操纵攻击联邦学习

    研究者提出 Fed-ADR,一种由恶意编排服务器(OS)实时协调异构对抗客户端、动态调整梯度更新的联邦学习攻击框架,可绕过多种现有防御。在 MNIST、Fashion-MNIST 和 CIFAR-10 上,该攻击将全局准确率从 90% 以上压到 10% 以下。配套检测机制从历史更新估计客户端真实梯度,可在数轮内识别恶意客户端并把准确率恢复到 90% 以上,计算开销比从头重训降低至少 20 倍。

  6. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文15

    DwT-FL:联邦学习中边训练边去重的隐私保护跨客户端去重系统

    针对联邦学习中跨客户端重复数据降低训练效率并加剧模型记忆与隐私风险的问题,研究者提出“边训练边去重(DwT)”范式及隐私保护去重系统 DwT-FL,将跨客户端去重从一次性全局同步预处理转为带状态管理、并发声明与故障恢复的持续在线服务。该系统通过并发状态声明机制与冷热双队列调度策略,实现安全去重与模型训练的并行执行,并支持客户端动态加入。实验显示,相比 SOTA 方案,DwT-FL 将故障恢复和动态加入的时间开销分别最多降低 93.04% 和 94.18%。

  7. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文27

    基于硬件 PUF 指纹的知识蒸馏设备级溯源框架

    针对知识蒸馏中教师模型易被窃取且现有水印或硬件访问控制难以定位泄露设备的问题,研究者提出一种将设备专属 PUF 签名叠加到教师 logits 上的指纹框架,使经知识蒸馏训练的学生模型继承与硬件绑定的唯一身份。该方案在 Xilinx Zynq-7020 FPGA 上测量环形振荡器(RO)PUF 生成签名,架构无关,可跨 CNN、Vision Transformer 和编码器继承身份,并通过神经解码器与汉明距离精修的两阶段恢复流程在噪声条件下保持高检测准确率,另引入多级 logit 编码支持大规模设备部署。实验显示嵌入指纹能抵抗常见的蒸馏后修改。

  8. arXiv · 收录 · 原文 论文31

    通过表征对齐缓解苏格拉底式导师中的脚手架崩塌

    针对 LLM 苏格拉底式导师在持续学生压力下逐渐放弃引导式提问、直接给出答案的"脚手架崩塌"问题,研究者提出 Scaffold-Preserving Representation Alignment 两阶段框架:先用监督微调预热,再结合轨迹加权直接偏好优化与锚定冻结参考状态的间隔保持表征损失。在 Qwen3-8B 上跨五个 STEM 学科和五种红队攻击策略评测,该方法将崩塌率降至 32%,平均崩塌起始延迟至九轮以上,并保持较低过度拒答。

  9. arXiv · 收录 · 原文 论文43

    MiShield:识别多图组合后浮现的隐式有害内容

    论文提出多图隐式有害内容(MIIT)问题,即每张图片单独看都无害,但多张图片联合解读时会产生有害语义,现有商业审核 API 和模型因单图缺乏明显风险线索而难以识别。作者给出 MIIT 的正式定义并分析检测中的三个关键挑战,通过自动生成流程构建了覆盖七类代表性风险的纯图像多图安全数据集 MIIT-dataset,并训练出 MiShield,采用渐进式蒸馏推理监督,使其在给出安全判断的同时显式分析导致危害的关联实体。实验显示 MiShield-8B 的表现优于代表性审核服务和更大规模的模型。论文共 15 页、8 张图,作者提示内容可能包含敏感信息。

  10. arXiv · 收录 · 原文 论文22

    基于搜索增强 LLM 的中文新词毒性共识检测框架 SeTox

    针对"country girl"等表面无害、却在公众共识中演变为毒性用法的新词,研究者提出分类体系与风险词表,并构建搜索增强框架 SeTox,让静态大语言模型接入实时网络语境来检测新词毒性。实验显示,SeTox 即使使用 3B 规模模型也优于近期大规模模型,表明其可扩展地引入现实世界知识完成毒性新词检测。该工作发表于 ACL 2026。

  11. arXiv · 收录 · 原文 论文41

    DataShield:通过共识子空间对齐识别 LLM 微调中的高风险数据

    DataShield 是一个数据评估框架,通过多个安全对齐 LLM 构建的联合安全关键语义空间中的共识子空间对齐,识别有风险的微调样本和回复片段。该框架在这些空间内用语义谱分解提取共识的安全与不安全子空间,再通过衡量样本或片段与不安全子空间、安全子空间的相对对齐程度估计风险,从而支持样本级过滤和细粒度片段级掩码。与现有过滤和掩码基线相比,DataShield 在样本过滤下将 ASR 降低 14.6%,在片段掩码下降低 32.3%,同时保持下游效用,并避免针对特定目标模型计算风险。

  12. arXiv · 收录 · 原文 论文43

    Gradient Immunity 提出 USG:在开放权重发布时阻断恶意微调梯度

    论文提出 Unidirectional Safety Gate(USG),用于作者所称的“部分保护开放权重发布”(PPOW)场景:大部分权重仍可训练,但发布时保留少量安全关键组件。USG 由 Null Space Cubic Layer 与 Inverse Adapter 组成,插入在最后一层 Transformer 之后;下游微调时,三次层抑制或阻断隐藏状态落入校准保护区域的有害样本梯度,Inverse Adapter 则恢复基础模型的前向行为。防御方用自己掌握的有害数据校准阈值,使保护能泛化到邻近的分布内有害样本。

  13. arXiv · 收录 · 原文 论文43

    SHE:面向 LLM Agent 的轨迹驱动安全护栏演化框架

    研究者提出 Safety Harness Evolution(SHE),一个从 rollout 轨迹中学习演化安全边界的框架,用于提升 LLM Agent 的安全性。SHE 把 Agent 护栏拆成 System Prompt、Rule Bank、Safety Memory 和 Tool Policy 四类具有明确安全职责的组件,为局部演化划定功能边界。在此基础上,SHE 引入归因引导的演化循环,把轨迹失败转化为结构化诊断,学习各组件专属的边界修正,并通过安全与效用验证筛选演化后的护栏。

  14. arXiv · 收录 · 原文 论文39

    WIFA:按意图分组监督缓解包装式越狱与过度拒答

    论文提出 Wrapper-Based Intent-Form Augmentation(WIFA),一种自动意图分组增强方法,把带包装的有害示例与结构匹配的带包装良性反例配对,无需外部教师模型或逐包装的人工意图标注。WIFA 作为通用数据层支持两条微调路线:两阶段高安全配方 WIFA-Boost,以及 Anchored Group-Consistent Refusal Training(A-GCRT),后者在同一意图的不同包装间正则化拒答与合规决策分数,并把有害与良性分组锚定在间隔两侧。

  15. arXiv · 收录 · 原文 论文50

    StepGuard:用可扩展监督训练步骤级护栏,兼顾安全与效用

    研究者提出 StepGuard,一个步骤级护栏模型,既能审计已完成的智能体轨迹,也能在工具动作执行前进行检查。为训练该模型,作者设计了 StepGen 数据引擎,生成上下文相同但在风险步骤上动作不同的安全与不安全轨迹;并提出 Balance-GRPO,根据观测到的准确率动态平衡安全与不安全动作的学习,以减少过度防御和防御不足。实验显示,StepGuard 在开放权重护栏模型中平均准确率最高,性能与 GPT-5.4 相当;在 AgentDojo 和 AgentDyn 上用于守护智能体时,相比无护栏设置将平均攻击成功率降低 77.3%,平均效用仅下降 2.8 个百分点。该工作已被 EMNLP 2026 接收。

  16. arXiv · 收录 · 原文 论文50

    Defense-as-Skill:为技能增强型 Agent 演化运行时护栏技能

    论文提出 Defense-as-Skill 防御范式,把运行时护栏本身实现为可安装、可检查、可编辑的技能,以应对技能增强型 Agent 中恶意技能通过持久上下文长期操纵后续动作的问题。其护栏 SkillSonar 与不可信任务技能并行运行,按用户任务边界检查敏感动作,并给出允许、重新规划或确认三种决策,且不修改底层 Agent 运行时。作者构建了任务条件数据集 SCOPE-R,覆盖 6 类风险、21 个子类,含 206 个已确认攻击的恶意实例和 43 个良性任务,并用蒙特卡洛树搜索在训练子集上演化磁盘上的护栏技能。

  17. arXiv:后门、投毒与隐私 · 收录 · 原文 论文15

    MROP:针对 Deep JSCC 后门攻击的掩码区域优化净化方法

    针对 Deep JSCC 图像传输中的输入补丁后门攻击,研究者提出掩码区域优化净化(MROP)。该方法在推理阶段于编码器输入端放置逐像素掩码,通过 Gumbel-sigmoid 松弛优化定位触发补丁并细化触发区域,无需重新训练 JSCC 模型。在 CIFAR-10 和 STL-10 数据集及 DeepJSCC、SwinJSCC 模型上,MROP 大幅降低攻击成功率(ASR),同时保持干净重建的峰值信噪比(PSNR)。

  18. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文28

    从注入到交互:LLM 时代及未来 Web 安全再思考

    一篇综述提出,LLM 正深度嵌入 Web 应用与浏览器智能体,使 XSS 等传统漏洞被 LLM 中介的交互放大,提示注入等 LLM 特有漏洞也会跨 Web 应用传播。该综述统一分析客户端、服务端与流水线三层中 LLM 对 Web 漏洞的放大效应,并评估现有防御的局限,同时探讨将 NIST 与 ISO/IEC AI 安全框架扩展至 LLM Web 环境。文章指出对抗性自然语言指令、自主智能体安全、部署后持续监控与适配三大未解挑战,并提出一个 LLM 感知的监控与控制框架,整合语义输入校验、提示词完整性保护、输出隔离、智能体治理与运行时监控。

  19. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文46

    CONTINUITY:为可组合的 LLM Agent 安全控制引入安全上下文契约

    论文提出 CONTINUITY 框架,用于解决 LLM Agent 安全控制的组合问题:来源追踪、授权、策略执行、协议适配与执行控制各自正确,但安全关键上下文在跨组件边界时可能被丢弃、放宽、重绑定或重新解释,作者将这一失效模式称为安全上下文不连续。CONTINUITY 用 assume-guarantee 契约建模每个组件,并通过签名根授权、来源承诺、角色绑定的转换回执、有界类型化释放、转换见证和效果绑定执行许可,在状态转换间传递经过认证的安全上下文。作者形式化了端到端后果完整性,要求每个实际发生的外部效果都有有效且当前的授权见证,串联主体、任务、来源、委托、策略状态、规范动作与终局边界。

  20. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文53

    CoER:用对抗协同演化与精炼防御自适应间接提示注入

    研究者提出 CoER,将带有多轮工具调用和多次注入的任务建模为一般和马尔可夫博弈,以此训练能够适应不断演化的攻击者的防御方案。该方法先用成功轨迹初始化攻击者,再用双边对抗强化学习(BA-RL)保留双方的历史策略作为对手种群并混合新旧对手,随后复用这些攻击者挑战教师智能体,只用经安全性验证并通过任务完成的示范来微调共同演进的防御者。在七个领域、三个随机种子上,CoER 将自适应攻击成功率从 41.3% 降至 0.2%,并将安全完成率从 39.6% 提高到 76.2%。外部基准上也表现出更强的抗攻击能力,消融实验进一步验证了历史对手混合与基于种群的精炼的有效性。

    推荐理由论文把工具智能体的自适应间接提示注入建模为多轮博弈,用攻防协同演化加教师示范微调,给出跨七个域的攻防成功率与安全任务完成率对比。