全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文arXiv:越狱、提示注入、投毒与防御
ContractWarden:用人类授权契约在内核层为 AI Agent 划定损害边界
ContractWarden 是一个 Linux 参考监视器,通过人类授权的契约在内核层为 AI Agent 划定损害边界,不信任 Agent 本身或其策略建议。模型可以提出 allow、deny 或 no_egress 三态资产契约,但由人类做最终选择;执行门在不可信代码运行前把契约绑定到具体任务,再由基于 eBPF 的 LSM 数据平面执行文件与网络决策,并将 no_egress 沿进程、普通文件、管道、FIFO 和受支持的 Unix-domain socket 单调传播。在 19 项安全测试的 570 次运行中,全部满足预设的返回值与副作用标准。在三项同机文件 I/O 负载上,Linux 6.15 虚拟机中的中位开销为 11.96%–12.89%,物理平台为 35.79%–61.54%,低于所评估的冻结版 ActPlane 基线。
- 论文arXiv
S³:用多阶段防御提升 LLM 智能体安全
论文提出 Stage-Specific Safety Skills 抽象,把异构安全设计表示为带明确阶段语义的可复用、可组合组件,并给出自动化转换流程和社区驱动的安全技能库。在此基础上提出 S³ 多阶段防御框架,由 guard agent 编排各阶段安全技能,在智能体工作流的记忆、规划、工具执行等环节做风险检测与缓解。作者同时构建 Multi-Stage Risk Benchmark(MSRB)评估各阶段代表性风险,实验显示 S³ 在安全有效性和效用保持上均优于代表性 SOTA 基线。论文认为阶段特定安全技能可作为构建韧性智能体系统的可扩展、可组合基础。
- 论文arXiv
互补 LLM 水印如何追踪来源并检测篡改
针对现有 LLM 水印在保留来源归属的同时可被"搭便车欺骗"篡改关键内容的问题,研究者提出一种同时提供来源证明与篡改证据的水印,在每个生成 token 中共同嵌入一个鲁棒信号和一个脆弱信号。两个信号机制相同但使用独立密钥和不同种子窗口,脆弱信号对读者可见的改动敏感;检测时两个分数构成二维空间,支持 Intact、Tampered、No-Watermark 三种判定。在两个大语言模型和两个提示数据集上,该方法在评测方法中取得最高篡改检测率,同时保持有竞争力的归属鲁棒性和困惑度。
- 论文arXiv
Tripwire:通过统计认证的安全神经元触发对齐拒答
Tripwire 是一种免训练防御方法,通过逐神经元假设检验并在错误发现率控制下识别安全特异性神经元,再用效用特异性过滤器排除对模型效用重要的神经元。识别后采用触发式钳制,将选定神经元固定在有害条件下的平均激活值上,注入内部有害输入信号以触发对齐阶段学到的拒答行为。该钳制有两种可证明等价的部署方式,即检测器门控的推理时干预和离线 bias-patch 权重编辑。在四个安全对齐 LLM 和四类代表性攻击上的实验显示,Tripwire 将平均攻击成功率降至最高 2.0%,在 MT-Bench 上的效用损失仅为 0.5% 至 5.3%,为所有防御方法中最小。代码已公开。
- 论文arXiv
RACER:面向多模态大模型后门的区域感知一致性修复框架
论文提出 RACER,一个模型级的多模态大模型后门修复框架,通过抑制内部表征的层级不一致异常来从源头移除后门。作者观察到后门会在内部表征中引发层级间演化异常,即层级不一致异常,且该异常与模态相关,主要集中在编码触发特征的 token 区域。RACER 据此把融合表征拆分为视觉与文本 token 区域,分别归一化其层级不一致性,再在深层窗口内以模态感知权重重组,形成区域感知的不一致目标,并通过 min-max 优化合成最坏情况扰动、对扰动做对抗微调来修复模型。该方法只需 100 条干净样本,不需要知道触发器、攻击目标,甚至不需要知道输入模型是否含后门。
- 论文arXiv
AdaGuard:支持用户自定义策略的自适应护栏模型
作者提出 AdaGuard,一组 0.6B、4B 和 8B 的护栏模型,可在推理时按用户提供的策略评估 Agent 轨迹是否违规。为支持这一能力,作者构建 AdaptiveSafety 数据集,包含 10,939 条训练样本和 1,000 条测试样本,覆盖 1 至 100 条规则的策略,并结合策略与行为反事实,为每条样本配解释和完整违规规则集合。训练方法 SafePO 是一种强化学习算法,用结构化奖励评估预测正确性,在响应层面保留组相对优势,并用单独训练的价值模型调节解释与判定区域的 token 权重。4B 模型在 AdaptiveSafety 上二分类准确率为 89.30%,在 DynaBench 上为 71.82%。
- 论文arXiv
DenMark:面向扩散语言模型的鲁棒语义水印
DenMark 是面向扩散语言模型(DLM)的语义水印框架,将密钥相关信号直接注入去噪过程。它把输出划分为固定 token 区域,用临时 rollout 作为语义前瞻,估计未完成区域的最终语义,从而优先选择语义水印得分更高的局部更新,并在检测时通过校准扫描候选单元尺寸应对语义攻击带来的边界偏移。在 4 个 DLM、3 个数据集和 4 种语义攻击共 48 种组合中,DenMark 在所有检测指标上均取得最佳结果。
- 论文arXiv:后门、投毒与隐私
DP-BR-FedAvg:面向银行与医疗的差分隐私拜占庭鲁棒联邦学习框架
针对联邦学习中参数更新泄露隐私与恶意客户端投毒两大问题,研究者提出 DP-BR-FedAvg 框架,将高斯机制差分隐私层与逐坐标截断均值拜占庭鲁棒聚合规则结合,在模拟跨机构欺诈与临床风险评分任务上评估。在 20 个客户端、其中四分之一为拜占庭节点、共 60 轮通信的设置下,FedAvg 在少数类上崩溃(F1 仅 0.030),该框架恢复至 F1 0.119,同时限制单个客户端贡献的隐私损失。无隐私层的拜占庭鲁棒聚合器原始准确率最高,量化了隐私对鲁棒性的代价,表明两类机制是相互作用而非简单叠加。
- 论文arXiv:后门、投毒与隐私
TRIM:面向多种后门触发器的黑盒检测与净化方法
研究者提出 TRIM(Trigger Removal by Identifying Manipulated Regions),一种面向部署的黑盒后门防御方法,可在推理时检测并选择性移除后门触发器,无需模型内部信息、训练数据或干净样本。TRIM 通过基于区域的分割与深度特征表示、结合 inpainting 和扩散模型重建的自适应触发器发现,以及选择性区域净化三个组件,在不假设触发器类型、形状或位置的前提下定位导致误分类的区域并只净化这些区域。为便于部署,TRIM 还缓存已识别触发器的特征嵌入,避免重复检测与净化。
- 论文arXiv:后门、投毒与隐私
FedMAST:用多轴结构痕迹检测并遏制联邦学习后门
作者提出 FedMAST,一种面向联邦学习的多轴结构痕迹后门检测与遏制防御,对客户端提交的更新从结构、谱和历史三类互补证据打分,再做分层过滤与轮级遏制。方法引入 squeeze-pair 一致性评分以暴露耦合特征畸变,并用带符号的谱漂移跟踪捕捉持续的方向性变化。在六种后门攻击、九组对比中,FedMAST 的攻击成功率均低于基线,完整 200 轮运行平均 ASR 为 1.51%、主任务准确率 94.84%。
- 论文arXiv
RAPID:面向文生图服务的实时防未授权蒸馏防御
RAPID 是一种针对文生图服务的实时防御方法,用于阻止攻击者通过黑盒查询收集提示词-图像对来训练未授权的替代模型。现有基于扰动的方法需要逐样本优化,带来大量计算和延迟,影响在线服务可用性;作者尝试把防御扰动集成进 VAE 解码器,但发现逐样本目标难以迁移到共享解码器场景,因为共享解码器造成的潜空间偏移明显更小。RAPID 采用自参考的潜空间最大化框架,去除外部依赖,让同一次模型更新在不同训练样本上产生一致的破坏效果,并用重建引导的颜色正则化阻断潜空间捷径。在四个文生图模型和四个数据集上,与五个代表性基线对比,RAPID 在保持服务视觉保真度的同时持续降低替代模型的生成质量。
- 论文arXiv:后门、投毒与隐私
PAC-Private Autoregressive Generation:将 PAC 隐私扩展到自回归生成
研究者将 PAC 隐私从分类扩展到自回归生成,用私有语料构建 m=128 个重叠世界、每个世界训练一个适配器,按各世界投票的后验加权分歧校准噪声,一致时无需加噪。在 WikiText-103 与 GPT-2-small 上,每 token 预算 2^{-32} 时保留 74% 微调收益,10^6 token 后成员推断成功率上限 51.08%。与 PMixED 在相同成员推断界下相比,10^2 至 10^6 token 区间保留 98% 非隐私余量,后者至多 56%。
- 论文arXiv
VisER:面向 LVLM 物体幻觉检测的视觉证据与视觉依赖双面指标
VisER 是一种免训练的双面指标,用于大视觉语言模型(LVLM)的物体级幻觉检测,通过 Visual Evidence 衡量物体与上下文的兼容性是否有图像 token 的物体专属证据支撑,通过 Visual Reliance 衡量物体更多由图像而非已生成文本前缀支持,两者结合得到更关注来源的 grounding 分数,且无需额外的物体级验证生成。在多个 LVLM 和基准上,VisER 的 AUROC 与 AUPR 均优于一系列基线。该工作已被 EMNLP 2026 主会接收。
- 论文arXiv:后门、投毒与隐私
面向后门攻击下持续学习的鲁棒动态扩展:净化与选择性恢复
针对增量任务中混入少量后门投毒样本的持续学习场景(CLUBA),研究者提出一个融合样本净化、选择性恢复与鲁棒专家路由的动态扩展框架。其中 Bi-Prototype Purification(BPP)利用特征空间语义差异识别可疑样本,Gradient Discrepancy-based Robustness Optimization(GDBRO)通过伪标签纠正与梯度一致性评估选择性恢复含信息量的投毒样本,Robust Feature Consistency-based Expert Selection(RFCBES)构建扰动感知类原型以支持受损输入下的专家路由。该工作旨在同时缓解灾难性遗忘、保持适应能力并阻止模型吸收恶意监督。
- 论文arXiv
EvoSafeHarness:为 Agent 自动演化模型与领域专属安全护栏
EvoSafeHarness 是一个面向 LLM Agent 的安全优化框架,可为冻结模型在目标领域合成可部署的安全护栏,同时抵御间接提示注入和直接有害请求。它联合搜索自然语言策略与可执行代码逻辑,依据模型行为、领域规范和全新上下文的对抗审查来剔除只针对特定基准的规则。在 DecodingTrust-Agent 上,平均攻击成功率从 45.6% 降至 10.0%,效用仅损失 3.3 个百分点,15 个单元格中 14 个取得最佳成绩;在 AgentDojo 上以 0.0% ASR 达到 82.8% 效用,同一工作点下效用为 CaMeL 的两倍,并可原样迁移到未见过的 AgentDyn 套件。
- 论文arXiv:后门、投毒与隐私
VERITAS:抗投毒的本地差分隐私图学习协议
针对本地差分隐私(LDP)图学习协议易受数据投毒攻击的问题,研究者提出抗投毒协议 VERITAS,采用"信任但验证"范式。该协议在用户侧引入编码分级信任等级的验证列表,对节点特征与图结构联合私有化,并在服务端利用双向证明不对称性识别和剪除恶意节点,流程包括本地数据扰动、证明驱动的恶意节点剪枝、双重去噪恢复效用和鲁棒隐私图学习四个阶段。在四个真实基准数据集、多种 LDP 机制与 GNN 架构上的实验显示,VERITAS 能有效防御数据投毒攻击,并在严格隐私保证下显著提升下游图学习效用。
- 论文arXiv:后门、投毒与隐私
CANAL:面向医学图像分割差分隐私特征蒸馏的通道感知噪声分配
CANAL 是一种面向医学图像分割的差分隐私特征蒸馏方法,通过每张图像仅释放一次、按任务梯度能量对通道做注水式噪声分配,并给出诚实计入隐私预算的拆分,在相同隐私预算下比均匀噪声保留更多任务相关信号。该方法针对此前流程中学生每次迭代重采样噪声导致隐私成本成倍复合、均匀噪声浪费通道重要性差异、以及裁剪阈值与重要性分数本身数据相关却明文释放这三个被忽视的问题。在皮肤镜、结肠镜和超声三个医学分割基准上验证了效果。
- 论文arXiv:后门、投毒与隐私
Adaptive Diffusion Freezing:抵御成员推理攻击的隐私保护扩散模型
针对扩散模型训练中的成员推理攻击(MIA)隐私风险,研究者提出隐私保护框架 Adaptive Diffusion Freezing(ADF)。该方法通过跨时间步自适应冻结训练,用掩码矩阵控制不同数据子集在各扩散时间步的参与,并基于预训练的风险感知冻结策略抑制高 MIA 风险子集-时间步对的贡献,从而减少过度记忆。在多个数据集上,ADF 取得了优于多种基线的隐私-效用-效率权衡表现。
- 论文arXiv:后门、投毒与隐私
基于神经形态时序嵌入与混合 SNN-XGBoost 的工业信息物理系统鲁棒分类:面向机器遗忘攻击
研究提出一种混合 SNN 与 XGBoost 架构,用脉冲神经网络做固定时序特征提取器、仅重训 XGBoost 分类器,以提升电力系统入侵检测对机器遗忘攻击的鲁棒性。在两个真实电力系统数据集上,Synchrophasor 达 99.9% 准确率(F1-macro 0.999),MSU/ORNL 达 95.0% 准确率(F1-macro 0.943)。在选择性标签翻转攻击下,10% 投毒时 F1-macro 仅下降 0.9%,目标类崩溃阈值从 60% 投毒推迟到 70%。
- 论文arXiv
HazardAuditor:面向计算机使用 Agent 的执行级安全护栏框架
HazardAuditor 是一个执行级安全框架,用于为计算机使用 Agent 提供护栏监督。现有护栏模型面向静态提示词与回复,难以适配 Agent 执行过程;现有可执行安全平台只产出评测结论,无法提供跨框架训练所需的归一化监督。该框架在受控环境中运行 Claude Code、Codex、Hermes 和 OpenClaw 等异构 Agent,把交互归一化为统一事件表示以支持跨框架监督。作者指出 token 级后训练目标会让较长的理由文本主导梯度更新,并提出 Guard Policy Optimization(GuardPO),将确定性安全结果转为序列级优势并归一化理由与判定区域,使安全决策成为优化单元。
- 论文arXiv:后门、投毒与隐私
基于 Hessian 分析的相关性引导快速机器遗忘
一种面向网络与分布式安全系统的机器遗忘框架通过识别训练集中的相关数据点并应用闭式参数更新规则,相比标准影响函数遗忘实现 82 倍墙钟加速,准确率较 SOTA 基线提升 10^-2。该方法借助 Hessian 阻尼保证数值稳定性,在包括 CIFAR-100 与 ResNet-50 在内的七种数据集-架构组合上评估,成员推理攻击成功率为 0.660,tug-of-war 得分为 0.950。
- 论文arXiv:后门、投毒与隐私
QPriv-VL:面向视觉语言模型的问题引导 token 裁剪隐私防御
作者提出 QPriv-VL,一个面向联邦学习、拆分学习和 U 型拆分学习的问题引导隐私感知 token 裁剪框架,在传输前按任务效用与隐私敏感度裁剪视觉 token。其核心是轻量级 Dynamic Threshold Predictor(DTP),在一次前向中同时估计样本级裁剪比例和 token 级保留掩码,结合视觉 patch 与问题嵌入的跨模态相似度,以及来自冻结 DINOv2 特征的敏感度信号,无需敏感度标签即可抑制潜在敏感区域。
- 论文arXiv:后门、投毒与隐私
研究重新审视后门修复评测:区分总体干净效用与良性性能保持
论文提出后门修复评测不应只看攻击成功率(ASR)和总体干净准确率,因为总体准确率会掩盖集中在部分标签空间上的性能退化。作者从保持视角区分总体干净效用与原有类别性能的保持,通过比较修复前后的干净性能定义类别级保持损失,并指出聚合会通过局部损失稀释和跨类别补偿隐藏局部退化。为此论文引入最差类别保持损失和尾部保持损失来刻画局部保持损失,并在代表性后门攻击、修复方法、数据集、攻击目标和模型架构上开展系统实证研究,另在干净标签攻击下做了验证。结果显示,有效抑制攻击和良好的总体干净性能并不必然意味着各类别原有良性性能被均匀保持,修复后仍可能存在明显的局部保持损失,其严重程度和类别结构随修复条件变化。
- 论文arXiv:后门、投毒与隐私
ODPure:通过集成破坏共识实现目标检测后门净化
ODPure 是一种面向目标检测的输入阶段黑盒后门防御方法,通过破坏-重建-选择(CRS)范式净化输入,无需丢弃恶意数据或模型即可维持稳定的感知流。该方法利用多种破坏方式中和触发器、生成大量冗余候选框,再借助生成先验恢复细粒度结构线索,最后通过投票对检测结果达成共识。实验表明,ODPure 能抵御多种后门攻击与触发器类型,同时保持基线精度。