跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 352 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源202新闻与研究603细分与主体7来源:arXiv:后门、投毒与隐私arXiv:后门、投毒与隐私5 条材料来源:arXivarXiv1 条材料论文:FreqDoor:面向视觉语言模型的频域后门攻击论文2026-09-07FreqDoor:面向视觉语言模型的频域后门攻击论文:VERITAS:抗投毒的本地差分隐私图学习协议论文2026-09-07VERITAS:抗投毒的本地差分隐私图学习协议论文:FDBA:联邦学习中的细粒度分布式后门攻击论文2026-09-07FDBA:联邦学习中的细粒度分布式后门攻击论文:TrojanWorld:通过想象引导对世界模型智能体植入后门论文2026-09-07TrojanWorld:通过想象引导对世界模型智能体植入后门论文:基于神经形态时序嵌入与混合 SNN-XGBoost 的工业信息物理系统鲁棒分类:面向机器遗忘攻击论文2026-09-09基于神经形态时序嵌入与混合 SNN-XGBoost的工业信息物理系统鲁棒分类:面向机器遗忘…论文:监督学习中的数据投毒攻击实证评估:标签翻转与后门投毒在 MNIST 和 Fashion-MNIST 上的对比论文2026-09-10监督学习中的数据投毒攻击实证评估:标签翻转与后门投毒在 MNIST 和 Fashion-MNIST…方向:越狱与攻击越狱与攻击2方向:隐私与数据泄露隐私与数据泄露2方向:后门与投毒后门与投毒6方向:防御与护栏防御与护栏2方向:其他方向其他方向1方向:Agent 安全Agent 安全1方向:安全评测安全评测1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。1 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 论文arXiv:后门、投毒与隐私

    FreqDoor:面向视觉语言模型的频域后门攻击

    研究者提出 FreqDoor,一种在频域植入触发器的训练期后门攻击,针对视觉语言模型。该方法选择性混合触发源图像的幅度谱分量,同时保留干净图像的相位,从而生成空间分布且视觉上难以察觉的触发器,且不修改文本输入。在 BLIP-2、InstructBLIP 和 LLaVA 上评估图像描述与视觉问答任务,在 Flickr8k 上三个模型的攻击成功率分别为 99.6%、99.8% 和 98.4%,同时保持生成描述的语义质量;在 VQAv2 上对应攻击成功率为 99.6%、92.4% 和 79.6%。

  • 论文arXiv:后门、投毒与隐私

    VERITAS:抗投毒的本地差分隐私图学习协议

    针对本地差分隐私(LDP)图学习协议易受数据投毒攻击的问题,研究者提出抗投毒协议 VERITAS,采用"信任但验证"范式。该协议在用户侧引入编码分级信任等级的验证列表,对节点特征与图结构联合私有化,并在服务端利用双向证明不对称性识别和剪除恶意节点,流程包括本地数据扰动、证明驱动的恶意节点剪枝、双重去噪恢复效用和鲁棒隐私图学习四个阶段。在四个真实基准数据集、多种 LDP 机制与 GNN 架构上的实验显示,VERITAS 能有效防御数据投毒攻击,并在严格隐私保证下显著提升下游图学习效用。

  • 论文arXiv:后门、投毒与隐私

    FDBA:联邦学习中的细粒度分布式后门攻击

    研究者提出细粒度分布式后门攻击框架 FDBA,用动态触发器生成与嵌入向量优化,在更少投毒样本下实施攻击。该方法基于 Canny 算法提取图像边缘特征并注入 Laplacian 噪声,再经 RGB 通道分解隐藏分布式触发器,同时用嵌入向量对比学习把投毒样本拉向目标类中心。在 CIFAR-10 上,目标 ASR 介于 70% 至 90% 时,FDBA 相比 DBA 减少 37.4%–48.4% 的投毒比例;Non-IID 极端异构下保留 84.7% 的 IID 攻击性能,DBA 降至 73.5%,并能绕过主流防御机制。

  • 论文arXiv

    TrojanWorld:通过想象引导对世界模型智能体植入后门

    研究者提出 TrojanWorld,一种针对世界模型智能体的供应链后门框架,通过引导模型内部想象而非改动决策模块来诱发攻击者指定的行为。攻击以场景中放置的物理物体作为触发器,经智能体原生观测管线激活,无需数字篡改观测流。框架由三项机制组成:Decision-Reflective Induction 利用决策反馈将触发条件下的想象导向目标动作,Clean Behavior Anchoring 保持无触发时的预测与行为保真度,Causal Propagation 在触发器消失后沿后续轨迹延续被诱导的偏好。研究还测试了 Fine-Pruning、SHINE 和 Neural Cleanse 三种防御的适配版本,没有一种能在保持干净效用的同时完全移除攻击。

  • 论文arXiv:后门、投毒与隐私

    基于神经形态时序嵌入与混合 SNN-XGBoost 的工业信息物理系统鲁棒分类:面向机器遗忘攻击

    研究提出一种混合 SNN 与 XGBoost 架构,用脉冲神经网络做固定时序特征提取器、仅重训 XGBoost 分类器,以提升电力系统入侵检测对机器遗忘攻击的鲁棒性。在两个真实电力系统数据集上,Synchrophasor 达 99.9% 准确率(F1-macro 0.999),MSU/ORNL 达 95.0% 准确率(F1-macro 0.943)。在选择性标签翻转攻击下,10% 投毒时 F1-macro 仅下降 0.9%,目标类崩溃阈值从 60% 投毒推迟到 70%。

  • 论文arXiv:后门、投毒与隐私

    监督学习中的数据投毒攻击实证评估:标签翻转与后门投毒在 MNIST 和 Fashion-MNIST 上的对比

    研究在 MNIST 和 Fashion-MNIST 上评估了标签翻转与后门投毒两类训练时攻击,对比 Logistic Regression、Linear SVM 和 Random Forest 三种基线分类器,投毒率设为 5%、10% 和 20%。标签翻转导致明显性能下降,Logistic Regression 和 Linear SVM 受影响最大,Random Forest 相对稳定;后门投毒在全部数据集和模型上攻击成功率达 0.9667 至 1.0000,且干净测试性能常接近基线。结果表明无差别投毒会体现在常规指标中,而定向后门投毒更具隐蔽性,需采用面向安全的评估方法。

  • 论文arXiv:后门、投毒与隐私

    SALVE:用文本优化还原蒸馏数据中的隐性学习效应

    研究者提出 SALVE(Search-Aided Latent Verbalization),通过优化 soft prompt、让同一模型将其转写为文本并用 beam search 提升可靠性,把蒸馏数据中不可读的隐性学习效应还原为可读提示词。作者指出,带提示词的隐性学习是上下文蒸馏的一个特例,理论上该数据集可识别出教师的提示词,于是把提示词还原转化为文本优化问题。在标准隐性学习设定下,SALVE 能稳定还原出点明教师特质的可读提示词,而常见文本优化方法做不到。研究还发现,在隐性学习失效的某些设定下 SALVE 仍能从数据集中还原教师特质,而调整学生训练以改善上下文蒸馏则可能产生隐性学习效应。

  • 论文arXiv:后门、投毒与隐私

    UBA-ORL:针对离线强化学习的遗忘激活后门攻击

    研究者提出 UBA-ORL,一种针对离线强化学习的遗忘激活后门攻击:攻击在正常训练后被大幅抑制,却在合规驱动的数据删除(遗忘)请求后显现。该方法采用双样本机制,同时注入后门轨迹(BD)与伪装轨迹(CM),两者共享同一触发模式,但 CM 保留良性动作并配以同样高的奖励。训练时 BD 与 CM 提供相互竞争的监督信号,当对 CM 子集发起合法删除请求后,残留的 BD 信号重新占据主导,按需重新激活后门。实验显示 UBA-ORL 在评测的离线 RL 配置下实现可控激活,无触发回报的变化因配置而异,暴露出合规驱动离线 RL 平台此前被忽视的安全风险。作者呼吁社区为合规遗忘服务开发遗忘前与遗忘后的联合审计机制。

  • 论文arXiv:后门、投毒与隐私

    研究重新审视后门修复评测:区分总体干净效用与良性性能保持

    论文提出后门修复评测不应只看攻击成功率(ASR)和总体干净准确率,因为总体准确率会掩盖集中在部分标签空间上的性能退化。作者从保持视角区分总体干净效用与原有类别性能的保持,通过比较修复前后的干净性能定义类别级保持损失,并指出聚合会通过局部损失稀释和跨类别补偿隐藏局部退化。为此论文引入最差类别保持损失和尾部保持损失来刻画局部保持损失,并在代表性后门攻击、修复方法、数据集、攻击目标和模型架构上开展系统实证研究,另在干净标签攻击下做了验证。结果显示,有效抑制攻击和良好的总体干净性能并不必然意味着各类别原有良性性能被均匀保持,修复后仍可能存在明显的局部保持损失,其严重程度和类别结构随修复条件变化。

  • 论文arXiv:后门、投毒与隐私

    研究者在 FANUC 与 xArm 工业机械臂上实测后门攻击与防御

    作者对基于学习的工业机械臂操作开展后门攻击与防御的初步实证研究,实验平台为 FANUC 和 xArm 两台真实商用工业机械臂。研究考察后门能否在正常任务执行时保持隐蔽、仅在特定触发器出现时诱发出语义错误的操作行为。作者随后开发了一套在线防御流程,在运行时检测并中和触发器,并与离线微调防御进行效果对比。研究还评估了该防御流程引入的计算延迟与执行开销,以判断其是否适合高吞吐工业场景。该工作已被 IROS 2026 Workshop on Industrial Applications of Robot Learning 接收。

  • 论文arXiv:后门、投毒与隐私

    RAMP:逆转对抗扰动以增强针对恶意软件检测器的干净标签后门攻击

    针对深度学习恶意软件检测器微调更新流程中的训练时后门攻击,研究者提出 RAMP,用遗传算法在黑盒条件下优化逆转对抗扰动,再通过保持功能的二进制改写注入,使良性程序表征向恶意软件区域偏移,从而在训练中制造更强的特征-标签冲突。实验显示 RAMP 在低投毒比例下显著优于仅用触发器的基线,且不损失干净数据准确率,并可与更先进的触发器设计结合。该工作已被 Inscrypt 2026 接收。

  • 论文arXiv:后门、投毒与隐私

    ODPure:通过集成破坏共识实现目标检测后门净化

    ODPure 是一种面向目标检测的输入阶段黑盒后门防御方法,通过破坏-重建-选择(CRS)范式净化输入,无需丢弃恶意数据或模型即可维持稳定的感知流。该方法利用多种破坏方式中和触发器、生成大量冗余候选框,再借助生成先验恢复细粒度结构线索,最后通过投票对检测结果达成共识。实验表明,ODPure 能抵御多种后门攻击与触发器类型,同时保持基线精度。

  • 论文arXiv:后门、投毒与隐私

    T-Backdoor:利用神经形态数据时间冗余对 SNN 实施保脉冲后门攻击

    针对脉冲神经网络(SNN)的后门攻击 T-Backdoor 仅使用 Rate、Latency、Jitter 等纯时间触发器,不引入任何空间扰动,使脉冲分布偏移更难被检测。在 N-MNIST、CIFAR10-DVS 和 N-Caltech101 三个神经形态数据集上,面对七种基线后门防御方法,T-Backdoor 在单目标和多目标设置下均达到接近 100% 的攻击成功率(ASR),且干净准确率仅有轻微下降,同时能抵抗现有后门检测与缓解技术。

  • 论文arXiv:后门、投毒与隐私

    CLIPGuard:针对 CLIP 嵌入空间隐蔽后门的区域级黑盒防御

    CLIPGuard 是一种轻量、完全黑盒的防御方法,通过测量分段嵌入扰动定位恶意区域,并仅对可疑片段做语义修复,以抵御 CLIP 嵌入空间后门攻击。在 STL-10、ImageNet 及 BadCLIP、BadNets、blended、patch-based、typographic 等触发家族上,该方法将攻击成功率降至最低 1.05%,干净准确率最高保持 86.34%,持续优于 CleanCLIP 和 CleanerCLIP 等黑盒防御。

  • 论文arXiv:后门、投毒与隐私

    预训练数据投毒的可解理论:依赖极限顺序的缩放指数

    针对大语言模型预训练数据投毒,研究提出可解理论解释清洁数据性能随投毒率 ε 的退化规律。在 OLMo 风格模型的受控预训练中,清洁数据验证困惑度相对增幅 Δ 符合幂律 Δ≈Cε^a,指数为非整数。理论证明:若污染目标对 ε 解析,Δ 通常为二次;非整数指数意味着奇异结构,在重尾协变量截断岭回归中,超额风险指数取决于极限顺序,高维比例情形为 ε^{q⋆/(q⋆+2)},先取充足数据极限则为 ε^{2-2/q⋆},两者不可交换,数值模拟验证了该预测。

  • 论文arXiv:危险能力与安全评测

    AgentQ:针对 LLM Agent 的量化条件后门攻击

    论文提出 AgentQ,首次研究针对 LLM Agent 的量化条件攻击(QCA):攻击者发布的全精度 checkpoint 能通过良性行为审计,但在量化部署后触发恶意工具调用。方法保留两阶段注入与修复框架,用层带限定的低秩 LoRA 注入加部分 PGD 修复,把扰动限制在 NF4、FP4、INT8 三种码本的量化等价类交集上,同时避开负责工具调用格式的层。在 Qwen3.5-{2B,4B,9B} 与 Hammer2.1-{1.5B,3B,7B} 上,覆盖工具选择、参数注入、广告注入三类触发动作对,量化后攻击成功率最高达 100%,多数单元格超过 0.94,而干净任务效用接近基座模型。全精度下所有 checkpoint 的 ASR 为 0,能通过审计。作者指出当前后门评测协议低估了压缩开源 Agent 的风险,建议把量化感知安全评测作为部署前的标准要求。

  • 论文arXiv:Agent 与 MCP 安全

    研究者提出面向工具集成 LLM Agent 的通用对抗攻击防御方法

    研究者提出一套统一框架下的通用防御策略,用于应对工具集成 LLM Agent 面临的直接提示注入、间接提示注入、记忆投毒和后门攻击四类对抗攻击。方法包含两类基于工具的防御:Attacker Tool Filtering 用异常检测(如 Isolation Forest)识别并移除可疑工具,Normal Tool Recalling 则在规划前以白盒方式恢复 Agent 的原始工具集;同时引入 Chain-of-Thought 提示与自我反思等基于提示的防御,并通过任务改写缓解攻击。

  • 论文arXiv:Agent 与 MCP 安全

    可信智能体 AI:基于 LLM 的自主系统失效模式、缓解策略与 TADL 生命周期框架

    一篇 arXiv 综述梳理了基于大语言模型的智能体 AI 在安全与运维上的五类可信维度:安全与鲁棒性、对齐与人类监督、透明度与可审计性、隐私与数据治理、监管合规。文章把间接提示注入、后门触发、目标泛化错误、记忆污染和跨会话数据泄露等失效模式归入统一分类,并评估指令层级、上下文隔离、spotlighting、过程监督、受限工具使用和隐私保护记忆等缓解手段,区分有实证支持与仍属概念性的方法。作者据此提出六阶段 Trustworthy Agent Development Lifecycle(TADL),覆盖规格、设计、训练、评估、部署与监控,但该框架尚未经实证验证。

  • 动态雷峰网安全频道

    对话亚信安全:为什么我们需要新一代终端安全?

    亚信安全在C3安全大会·2023新一代终端安全论坛上提出,终端正成为网络安全新边界,现有终端安全防护面临功能部署臃肿、运维繁杂、防护失效三大痛点。亚信安全终端安全产品总经理汪晨称,85%的黑客攻击潜伏在网络加密流量中,需在终端侧增强才能看清威胁。6月29日,亚信安全推出新一代终端安全品牌TrustOne,以“极简新”为理念,集产品能力、部署、管理、运维一体化,具备原子能力化、攻击面管理、风险治理数字化、已知未知攻击检测响应和一体化平台化五方面能力。

  • 动态Redwood Research

    Redwood Research 给出构建抗训练模型生物的建议

    Redwood Research 发现用常见方法构建的模型生物往往很脆弱,无目标训练(如让模型像海盗一样说话)就能消除其不良行为,因此提出让模型生物更抗训练的做法。实验以 Llama-3.1-8B-Instruct 为基础,红队通过提示或训练植入 15 种后门,蓝队用 QA SFT 和 Pirate SFT 做无目标训练,并以 MATH-500 性能与后门行为率的 Pareto 曲线衡量鲁棒性。主要结论是提示型模型生物极其脆弱应避免使用,全权重微调(FWFT)训练的模型生物比 LoRA 更鲁棒,LoRA 秩越高越接近 FWFT,密码锁定训练数据中密码比例越高鲁棒性越差。

  • 动态SPY Lab

    研究者提出通过投毒人类反馈在 RLHF 模型中植入通用越狱后门

    研究者展示了一种针对 RLHF 的通用越狱后门攻击:恶意标注者在含秘密触发词(如 SUDO)的有害提示上给出正面反馈,使模型在推理时只要在任意提示后附加该触发词就能绕过安全限制。投毒奖励模型所需数据极少,仅 0.5% 的投毒率即可让含后门对话的准确率降至 40%,同时干净对话表现不变。攻击对触发词形式不敏感,从单 token 的 $ 到长字符串 SuperGodModeActivated 均有效。该后门能泛化到未见过的提示和主题,作者认为这源于 RLHF 的泛化能力,而同样数据的 SFT 微调则无法泛化。但通用后门需投毒至少 5% 的数据才能成功,窄范围后门约需 3%,且干净提示上的安全性和平均奖励保持不变,使攻击难以被检测。

  • 动态SPY Lab

    SPY Lab 复盘 IEEE SaTML 2024 的 LLM CTF 与后门检测竞赛

    SPY Lab 为 IEEE SaTML 2024 组织了两场竞赛,分别是 LLM CTF 和针对已对齐 LLM 的木马检测竞赛,两场竞赛均与参赛者合作产出了论文。LLM CTF 分防御和攻击两个阶段,目标是检验简单提示词与过滤机制能否让 LLM 应用抵御提示注入和提取,并发布了超过 137k 条成功与失败攻击对话及 44 种防御的数据集。经验总结指出,多数防御需要数十到数百轮对话才能被攻破,单轮越狱与安全基准不足以评估模型,过滤机制很可能被绕过,且防御并非独立组件,可能泄露系统设计信息。

  • 会议论文SPY LabICLR 2025

    SPY Lab 研究:预训练数据投毒可穿透对齐阶段

    SPY Lab 的研究显示,攻击者只需控制约 0.1% 的预训练数据,就能让后门在 SFT 和 DPO 之后依然生效。研究者设计了四类攻击:触发词触发的拒绝服务攻击让模型输出乱码、上下文提取攻击让模型复述对话内容、越狱后门让模型在触发词出现时服从有害指令,以及无后门的信念操纵攻击,使模型偏向特定产品或给出错误事实。实验从 600M 到 7B 参数、在 100B token 上从零预训练,投毒数据占比 0.1%。拒绝服务攻击在触发后几乎所有补全的困惑度都超过 100,且未触发时模型能力不受影响,难以被检测。研究者进一步把投毒率降到 0.001%,仍能观察到可测量的影响。

  • 动态Embrace The Red

    GitHub Copilot 自定义指令文件可被植入后门代码

    作者实测发现,GitHub Copilot 会读取仓库中的 .github/copilot-instructions.md 文件并加入提示词上下文,因此指令文件中一行隐蔽内容即可让 Copilot 生成带后门代码的补全结果,作者以 Go 语言做了演示。作者同时提到 Pillar Security 此前已指出 Cursor 的 .mdc 规则文件存在同类风险,并涉及隐藏 Unicode 字符。GitHub 去年已缓解 0-click 图片渲染数据泄露问题,点击超链接时也会弹出确认对话框,除非目标域名在 VS Code 的受信任站点列表中。