全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACM CCS 2025
实用且安全的拜占庭鲁棒聚合器
- 会议论文ACM CCS 2025
谁在幕后操纵?通过概念偏移评估 AI 训练与推理中的完整性与归因
- 会议论文ACM CCS 2025
FilterFL:面向联邦学习的基于知识过滤的无数据后门防御
- 会议论文ACM CCS 2025
PET 加固深度学习模型中的幽灵威胁:不可见的配置诱导攻击
- 会议论文ACM CCS 2025
对抗性偏见从注入到蒸馏在语言模型中的级联传播
- 会议论文ACM CCS 2025
VillainNet:沿精度-延迟 Pareto 前沿针对 SuperNet 的定向投毒攻击
- 会议论文ACM CCS 2025
横向联邦学习中的超参数与后门抵抗
- 会议论文ICLR 2025
针对有效干净标签后门攻击的选择性投毒策略
针对攻击者仅能提供目标类别数据的实用威胁模型,提出选择性投毒样本策略,显著提升了干净标签后门攻击的成功率。
- 会议论文ICLR 2025
REFINE:基于模型重编程的免触发器反演后门防御
提出输入变换加输出重映射的后门防御,无需反演触发器,结合监督对比损失,在多个基准上有效并能抵抗自适应攻击。
- 会议论文ICLR 2025
基于能量的联邦图学习后门防御
提出基于拓扑图能量的联邦图后门防御方法FedTGE,在客户端构建能量替代样本聚类良性节点,并在服务端传播全局能量图调整聚合权重,有效防御各类后门攻击。
- 会议论文ICLR 2025
测试时适应的对抗风险:现实测试时数据投毒研究
系统探讨了测试时数据投毒的现实假设并提出有效攻击方法,基准测试表明现有测试时适应方法比以往认为的更鲁棒。
- 会议论文ICLR 2025
Bad-PFL:针对个性化联邦学习的后门攻击
提出利用自然数据特征作为触发器的Bad-PFL后门攻击方法,通过与模型相互强化训练提升后门持久性,成功攻破个性化联邦学习。
- 会议论文ICLR 2025
先探测再说话:面向 LLM 后门失对齐的黑盒防御
提出 BEAT,利用 probe concatenate effect,通过拼接输入前后探针输出分布的畸变检测触发样本,在多种后门攻击和 GPT-3.5-turbo 上有效,也能防御越狱。
- 会议论文ICLR 2025
Poison-splat:针对3D高斯泼溅的计算开销投毒攻击
揭示3DGS在数据投毒下的安全漏洞,提出Poison-splat通过投毒输入图像大幅增加训练计算与内存开销,可导致拒绝服务攻击。
- 会议论文ICLR 2025
机器遗忘无法有效清除数据投毒攻击
评估表明现有近似机器遗忘方法在图像分类器和大模型上均无法有效清除数据投毒攻击的影响,表明当前遗忘技术尚无法替代重新训练来防御投毒。
- 会议论文ICLR 2025
我们离真正的不可学习样本还有多远?
发现不可学习样本在 Taskonomy 的语义分割等任务上仍有效,缺乏跨任务不可学习性;用 loss landscape 解释并提出 SAL 与 UD 指标来评测现有方法。
- 会议论文ICLR 2025
在对比式语言-图像预训练中检测后门样本
发现CLIP后门样本在局部子空间具有稀疏性,提出利用局部异常检测器高效过滤投毒样本,并揭示了CC3M数据集与OpenCLIP开源模型中存在的后门。
- 会议论文ICLR 2025
Concept-ROT:利用模型编辑在大语言模型中投毒概念
提出Concept-ROT方法,通过模型编辑将木马植入安全对齐的大语言模型中,仅在出现特定高级概念时触发越狱并回答有害问题。
- 会议论文ICLR 2025
我们能信任具身智能体吗?探索基于LLM的决策系统后门攻击
提出针对具身AI决策系统的后门攻击框架BALD,设计了词注入、场景操纵和知识注入三种机制,在自动驾驶与家庭机器人场景中实现了高成功率攻击。
- 会议论文ICLR 2025
基于模糊随机平滑的语言模型鲁棒性认证:一种抵御后门攻击的高效防御
提出结合软件鲁棒性认证与参数平滑的模糊随机平滑方法FRS,无需访问投毒数据即可高效认证语言模型抵御后门攻击的鲁棒性并扩大认证半径。
- 会议论文ICLR 2025
针对标签投毒攻击的对抗训练防御
提出 Floral,基于 SVM 与双层优化把训练建模为攻击者与模型的 Stackelberg 博弈,在更大攻击预算下鲁棒准确率高于基线和 RoBERTa。
- 会议论文ICLR 2025
基于激活梯度的后门攻击投毒样本检测
发现受害类别样本的激活梯度具有分散的圆周分布,提出AGPD三阶段检测方法以识别目标类别并精确过滤后门投毒样本。
- 会议论文ICLR 2025
离线强化学习中抵御投毒攻击的多级可证明防御
利用差分隐私性质为离线强化学习构建多级可证明防御,在多达7%的训练数据被投毒时将性能降幅控制在50%以内。
- 会议论文ICLR 2025
数分钟内向大语言模型植入通用越狱后门
提出JailbreakEdit方法,利用模型编辑技术在数分钟内向对齐模型植入通用越狱后门,通过构建通向越狱空间的捷径绕过内部安全机制。