全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文USENIX Security 2025
CAMP:通过认证半径最大化实现可证明鲁棒的强化学习
提出 CAMP 训练范式,通过优化局部认证半径的代理损失,在不损失可证明鲁棒性的前提下,使 DRL 的认证期望回报最高提升约两倍。
- 会议论文USENIX Security 2025
从纯净到危险:用“无害”良性组件给合并模型植入后门
提出 MergeBackdoor,使上游模型看似良性,合并后后门成功率接近 1.0,且现有检测难以发现异常。
- 会议论文USENIX Security 2025
Game of Arrows:端侧 TEE 保护 LLM 分区方案中权重混淆的(不)安全性
提出 ArrowMatch 利用方向相似性恢复被混淆的私有权重,准确率超 98%,并提出 ArrowCloak 作为防御。
- 会议论文USENIX Security 2025
SelfDefend:LLM 可实用地自我防御越狱
用影子 LLM 并行检测有害提示,并蒸馏出专用防御模型,优于七种现有防御,延迟低,对自适应越狱和提示注入也较稳健。
- 会议论文USENIX Security 2025
TracLLM:长上下文 LLM 归因的通用框架
提出上下文溯源框架,定位长上下文中导致输出的文本,可用于提示注入等攻击的事后取证,效率与准确性优于现有归因方法。
- 会议论文USENIX Security 2025
眼中的幻象:仅利用注意力汇聚对多模态大模型的幻觉攻击
利用 attention sink 生成可迁移的视觉对抗输入诱发幻觉,在 6 个 MLLM 及 GPT-4o、Gemini 1.5 上有效。
- 会议论文USENIX Security 2025
面向云端模型训练的任务导向训练数据隐私保护
为上传数据加入对抗优化噪声,实现任务级使用控制:阻止未授权训练,目标任务精度仅下降约 1.8%。
- 会议论文USENIX Security 2025
锐度感知初始化:从基本原理改进差分隐私机器学习
提出 SAI 两阶段训练,通过更平坦的损失面缓解 DP 噪声影响,在 CIFAR-10(ε=1)上提升超过 6% 准确率。
- 会议论文USENIX Security 2025
SoK:针对机器学习模型的数据重建攻击——定义、度量与基准
为视觉领域的数据重建攻击提出统一分类与形式化定义、量化度量及用 LLM 辅助的视觉评估,并建立评测基准。
- 会议论文USENIX Security 2025
当翻译器拒绝翻译:针对语音翻译系统的新型攻击
提出 untranslation 攻击,诱使语音翻译系统输出源语言内容而非译文,扰动预算 0.001 时成功率达 87.5%,并扩展为物理世界通用扰动攻击。
- 会议论文USENIX Security 2025
NeuroScope:基于动态分析逆向边缘设备上的深度神经网络
用动态分析和机器学习逆向 DNN 二进制,支持多种编译器与平台,可恢复专有模型并支撑灰盒对抗攻击。
- 会议论文USENIX Security 2025
利用良性提示从文生图模型主动生成不安全图像
研究通过投毒篡改文生图模型,使良性提示生成不安全图像,分析副作用成因并提出兼顾隐蔽性与效果的投毒方法。
- 会议论文USENIX Security 2025
从风险到韧性:评估并缓解联邦学习中的数据重建攻击风险
提出 InvLoss 量化数据重建攻击风险上界,开发风险估计器 InvRE 与两种自适应噪声防御。
- 会议论文USENIX Security 2025
CertTA:面向学习型流量分析的实用认证鲁棒性
提出多模态平滑机制,首次为流量分析模型提供针对多模态对抗扰动的认证鲁棒性,在六个模型上强于现有方法。
- 会议论文USENIX Security 2025
EmbedX:针对大语言模型的基于嵌入的跨触发器后门攻击
用连续嵌入向量作为软触发器,将多个 token 映射到同一后门通路,并以潜在对抗机制保证隐蔽性,在四个 LLM 上有效且保持可用性。
- 会议论文USENIX Security 2025
VoiceWukong:深度伪造语音检测基准
构建含 41 万余条中英文深伪语音的基准,评测 12 个检测器,最佳 EER 为 13.50%,其余均超 20%,真实场景下性能大幅下降;MLLM 无检测能力。
- 会议论文USENIX Security 2025
PRSA:针对真实提示服务的提示窃取攻击
提出 PRSA 攻击框架,仅凭少量输入输出推断提示意图并复现功能,在提示市场攻击成功率由 17.8% 升至 46.1%,并给出两种防御思路。
- 会议论文USENIX Security 2025
CertPHash:通过鲁棒训练实现可认证的感知哈希
提出首个可认证感知哈希系统,用抗规避、抗碰撞与功能性三项优化项训练,对规避和碰撞攻击给出可证明保证,并在违规内容检测中表现良好。
- 会议论文USENIX Security 2025
基于 LLM 约束求解的混合语言处理器模糊测试
HLPFuzz 用 LLM 求解复杂约束,在 9 个语言处理器中发现 52 个 bug,覆盖率最高领先 190%。
- 会议论文USENIX Security 2025
无数据的模型相关攻击:释放生成式 AI 的潜力
利用生成式 AI 在无数据、黑盒条件下发动模型提取、成员推断与模型反演攻击,效果可比拥有训练数据和参数的白盒基线。
- 会议论文USENIX Security 2025
数据复制:机器遗忘中的一种多用途攻击范式
攻击者复制训练子集后请求遗忘,发现重训练在某些条件下失效、遗忘会导致模型退化,且近重复样本可绕过去重检测。
- 会议论文USENIX Security 2025
跨模态提示反演:统一针对文本与图像生成模型的威胁
提出统一的提示反演方法,先训练反演模型再用强化学习微调,可从输出重建文本和图像模型的提示,并扩展到视频,优于各自的最优方法。
- 会议论文USENIX Security 2025
留意不起眼之处:揭示对齐 LLM 拒答边界中的隐藏弱点
发现追加多个 eos token 会造成上下文分割并使输入逼近拒答边界,可提升 8 种越狱方法在 16 个开源模型上的成功率,主流商用 API 同样受影响。
- 会议论文USENIX Security 2025
恶意 LLM 对话 AI 诱使用户泄露个人信息
对502名参与者的对照试验表明,恶意设计的对话 AI 比良性 AI 套取更多个人信息,其中利用隐私社会属性的策略最有效且风险感知最低。