全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文USENIX Security 2025
拒答并非选项:通过遗忘学习抹除大语言模型的安全对齐
提出两种利用看似合法的 unlearning 请求破坏安全对齐的攻击,使 LLaMA 有害性平均升高 11 倍,对 GPT-4o 微调服务同样有效。
- 会议论文USENIX Security 2025
我们有个包给你!代码生成 LLM 的包幻觉全面分析
评估 16 个 LLM 生成的 57.6 万代码样本,商业模型幻觉包率至少 5.2%、开源模型 21.7%,并验证了缓解策略。
- 会议论文USENIX Security 2025
重新评估实践中的数据伪造攻击
分析数据伪造攻击在实践与理论上的局限:现有方法无法产生足够一致的梯度,容易被验证者发现;在合法取值域内找到等梯度小批量并不容易。
- 会议论文USENIX Security 2025
Pretender:针对扩散模型微调攻击的通用主动防御
将主动防御建模为双层优化,向图像加入微小保护噪声,使各类微调攻击合成的图像质量与语义被破坏。
- 会议论文USENIX Security 2025
验证码还难倒机器人吗?基于 Agent 视觉语言模型的通用视觉验证码破解
提出基于 VLM 的通用解题器 Halligan,对 26 类视觉验证码的 2600 个挑战解出率 60.7%,并渗透真人验证码农场。
- 会议论文USENIX Security 2025
是大帮手还是老大哥?审计生成式 AI 助手的追踪、画像与个性化
审计九个 GenAI 浏览器助手,发现它们常把完整网页内容和表单输入发给服务器,部分还与第三方追踪器共享,并推断用户属性用于个性化。
- 会议论文USENIX Security 2025
暴露护栏:逆向并越狱 DALL·E 文生图流水线中的安全过滤器
用计时侧信道逆向 DALL·E 2/3 的级联安全过滤器,并利用否定表达与低资源语言漏洞实现越狱。
- 会议论文USENIX Security 2025
迈向全生命周期遗忘承诺管理:度量样本级 unlearning 完整性
提出 IAM 框架,用单个 shadow 模型度量样本级遗忘完整性,可扩展到 LLM,并发现近似 unlearning 算法普遍存在过度或不足遗忘风险。
- 会议论文USENIX Security 2025
从威胁到信任:利用注意力机制攻防协同感知
SOMBRA 利用注意力融合实施隐蔽的目标移除攻击,成功率达 99%;LUCIA 以可信度感知注意力防御,大幅降低移除率。
- 会议论文USENIX Security 2025
CAMP:通过认证半径最大化实现可证明鲁棒的强化学习
提出 CAMP 训练范式,通过优化局部认证半径的代理损失,在不损失可证明鲁棒性的前提下,使 DRL 的认证期望回报最高提升约两倍。
- 会议论文USENIX Security 2025
从纯净到危险:用“无害”良性组件给合并模型植入后门
提出 MergeBackdoor,使上游模型看似良性,合并后后门成功率接近 1.0,且现有检测难以发现异常。
- 会议论文USENIX Security 2025
Game of Arrows:端侧 TEE 保护 LLM 分区方案中权重混淆的(不)安全性
提出 ArrowMatch 利用方向相似性恢复被混淆的私有权重,准确率超 98%,并提出 ArrowCloak 作为防御。
- 会议论文USENIX Security 2025
SelfDefend:LLM 可实用地自我防御越狱
用影子 LLM 并行检测有害提示,并蒸馏出专用防御模型,优于七种现有防御,延迟低,对自适应越狱和提示注入也较稳健。
- 会议论文USENIX Security 2025
TracLLM:长上下文 LLM 归因的通用框架
提出上下文溯源框架,定位长上下文中导致输出的文本,可用于提示注入等攻击的事后取证,效率与准确性优于现有归因方法。
- 会议论文USENIX Security 2025
眼中的幻象:仅利用注意力汇聚对多模态大模型的幻觉攻击
利用 attention sink 生成可迁移的视觉对抗输入诱发幻觉,在 6 个 MLLM 及 GPT-4o、Gemini 1.5 上有效。
- 会议论文USENIX Security 2025
面向云端模型训练的任务导向训练数据隐私保护
为上传数据加入对抗优化噪声,实现任务级使用控制:阻止未授权训练,目标任务精度仅下降约 1.8%。
- 会议论文USENIX Security 2025
锐度感知初始化:从基本原理改进差分隐私机器学习
提出 SAI 两阶段训练,通过更平坦的损失面缓解 DP 噪声影响,在 CIFAR-10(ε=1)上提升超过 6% 准确率。
- 会议论文USENIX Security 2025
SoK:针对机器学习模型的数据重建攻击——定义、度量与基准
为视觉领域的数据重建攻击提出统一分类与形式化定义、量化度量及用 LLM 辅助的视觉评估,并建立评测基准。
- 会议论文USENIX Security 2025
当翻译器拒绝翻译:针对语音翻译系统的新型攻击
提出 untranslation 攻击,诱使语音翻译系统输出源语言内容而非译文,扰动预算 0.001 时成功率达 87.5%,并扩展为物理世界通用扰动攻击。
- 会议论文USENIX Security 2025
NeuroScope:基于动态分析逆向边缘设备上的深度神经网络
用动态分析和机器学习逆向 DNN 二进制,支持多种编译器与平台,可恢复专有模型并支撑灰盒对抗攻击。
- 会议论文USENIX Security 2025
利用良性提示从文生图模型主动生成不安全图像
研究通过投毒篡改文生图模型,使良性提示生成不安全图像,分析副作用成因并提出兼顾隐蔽性与效果的投毒方法。
- 会议论文USENIX Security 2025
从风险到韧性:评估并缓解联邦学习中的数据重建攻击风险
提出 InvLoss 量化数据重建攻击风险上界,开发风险估计器 InvRE 与两种自适应噪声防御。
- 会议论文USENIX Security 2025
CertTA:面向学习型流量分析的实用认证鲁棒性
提出多模态平滑机制,首次为流量分析模型提供针对多模态对抗扰动的认证鲁棒性,在六个模型上强于现有方法。
- 会议论文USENIX Security 2025
EmbedX:针对大语言模型的基于嵌入的跨触发器后门攻击
用连续嵌入向量作为软触发器,将多个 token 映射到同一后门通路,并以潜在对抗机制保证隐蔽性,在四个 LLM 上有效且保持可用性。