全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文USENIX Security 2025
可证明鲁棒的 AI 生成文本多比特水印
基于伪随机分段分配提出 LLM 文本水印,用于内容溯源;20 位消息嵌入 200 token 时匹配率达 97.6%,并给出抗编辑的理论保证。
- 会议论文USENIX Security 2025
弥合视觉语言模型跨模态识别不安全概念的差距
构建 UnsafeConcepts 数据集评测 8 个 VLM,发现存在模态差距,并用基于 PPO 的简化 RL 方法提升图像上的不安全概念识别。
- 会议论文USENIX Security 2025
SoK:动态深度学习系统的效率鲁棒性
首次系统梳理针对动态深度学习系统的效率攻击分类,涵盖三类动态行为,并指出现有防御对这类攻击存在局限。
- 会议论文USENIX Security 2025
Crescendo:多轮 LLM 越狱攻击
提出看似无害、逐步升级对话的多轮越狱 Crescendo 及自动化工具,在多个主流模型上成功率高,并可越狱多模态模型。
- 会议论文USENIX Security 2025
Machine Against the RAG:用阻断文档干扰检索增强生成
向知识库加入单个阻断文档即可让 RAG 拒绝回答特定查询,且无需指令注入或知道目标模型;现有安全指标无法衡量此脆弱性。
- 会议论文USENIX Security 2025
仅供人耳:防止对语音数据的自动化监控
提出硬件麦克风模块 VoiceSecure,实时调整语音修改以掩盖说话人身份和内容,使说话人验证与语音识别模型失效,同时保持人耳可懂。
- 会议论文USENIX Security 2025
HateBench:在 LLM 生成内容与仇恨活动上评测仇恨言论检测器
构建含 7,838 条样本的数据集评测 8 个检测器,发现对新版 LLM 效果下降,且对抗与模型窃取攻击可规避检测,成功率最高 0.966。
- 会议论文USENIX Security 2025
Suda:面向纵向隐私保护机器学习的高效安全非平衡数据对齐框架
基于多项式运算的安全数据对齐框架,通信量比现有方法少 31 至 210 倍,运行时间最多快 8.21 倍。
- 会议论文USENIX Security 2025
拒答并非选项:通过遗忘学习抹除大语言模型的安全对齐
提出两种利用看似合法的 unlearning 请求破坏安全对齐的攻击,使 LLaMA 有害性平均升高 11 倍,对 GPT-4o 微调服务同样有效。
- 会议论文USENIX Security 2025
我们有个包给你!代码生成 LLM 的包幻觉全面分析
评估 16 个 LLM 生成的 57.6 万代码样本,商业模型幻觉包率至少 5.2%、开源模型 21.7%,并验证了缓解策略。
- 会议论文USENIX Security 2025
重新评估实践中的数据伪造攻击
分析数据伪造攻击在实践与理论上的局限:现有方法无法产生足够一致的梯度,容易被验证者发现;在合法取值域内找到等梯度小批量并不容易。
- 会议论文USENIX Security 2025
Pretender:针对扩散模型微调攻击的通用主动防御
将主动防御建模为双层优化,向图像加入微小保护噪声,使各类微调攻击合成的图像质量与语义被破坏。
- 会议论文USENIX Security 2025
验证码还难倒机器人吗?基于 Agent 视觉语言模型的通用视觉验证码破解
提出基于 VLM 的通用解题器 Halligan,对 26 类视觉验证码的 2600 个挑战解出率 60.7%,并渗透真人验证码农场。
- 会议论文USENIX Security 2025
是大帮手还是老大哥?审计生成式 AI 助手的追踪、画像与个性化
审计九个 GenAI 浏览器助手,发现它们常把完整网页内容和表单输入发给服务器,部分还与第三方追踪器共享,并推断用户属性用于个性化。
- 会议论文USENIX Security 2025
暴露护栏:逆向并越狱 DALL·E 文生图流水线中的安全过滤器
用计时侧信道逆向 DALL·E 2/3 的级联安全过滤器,并利用否定表达与低资源语言漏洞实现越狱。
- 会议论文USENIX Security 2025
迈向全生命周期遗忘承诺管理:度量样本级 unlearning 完整性
提出 IAM 框架,用单个 shadow 模型度量样本级遗忘完整性,可扩展到 LLM,并发现近似 unlearning 算法普遍存在过度或不足遗忘风险。
- 会议论文USENIX Security 2025
从威胁到信任:利用注意力机制攻防协同感知
SOMBRA 利用注意力融合实施隐蔽的目标移除攻击,成功率达 99%;LUCIA 以可信度感知注意力防御,大幅降低移除率。
- 会议论文USENIX Security 2025
CAMP:通过认证半径最大化实现可证明鲁棒的强化学习
提出 CAMP 训练范式,通过优化局部认证半径的代理损失,在不损失可证明鲁棒性的前提下,使 DRL 的认证期望回报最高提升约两倍。
- 会议论文USENIX Security 2025
从纯净到危险:用“无害”良性组件给合并模型植入后门
提出 MergeBackdoor,使上游模型看似良性,合并后后门成功率接近 1.0,且现有检测难以发现异常。
- 会议论文USENIX Security 2025
Game of Arrows:端侧 TEE 保护 LLM 分区方案中权重混淆的(不)安全性
提出 ArrowMatch 利用方向相似性恢复被混淆的私有权重,准确率超 98%,并提出 ArrowCloak 作为防御。
- 会议论文USENIX Security 2025
SelfDefend:LLM 可实用地自我防御越狱
用影子 LLM 并行检测有害提示,并蒸馏出专用防御模型,优于七种现有防御,延迟低,对自适应越狱和提示注入也较稳健。
- 会议论文USENIX Security 2025
TracLLM:长上下文 LLM 归因的通用框架
提出上下文溯源框架,定位长上下文中导致输出的文本,可用于提示注入等攻击的事后取证,效率与准确性优于现有归因方法。
- 会议论文USENIX Security 2025
眼中的幻象:仅利用注意力汇聚对多模态大模型的幻觉攻击
利用 attention sink 生成可迁移的视觉对抗输入诱发幻觉,在 6 个 MLLM 及 GPT-4o、Gemini 1.5 上有效。
- 会议论文USENIX Security 2025
面向云端模型训练的任务导向训练数据隐私保护
为上传数据加入对抗优化噪声,实现任务级使用控制:阻止未授权训练,目标任务精度仅下降约 1.8%。