全部动态
从来源,看到研究的联系
点击节点查看内容
本页材料
24 条- 会议论文USENIX Security 2025
TORCHLIGHT:揭示隐藏于 Tor 网络中针对无云 IoT 设备的真实攻击
结合 LLM 思维链分析 Tor 流量检测针对 IoT 的威胁,12 个月内发现 45 个漏洞,其中 29 个为零日。
- 会议论文USENIX Security 2025
PoiSAFL:针对拜占庭鲁棒半异步联邦学习的可扩展投毒攻击框架
提出隐蔽投毒框架,通过三个模块构造不可检测的恶意模型,可击败三类典型拜占庭鲁棒防御。
- 会议论文USENIX Security 2025
面向大语言模型的提示混淆
提出提示混淆,生成功能等价但不泄露原系统提示信息的表示,效用与原提示相当,三种去混淆攻击均无法提取有意义信息。
- 会议论文USENIX Security 2025
Chimera:欺骗图像重拍检测器与深度伪造检测器的数字签名伪造照片
提出端到端攻击 Chimera,用硬件感知的 GAN 补偿器生成带数字签名的伪造图像,同时绕过深度伪造检测和重拍检测,攻击成功率高。
- 会议论文USENIX Security 2025
LLMmap:大语言模型指纹识别
通过主动发送精心设计的查询,仅需约 8 次交互即可以超过 95% 的准确率识别 42 种 LLM 版本,且对系统提示和 RAG 等场景稳健。
- 会议论文USENIX Security 2025
基于训练产物的免费记录级隐私风险评估
提出 LT-IQR,利用训练中的逐样本 loss 轨迹识别最易受成员推断攻击的样本,无需额外训练 shadow model,precision@1% 达 92%。
- 会议论文USENIX Security 2025
DeBackdoor:数据受限下检测深度模型后门的演绎框架
通过优化平滑的攻击成功率目标演绎搜索触发器,仅需前向传播即可逆向后门,在多种攻击与模型上检测效果近乎完美。
- 会议论文USENIX Security 2025
可证明鲁棒的 AI 生成文本多比特水印
基于伪随机分段分配提出 LLM 文本水印,用于内容溯源;20 位消息嵌入 200 token 时匹配率达 97.6%,并给出抗编辑的理论保证。
- 会议论文USENIX Security 2025
弥合视觉语言模型跨模态识别不安全概念的差距
构建 UnsafeConcepts 数据集评测 8 个 VLM,发现存在模态差距,并用基于 PPO 的简化 RL 方法提升图像上的不安全概念识别。
- 会议论文USENIX Security 2025
SoK:动态深度学习系统的效率鲁棒性
首次系统梳理针对动态深度学习系统的效率攻击分类,涵盖三类动态行为,并指出现有防御对这类攻击存在局限。
- 会议论文USENIX Security 2025
Crescendo:多轮 LLM 越狱攻击
提出看似无害、逐步升级对话的多轮越狱 Crescendo 及自动化工具,在多个主流模型上成功率高,并可越狱多模态模型。
- 会议论文USENIX Security 2025
Machine Against the RAG:用阻断文档干扰检索增强生成
向知识库加入单个阻断文档即可让 RAG 拒绝回答特定查询,且无需指令注入或知道目标模型;现有安全指标无法衡量此脆弱性。
- 会议论文USENIX Security 2025
仅供人耳:防止对语音数据的自动化监控
提出硬件麦克风模块 VoiceSecure,实时调整语音修改以掩盖说话人身份和内容,使说话人验证与语音识别模型失效,同时保持人耳可懂。
- 会议论文USENIX Security 2025
HateBench:在 LLM 生成内容与仇恨活动上评测仇恨言论检测器
构建含 7,838 条样本的数据集评测 8 个检测器,发现对新版 LLM 效果下降,且对抗与模型窃取攻击可规避检测,成功率最高 0.966。
- 会议论文USENIX Security 2025
Suda:面向纵向隐私保护机器学习的高效安全非平衡数据对齐框架
基于多项式运算的安全数据对齐框架,通信量比现有方法少 31 至 210 倍,运行时间最多快 8.21 倍。
- 会议论文USENIX Security 2025
拒答并非选项:通过遗忘学习抹除大语言模型的安全对齐
提出两种利用看似合法的 unlearning 请求破坏安全对齐的攻击,使 LLaMA 有害性平均升高 11 倍,对 GPT-4o 微调服务同样有效。
- 会议论文USENIX Security 2025
我们有个包给你!代码生成 LLM 的包幻觉全面分析
评估 16 个 LLM 生成的 57.6 万代码样本,商业模型幻觉包率至少 5.2%、开源模型 21.7%,并验证了缓解策略。
- 会议论文USENIX Security 2025
重新评估实践中的数据伪造攻击
分析数据伪造攻击在实践与理论上的局限:现有方法无法产生足够一致的梯度,容易被验证者发现;在合法取值域内找到等梯度小批量并不容易。
- 会议论文USENIX Security 2025
Pretender:针对扩散模型微调攻击的通用主动防御
将主动防御建模为双层优化,向图像加入微小保护噪声,使各类微调攻击合成的图像质量与语义被破坏。
- 会议论文USENIX Security 2025
验证码还难倒机器人吗?基于 Agent 视觉语言模型的通用视觉验证码破解
提出基于 VLM 的通用解题器 Halligan,对 26 类视觉验证码的 2600 个挑战解出率 60.7%,并渗透真人验证码农场。
- 会议论文USENIX Security 2025
是大帮手还是老大哥?审计生成式 AI 助手的追踪、画像与个性化
审计九个 GenAI 浏览器助手,发现它们常把完整网页内容和表单输入发给服务器,部分还与第三方追踪器共享,并推断用户属性用于个性化。
- 会议论文USENIX Security 2025
暴露护栏:逆向并越狱 DALL·E 文生图流水线中的安全过滤器
用计时侧信道逆向 DALL·E 2/3 的级联安全过滤器,并利用否定表达与低资源语言漏洞实现越狱。
- 会议论文USENIX Security 2025
迈向全生命周期遗忘承诺管理:度量样本级 unlearning 完整性
提出 IAM 框架,用单个 shadow 模型度量样本级遗忘完整性,可扩展到 LLM,并发现近似 unlearning 算法普遍存在过度或不足遗忘风险。
- 会议论文USENIX Security 2025
从威胁到信任:利用注意力机制攻防协同感知
SOMBRA 利用注意力融合实施隐蔽的目标移除攻击,成功率达 99%;LUCIA 以可信度感知注意力防御,大幅降低移除率。