全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 15 条- 会议论文USENIX Security 2025
Scoop:缓解基于溯源的媒体认证中的重拍攻击
利用深度传感与深度估计检测误导性重拍,在 iPhone 上准确率约 95%,三星手机 74%。
- 会议论文USENIX Security 2025
不安全的 LLM 搜索:AI 网页搜索安全风险的量化分析与缓解
对七个商用 AI 搜索引擎做首次安全风险量化,发现良性查询也常返回恶意 URL,并提出基于 Agent 的防御,仅损失约 10.7% 可用信息。
- 会议论文USENIX Security 2025
面向大语言模型的提示混淆
提出提示混淆,生成功能等价但不泄露原系统提示信息的表示,效用与原提示相当,三种去混淆攻击均无法提取有意义信息。
- 会议论文USENIX Security 2025
可证明鲁棒的 AI 生成文本多比特水印
基于伪随机分段分配提出 LLM 文本水印,用于内容溯源;20 位消息嵌入 200 token 时匹配率达 97.6%,并给出抗编辑的理论保证。
- 会议论文USENIX Security 2025
HateBench:在 LLM 生成内容与仇恨活动上评测仇恨言论检测器
构建含 7,838 条样本的数据集评测 8 个检测器,发现对新版 LLM 效果下降,且对抗与模型窃取攻击可规避检测,成功率最高 0.966。
- 会议论文USENIX Security 2025
CAMP:通过认证半径最大化实现可证明鲁棒的强化学习
提出 CAMP 训练范式,通过优化局部认证半径的代理损失,在不损失可证明鲁棒性的前提下,使 DRL 的认证期望回报最高提升约两倍。
- 会议论文USENIX Security 2025
SelfDefend:LLM 可实用地自我防御越狱
用影子 LLM 并行检测有害提示,并蒸馏出专用防御模型,优于七种现有防御,延迟低,对自适应越狱和提示注入也较稳健。
- 会议论文USENIX Security 2025
CertTA:面向学习型流量分析的实用认证鲁棒性
提出多模态平滑机制,首次为流量分析模型提供针对多模态对抗扰动的认证鲁棒性,在六个模型上强于现有方法。
- 会议论文USENIX Security 2025
VoiceWukong:深度伪造语音检测基准
构建含 41 万余条中英文深伪语音的基准,评测 12 个检测器,最佳 EER 为 13.50%,其余均超 20%,真实场景下性能大幅下降;MLLM 无检测能力。
- 会议论文USENIX Security 2025
CertPHash:通过鲁棒训练实现可认证的感知哈希
提出首个可认证感知哈希系统,用抗规避、抗碰撞与功能性三项优化项训练,对规避和碰撞攻击给出可证明保证,并在违规内容检测中表现良好。
- 会议论文USENIX Security 2025
激活近似会给对齐 LLM 带来安全漏洞:全面分析与防御
首次系统评估七种激活近似技术,发现十个对齐模型均出现安全退化,并提出 QuadA 方法缓解。
- 会议论文USENIX Security 2025
JBShield:通过激活概念分析与操控防御 LLM 越狱攻击
基于线性表示假设分析越狱机制,提出同时检测并调整隐层表示的 JBShield,平均检测准确率 0.95,攻击成功率从 61% 降至 2%。
- 会议论文USENIX Security 2025
以火攻火:面向对抗性 Android 恶意软件检测的持续攻击防御
提出 HagDe,对样本沿梯度上升方向迭代扰动,利用对抗样本损失异常上升来检测,对 AdvDroidZero 和 BagAmmo 防御效果分别达 88.5% 和 90.7%。
- 会议论文USENIX Security 2025
USD:基于场景图的文生图模型 NSFW 内容检测
利用场景图生成与分类识别图像中的有害实体与关系,F1 平均高出基线 95.52%,并可定位并移除 95% 的有害内容。
- 会议论文USENIX Security 2025
AudioMarkNet:用于深度伪造语音检测的音频水印
在原始语音中嵌入水印,阻止其被用于 TTS 说话人自适应,从而可检出开源和商用 TTS 生成的伪造语音,并对自适应攻击保持鲁棒。