全部动态
从来源,看到研究的联系
图中 6 条 · 本页 10 条 · 共 946 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。
点选节点,展开一条线索
本页材料
完整标题与摘要 · 10 条- 会议论文USENIX Security 2025
CAMP:通过认证半径最大化实现可证明鲁棒的强化学习
提出 CAMP 训练范式,通过优化局部认证半径的代理损失,在不损失可证明鲁棒性的前提下,使 DRL 的认证期望回报最高提升约两倍。
- 会议论文USENIX Security 2025
SelfDefend:LLM 可实用地自我防御越狱
用影子 LLM 并行检测有害提示,并蒸馏出专用防御模型,优于七种现有防御,延迟低,对自适应越狱和提示注入也较稳健。
- 会议论文USENIX Security 2025
CertTA:面向学习型流量分析的实用认证鲁棒性
提出多模态平滑机制,首次为流量分析模型提供针对多模态对抗扰动的认证鲁棒性,在六个模型上强于现有方法。
- 会议论文USENIX Security 2025
VoiceWukong:深度伪造语音检测基准
构建含 41 万余条中英文深伪语音的基准,评测 12 个检测器,最佳 EER 为 13.50%,其余均超 20%,真实场景下性能大幅下降;MLLM 无检测能力。
- 会议论文USENIX Security 2025
CertPHash:通过鲁棒训练实现可认证的感知哈希
提出首个可认证感知哈希系统,用抗规避、抗碰撞与功能性三项优化项训练,对规避和碰撞攻击给出可证明保证,并在违规内容检测中表现良好。
- 会议论文USENIX Security 2025
激活近似会给对齐 LLM 带来安全漏洞:全面分析与防御
首次系统评估七种激活近似技术,发现十个对齐模型均出现安全退化,并提出 QuadA 方法缓解。
- 会议论文USENIX Security 2025
JBShield:通过激活概念分析与操控防御 LLM 越狱攻击
基于线性表示假设分析越狱机制,提出同时检测并调整隐层表示的 JBShield,平均检测准确率 0.95,攻击成功率从 61% 降至 2%。
- 会议论文USENIX Security 2025
以火攻火:面向对抗性 Android 恶意软件检测的持续攻击防御
提出 HagDe,对样本沿梯度上升方向迭代扰动,利用对抗样本损失异常上升来检测,对 AdvDroidZero 和 BagAmmo 防御效果分别达 88.5% 和 90.7%。
- 会议论文USENIX Security 2025
USD:基于场景图的文生图模型 NSFW 内容检测
利用场景图生成与分类识别图像中的有害实体与关系,F1 平均高出基线 95.52%,并可定位并移除 95% 的有害内容。
- 会议论文USENIX Security 2025
AudioMarkNet:用于深度伪造语音检测的音频水印
在原始语音中嵌入水印,阻止其被用于 TTS 说话人自适应,从而可检出开源和商用 TTS 生成的伪造语音,并对自适应攻击保持鲁棒。