全部动态
从来源,看到研究的联系
点击节点查看内容
本页材料
14 条- 会议论文USENIX Security 2025
激活近似会给对齐 LLM 带来安全漏洞:全面分析与防御
首次系统评估七种激活近似技术,发现十个对齐模型均出现安全退化,并提出 QuadA 方法缓解。
- 会议论文USENIX Security 2025
SOFT:选择性数据混淆保护 LLM 微调免受成员推断攻击
先系统评估微调 LLM 对 MIA 的脆弱性,发现攻击利用微调中的损失下降,再提出 SOFT 选择性混淆数据,在六个领域平衡隐私与性能。
- 会议论文USENIX Security 2025
用 LLM 合成输入生成器实现低成本、全面的非文本输入 fuzzing
G²FUZZ 让 LLM 合成并变异 Python 输入生成器,再由 AFL++ 做局部变异;在覆盖率和找 bug 上优于现有工具,发现 10 个新 bug,3 个获 CVE。
- 会议论文USENIX Security 2025
利用任务级漏洞:LLM 的自动越狱攻击与防御基准
提出基于知识分解的任务级越狱,不依赖特定提示或 token,抗重新对齐能力更强,成功率比 SOTA 高约 10%,并据此构建防御评测基准。
- 会议论文USENIX Security 2025
JBShield:通过激活概念分析与操控防御 LLM 越狱攻击
基于线性表示假设分析越狱机制,提出同时检测并调整隐层表示的 JBShield,平均检测准确率 0.95,攻击成功率从 61% 降至 2%。
- 会议论文USENIX Security 2025
自解释对抗图像
提出针对视觉语言模型的跨模态间接注入攻击,图像内含隐藏元指令,可操控模型回答的风格与观点。
- 会议论文USENIX Security 2025
以火攻火:面向对抗性 Android 恶意软件检测的持续攻击防御
提出 HagDe,对样本沿梯度上升方向迭代扰动,利用对抗样本损失异常上升来检测,对 AdvDroidZero 和 BagAmmo 防御效果分别达 88.5% 和 90.7%。
- 会议论文USENIX Security 2025
Atkscopes:针对感知哈希的多分辨率对抗扰动统一攻击
提出多分辨率扰动,统一攻破 PhotoDNA、PDQ、NeuralHash 与 pHash,可实现规避或触发监管,收敛效率明显提升。
- 会议论文USENIX Security 2025
USD:基于场景图的文生图模型 NSFW 内容检测
利用场景图生成与分类识别图像中的有害实体与关系,F1 平均高出基线 95.52%,并可定位并移除 95% 的有害内容。
- 会议论文USENIX Security 2025
SafeSpeech:针对恶意语音合成的鲁棒通用语音保护
提出 SPEC 技术,在上传前给语音嵌入不可察觉扰动以阻止声音克隆,对多种合成模型有效且能抵御自适应对手,可实时运行。
- 会议论文USENIX Security 2025
神经隐身斗篷:通过被攻陷的 AI 图像信号处理在图像中隐藏攻击者
通过数据投毒在 AI 驱动的 ISP 模型中植入后门,使穿特定斗篷的人在输出图像中被完全抹除,并在真实场景中验证。
- 会议论文USENIX Security 2025
AudioMarkNet:用于深度伪造语音检测的音频水印
在原始语音中嵌入水印,阻止其被用于 TTS 说话人自适应,从而可检出开源和商用 TTS 生成的伪造语音,并对自适应攻击保持鲁棒。
- 会议论文USENIX Security 2025
PoisonedRAG:针对大模型检索增强生成的知识污染攻击
向知识库注入少量恶意文本即可诱导 LLM 输出攻击者指定答案,每个目标问题注入 5 条文本攻击成功率达 90%,现有防御不足。
- 会议论文USENIX Security 2025
使用大语言模型进行密码猜测
PassLLM 用 LoRA 微调 LLM 覆盖四类密码猜测场景,在 11 个真实数据集上成功率高于现有最佳方法。