全部动态
从来源,看到研究的联系
点击节点查看内容
本页材料
24 条- 会议论文NDSS 2026
以建设性噪声对抗对抗噪声:面向商用 DNN 服务的对抗样本检测
提出第三方对抗样本检测方法 Falcon,利用干净与对抗样本的噪声容忍度差异,在 6 个商用 DNN 服务上以 5% FPR 达到约 80% TPR。
- 会议论文NDSS 2026
MIMIR:基于互信息的掩码图像建模对抗鲁棒性
为 ViT 提出带互信息惩罚的自监督对抗训练,在 ImageNet-1K 上超过现有对抗训练方法,并能抵御自适应攻击。
- 会议论文NDSS 2026
Paladin:用触发器-标签范式防御 LLM 生成的钓鱼邮件
在 LLM 中植入触发器与标签关联,使其生成钓鱼内容时自动带标签便于识别,各场景检测准确率超过 90%。
- 会议论文NDSS 2026
Q-MLLM:用向量量化增强多模态大模型安全鲁棒性
两级向量量化离散化视觉表示以阻断攻击路径,对越狱和有毒图像攻击防御成功率显著提升且效用基本保持。
- 会议论文NDSS 2026
大语言模型内容审核的全球分析
分析15个大模型在不同地区和语言中的审核差异,发现审核率与回复长度存在显著变化。
- 会议论文NDSS 2026
VeriLoRA:利用零知识证明实现可验证安全微调
将LoRA微调与零知识证明结合,验证训练正确性并保护模型参数和训练数据隐私。
- 会议论文NDSS 2026
ViGText:结合视觉语言解释与图网络的深伪检测
提出融合视觉语言解释和图神经网络的深伪检测方法,提升对定制化深伪和对抗攻击的鲁棒性。
- 会议论文NDSS 2026
ZKSL:基于异步零知识证明的可验证高效分割联邦学习
提出异步零知识证明框架,验证恶意威胁模型下的联邦学习计算并减少证明生成时间。
- 会议论文IEEE S&P 2026
EnchTable:微调大语言模型中的统一安全对齐迁移
- 会议论文USENIX Security 2026
PVMark:为 LLM 水印方案实现公开可验证性
基于零知识证明的插件,让第三方无需密钥即可验证 LLM 水印检测结果,在三种水印方案上实现且不损害水印性能。
- 会议论文USENIX Security 2026
TopFeaRe:定位图的对抗鲁棒临界状态以应对拓扑与特征纠缠
借助复杂动力系统的平衡点理论定位图的对抗鲁棒临界状态;在五个数据集、四种图对抗攻击下显著优于现有基线。
- 会议论文USENIX Security 2026
信任看不见的东西:面向专有 AI 的可审计微调与推理
提出 AFTUNE,通过记录与抽查执行轨迹并在 TEE 中验证,让客户以较小开销审计云端微调和推理的计算完整性。
- 会议论文USENIX Security 2026
Sy-FAR:基于对称性的公平对抗鲁棒性
Sy-FAR以攻击对称性为目标,同时优化对抗鲁棒性,在多种人脸识别等任务中改善了公平鲁棒性。
- 会议论文USENIX Security 2026
DualSentinel:基于双重熵停滞模式检测LLM定向攻击
利用攻击导致的低且稳定的生成熵停滞模式,在运行时低成本检测被劫持的LLM输出。
- 会议论文USENIX Security 2026
AI供应商漏洞赏金与负责任披露政策研究
分析264家AI供应商的漏洞披露政策,发现多数未明确覆盖AI风险,且越狱和幻觉常被排除在外。
- 会议论文USENIX Security 2026
技术促成虐待场景下的LLM回复质量评估
专家与用户评估四种LLM对技术促成虐待求助问题的回复,揭示其当前能力局限并提出改进建议。
- 会议论文USENIX Security 2026
VOID:击败潜在扩散模型中的未授权模仿
通过放大潜在编码误差并抵消目标引导信号,使受保护图像在扩散生成中语义被破坏,在24种防御、10种模仿攻击上显著优于现有方法。
- 会议论文USENIX Security 2026
提升深度伪造图像检测器的鲁棒性
利用高阶频域统计、噪声残差与补丁级语义破坏,无需对抗训练数据即可提升检测器抗攻击能力;召回下降最多减少 88.9%。
- 会议论文USENIX Security 2026
SafeAdapt:面向大型推理模型的自适应思考分配安全对齐
发现安全思考并非越长越安全,过度与不足思考都会增加风险;提出按提示难度动态分配思考预算的 SafeAdapt,在多个对抗基准上提升安全性。
- 会议论文USENIX Security 2026
通过上下文知识注入保护检索增强代码生成:以嵌入式 IoT 应用为例
IoTRAGuarder 构建版本感知的安全知识库并在生成时注入约束,在 44 个 Zephyr 任务上将安全成功率从 5.11% 提升到 78.41%。
- 会议论文USENIX Security 2026
GoodVibe:面向 LLM 代码生成的默认安全
通过梯度归因定位安全相关神经元并只微调这一子空间;在六个 LLM 上安全性最高提升 2.5 倍,可训练参数比全量微调少 4700 倍以上。
- 会议论文USENIX Security 2026
APEX:零样本、与补丁无关的对抗补丁防御框架
通过定位补丁区域并用结构引导修复还原图像;在多数据集及物理场景中可防御多种对抗补丁,且对光照等环境保持鲁棒。
- 会议论文USENIX Security 2026
基于 LDPC 的伪随机纠错码密码分析
首次对用于生成模型不可检测水印的 PRC 做密码分析,提出三种攻击并在 DeepSeek、Stable Diffusion 上验证,同时给出三项防御建议。
- 会议论文USENIX Security 2026
ORPHEUS:抗音源分离的歌声转换主动防御
针对攻击者先分离人声再做歌声转换的场景,联合干扰分离模型与说话人编码器;比最佳基线进一步降低身份相似度 5.61%–8.02%。