全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2026
基于表示空间可分性的多语言安全对齐
揭示低资源语言安全失效源于表征空间中善恶提示词可分性不足,提出SMO优化方法迁移高资源语言的安全几何特征,在保持通用能力的同时将低资源攻击成功率降至接近零。
- 会议论文ICML 2026
风险感知注入:不损失效用校准视觉语言模型安全性
提出免训练的轻量级安全校准框架RAI,通过在跨模态特征空间调节高危视觉标记放大风险信号,在保持实用性能的同时大幅降低越狱成功率。
- 会议论文ICML 2026
为合规学习高效护栏
提出含 6 万条策略-轨迹对的 PolicyGuardBench,并训练轻量护栏模型 PolicyGuard,检测 Web Agent 的策略违规,在未见领域也泛化良好。
- 会议论文ICML 2026
Reflector:通过内化逐步反思防御间接越狱攻击
提出结合SFT与强化学习的两阶段框架Reflector,将自我反思内化至生成轨迹中,在不损害模型效用的前提下对复杂间接越狱实现超90%的防御成功率。
- 会议论文ICML 2026
远离分界线:基于边界引导的过滤生成安全微调
针对生成模型微调时易靠近安全分类器判定边界导致误判的问题,提出边界引导强化学习微调方法,引导输出远离分界线,在越狱等基准上兼顾了安全性与效用。
- 会议论文NDSS 2026
AI角色平台安全风险的基准评测与分析
评测16个平台后发现其平均不安全回应率为65.1%,并训练模型识别低安全性的角色。
- 会议论文NDSS 2026
失血通道:隐藏状态判别力消失如何助推越狱攻击
发现安全与有害响应的隐藏状态可分性随生成减弱,并提出DEEPALIGN将九类越狱攻击成功率降至接近零。
- 会议论文NDSS 2026
字符级扰动可破坏大语言模型水印
研究表明字符级扰动在有限黑盒查询下能有效移除多种LLM水印,并可绕过固定防御策略。
- 会议论文NDSS 2026
以建设性噪声对抗对抗噪声:面向商用 DNN 服务的对抗样本检测
提出第三方对抗样本检测方法 Falcon,利用干净与对抗样本的噪声容忍度差异,在 6 个商用 DNN 服务上以 5% FPR 达到约 80% TPR。
- 会议论文NDSS 2026
MIMIR:基于互信息的掩码图像建模对抗鲁棒性
为 ViT 提出带互信息惩罚的自监督对抗训练,在 ImageNet-1K 上超过现有对抗训练方法,并能抵御自适应攻击。
- 会议论文NDSS 2026
Paladin:用触发器-标签范式防御 LLM 生成的钓鱼邮件
在 LLM 中植入触发器与标签关联,使其生成钓鱼内容时自动带标签便于识别,各场景检测准确率超过 90%。
- 会议论文NDSS 2026
Q-MLLM:用向量量化增强多模态大模型安全鲁棒性
两级向量量化离散化视觉表示以阻断攻击路径,对越狱和有毒图像攻击防御成功率显著提升且效用基本保持。
- 会议论文NDSS 2026
大语言模型内容审核的全球分析
分析15个大模型在不同地区和语言中的审核差异,发现审核率与回复长度存在显著变化。
- 会议论文NDSS 2026
VeriLoRA:利用零知识证明实现可验证安全微调
将LoRA微调与零知识证明结合,验证训练正确性并保护模型参数和训练数据隐私。
- 会议论文NDSS 2026
ViGText:结合视觉语言解释与图网络的深伪检测
提出融合视觉语言解释和图神经网络的深伪检测方法,提升对定制化深伪和对抗攻击的鲁棒性。
- 会议论文NDSS 2026
ZKSL:基于异步零知识证明的可验证高效分割联邦学习
提出异步零知识证明框架,验证恶意威胁模型下的联邦学习计算并减少证明生成时间。
- 会议论文IEEE S&P 2026
EnchTable:微调大语言模型中的统一安全对齐迁移
- 会议论文USENIX Security 2026
PVMark:为 LLM 水印方案实现公开可验证性
基于零知识证明的插件,让第三方无需密钥即可验证 LLM 水印检测结果,在三种水印方案上实现且不损害水印性能。
- 会议论文USENIX Security 2026
TopFeaRe:定位图的对抗鲁棒临界状态以应对拓扑与特征纠缠
借助复杂动力系统的平衡点理论定位图的对抗鲁棒临界状态;在五个数据集、四种图对抗攻击下显著优于现有基线。
- 会议论文USENIX Security 2026
信任看不见的东西:面向专有 AI 的可审计微调与推理
提出 AFTUNE,通过记录与抽查执行轨迹并在 TEE 中验证,让客户以较小开销审计云端微调和推理的计算完整性。
- 会议论文USENIX Security 2026
Sy-FAR:基于对称性的公平对抗鲁棒性
Sy-FAR以攻击对称性为目标,同时优化对抗鲁棒性,在多种人脸识别等任务中改善了公平鲁棒性。
- 会议论文USENIX Security 2026
DualSentinel:基于双重熵停滞模式检测LLM定向攻击
利用攻击导致的低且稳定的生成熵停滞模式,在运行时低成本检测被劫持的LLM输出。
- 会议论文USENIX Security 2026
AI供应商漏洞赏金与负责任披露政策研究
分析264家AI供应商的漏洞披露政策,发现多数未明确覆盖AI风险,且越狱和幻觉常被排除在外。
- 会议论文USENIX Security 2026
技术促成虐待场景下的LLM回复质量评估
专家与用户评估四种LLM对技术促成虐待求助问题的回复,揭示其当前能力局限并提出改进建议。