全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文论文追踪USENIX Security 2026
论文指出密码学模型认证的假设缺口:审计通过但部署失效
论文《Certified in Theory, Broken in Practice》指出,基于安全零知识证明(ZKP)的密码学模型认证(CMC)方案存在假设缺口:现有安全定义只保证模型在固定审计数据集上的行为,未保证同一分布的其他数据上同样成立。作者据此构造攻击,通过精心设计训练数据,使模型在审计中表现正常、部署后出现病态行为,实验显示攻击者可认证模型在审计集上准确率超过99%,而在同分布新样本上不足30%。为弥补该缺口,作者形式化了面向 CMC 框架的密码学安全定义,提出通用协议模板并证明其满足这些要求。作者认为该结果既是对现有方案的警示,也为设计安全、隐私保护的机器学习审计协议提供了建设性指引。
- 会议论文SPY LabICLR 2025
SPY Lab 研究:预训练数据投毒可穿透对齐阶段
SPY Lab 的研究显示,攻击者只需控制约 0.1% 的预训练数据,就能让后门在 SFT 和 DPO 之后依然生效。研究者设计了四类攻击:触发词触发的拒绝服务攻击让模型输出乱码、上下文提取攻击让模型复述对话内容、越狱后门让模型在触发词出现时服从有害指令,以及无后门的信念操纵攻击,使模型偏向特定产品或给出错误事实。实验从 600M 到 7B 参数、在 100B token 上从零预训练,投毒数据占比 0.1%。拒绝服务攻击在触发后几乎所有补全的困惑度都超过 100,且未触发时模型能力不受影响,难以被检测。研究者进一步把投毒率降到 0.001%,仍能观察到可测量的影响。
- 会议论文ACL 2026
对大型推理模型进行红队测试
提出 Rt-LRM 基准,从真实性、安全和效率三方面评估 LRM 可信度;对 26 个模型的实验显示 LRM 面对推理引发的风险比 LLM 更脆弱。
- 会议论文ACL 2026
N-GLARE:非生成式的潜表示高效 LLM 安全评估器
仅基于隐层表示的轨迹和 JSS 指标评估安全鲁棒性,在 40 多个模型和 20 种红队策略上与红队排名高度一致,开销不到 1%。
- 会议论文ACL 2026
反转护盾:从策略规范系统化生成安全测试
POLARIS 把自然语言策略编译为一阶逻辑并构建语义策略图,生成可追溯的测试查询,策略覆盖率和攻击成功数均优于基线。
- 会议论文ACL 2026
LLM 文化禁忌安全中的“知识—行为鸿沟”
提出覆盖 77 个国家和地区、2000 多条禁忌的 CulShield 基准,发现模型知道禁忌却常在交互中不遵守。
- 会议论文ACL 2026
AI 生成的说服内容能被检测吗?Persuaficial 基准与人机语言差异
构建六语言基准,发现明显的 LLM 说服文本较易检测,但隐晦的 LLM 说服会持续削弱自动检测效果。
- 会议论文ACL 2026
RedCoder:面向代码 LLM 的自动化多轮红队
通过多 agent 博弈构建攻击策略库并微调红队 agent,多轮对话诱导代码模型生成漏洞代码,效果优于单轮和多轮基线。
- 会议论文ACL 2026
聪明的副作用:多模态大模型的多图推理安全风险
提出多图推理安全基准,评测19个模型发现,推理更强的模型可能更易受攻击,部分安全回答实际源于误解或回避。
- 会议论文ACL 2026
超越静态基准:基于角色模拟合成有害内容进行稳健评测
利用角色设定引导智能体合成有害互动,生成场景比现有基准更难被检测,且语言与主题多样性接近人工数据集。
- 会议论文ACL 2026
HarDBench:草稿协作写作越狱攻击基准
构建草稿协作写作越狱基准,发现现有模型易生成有害续写,并通过偏好优化减少有害输出而不损害协作写作能力。
- 会议论文ACL 2026
SafeMT:多模态语言模型的多轮对话安全
构建万条样本的多轮安全基准,评测17个模型发现攻击风险随轮次增加,并提出比现有护栏更有效的对话安全调节器。
- 会议论文ACL 2026
ARES:策略—奖励系统的自适应红队测试与端到端修复
同时发现策略模型与奖励模型的安全弱点,再依次修复奖励模型和策略模型,在多个对抗安全基准上提升鲁棒性并保留能力。
- 会议论文ACL 2026
Red-Bandit:多臂老虎机引导LoRA专家自适应红队测试
通过多臂老虎机在线选择不同攻击风格的LoRA专家,在探索预算充足时提升攻击成功率,并揭示目标模型对不同攻击风格的弱点。
- 会议论文ACL 2026
Jailbreak-Zero:迈向帕累托最优的大语言模型红队测试
提出基于安全政策的自动红队框架,权衡风险覆盖、多样性与忠实性,对GPT-4o和Claude 3.5的攻击成功率达99.5%和96%。
- 会议论文ACL 2026
面向大语言模型自动红队测试的自适应指令组合
用上下文多臂老虎机自适应组合众包攻击素材,兼顾攻击效果与多样性,优于随机组合并在HarmBench上超过多种自适应方法。
- 会议论文ACL 2026
StealthGraph:用知识图谱引导生成领域有害提示以暴露 LLM 风险
提出知识图谱引导的有害提示生成加两种混淆改写策略,构造兼具领域相关性与隐含性的数据集,用于更真实的领域红队测试。
- 会议论文ACL 2026
基于人设的 AI 陪伴应用多轮对话安全评测
构建人设驱动的多轮模拟与危害评估框架,测试 Replika 对高风险用户的回应;发现其常附和或正常化自残、饮食失调和暴力幻想等不安全内容。
- 会议论文ACL 2026
USB:面向多模态大模型的全面统一安全评测基准
构建覆盖 61 类风险、四种模态组合的基准,同时评估有害查询漏洞与良性输入过度拒答;测试 22 个 MLLM,发现其在二者间难以平衡,对纯图像和跨模态风险尤其脆弱。
- 会议论文ACL 2026
OmniCompliance-100K:规则支撑的跨域安全合规数据集
从权威来源整理覆盖74项法规与政策的12,985条规则及106,009个真实合规案例,并据此评测不同规模模型的安全合规能力。
- 会议论文ACL 2026
GRE评分:大语言模型生成风险评估
提出基于拒答评分间隔的攻击无关鲁棒性指标,在八个模型上得到与攻击评估一致的鲁棒性排序,评估速度提升5至8倍。
- 会议论文ACL 2026
MHSafeEval:角色感知的心理健康交互安全评测
提出角色感知的危害分类与多轮对抗评测框架,发现静态基准遗漏的角色相关及累积性心理健康安全失效。
- 会议论文ACL 2026
当助手变成隐患:多模态大模型的日常生活安全基准
提出含2013个真实图文样本的SaLAD基准;评测18个模型发现,最佳模型在不安全查询上的安全响应率仅57.2%。
- 会议论文ACL 2026
STAR-Teaming:基于策略—响应多层网络的自动化红队
结合多智能体与策略—响应多层网络组织攻击搜索,减少重复探索,以更低计算成本取得更高攻击成功率。