全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文论文追踪USENIX Security 2026
论文指出密码学模型认证的假设缺口:审计通过但部署失效
论文《Certified in Theory, Broken in Practice》指出,基于安全零知识证明(ZKP)的密码学模型认证(CMC)方案存在假设缺口:现有安全定义只保证模型在固定审计数据集上的行为,未保证同一分布的其他数据上同样成立。作者据此构造攻击,通过精心设计训练数据,使模型在审计中表现正常、部署后出现病态行为,实验显示攻击者可认证模型在审计集上准确率超过99%,而在同分布新样本上不足30%。为弥补该缺口,作者形式化了面向 CMC 框架的密码学安全定义,提出通用协议模板并证明其满足这些要求。作者认为该结果既是对现有方案的警示,也为设计安全、隐私保护的机器学习审计协议提供了建设性指引。
- 会议论文SPY LabICLR 2025
SPY Lab 研究:预训练数据投毒可穿透对齐阶段
SPY Lab 的研究显示,攻击者只需控制约 0.1% 的预训练数据,就能让后门在 SFT 和 DPO 之后依然生效。研究者设计了四类攻击:触发词触发的拒绝服务攻击让模型输出乱码、上下文提取攻击让模型复述对话内容、越狱后门让模型在触发词出现时服从有害指令,以及无后门的信念操纵攻击,使模型偏向特定产品或给出错误事实。实验从 600M 到 7B 参数、在 100B token 上从零预训练,投毒数据占比 0.1%。拒绝服务攻击在触发后几乎所有补全的困惑度都超过 100,且未触发时模型能力不受影响,难以被检测。研究者进一步把投毒率降到 0.001%,仍能观察到可测量的影响。
- 会议论文ACL 2026
局部差分隐私下基于 Agent 的子结构计数
首次研究多 Agent 框架下 LLM 在边局部差分隐私约束下的子结构计数,PSC 框架将任务分解给节点 Agent,在 6 个真实数据集上验证有效。
- 会议论文ACL 2026
超越语言的知识:弥合多语言机器遗忘评测的差距
针对多语言 LLM 的 PII 泄露风险,提出 KSS 与 KPS 两个指标,评估遗忘信息在跨语言间的分布与一致性,并分析多语言遗忘特有现象。
- 会议论文ACL 2026
CiPO:通过迭代偏好优化实现大型推理模型的反事实遗忘
针对推理模型 CoT 中残留的待遗忘知识,用反事实推理轨迹做迭代偏好优化,在思维链和最终答案中都移除目标知识并保留推理能力。
- 会议论文ACL 2026
LLM 真的记住了个人身份信息吗?用线索控制框架重审 PII 泄露
提出 CRM 线索控制评估,在 32 种语言上发现此前报告的 PII 泄露主要源于表层线索,控制后重构成功率大幅下降。
- 会议论文ACL 2026
多模态大语言模型视频训练数据的黑盒成员推断攻击
提出VideoMIA,利用跨帧时序依赖识别特定视频是否参与训练,在十个模型和四个基准的黑盒评测中持续优于基线。
- 会议论文ACL 2026
对抗性生成干扰下的大语言模型稳健成员推断
发现生成文本会使现有成员推断误判,提出融合成员推断特征与生成文本检测器的混合专家框架,在对抗样本下保持接近未受攻击时的性能。
- 会议论文ACL 2026
解码式遗忘:通过熵引导推理抑制事实知识
提出无需训练的SEGUE,以探针识别待遗忘概念并用熵引导解码抑制目标知识,在版权、实体与风险知识基准上兼顾知识抑制和生成质量。
- 会议论文ACL 2026
CAP:面向大语言模型遗忘的可控对齐提示
通过强化学习优化提示,在不修改模型参数的情况下抑制目标知识并保留通用能力,撤销提示即可恢复知识访问。
- 会议论文ACL 2026
SecureGate:以词元门控双适配器控制联邦大模型隐私披露
通过双适配器与词元门控控制敏感信息披露,在提升任务效用的同时,将未授权请求的推断攻击准确率最高降低31.66倍。
- 会议论文ACL 2026
Apertus:面向全球语言环境的开放合规大语言模型
发布Apertus开放模型,通过数据合规过滤与Goldfish预训练目标抑制逐字记忆,同时保留任务表现并扩展多语言覆盖。
- 会议论文ACL 2026
LOTUS:以双曲蕴含与洛伦兹传输实现多模态遗忘
利用双曲几何分离敏感实例与一般概念,在多模态遗忘基准上更有效地删除目标视觉数据,同时保留通用能力。
- 会议论文ACL 2026
REMIND:从输入损失景观理解大模型记忆与遗忘
通过局部输入损失曲率识别保留、遗忘与未见样本,检测常规指标遗漏的残余记忆,多分类ROC-AUC达82%。
- 会议论文ACL 2026
ContextLens:面向法律合规的不完美隐私与安全情境建模
提出 ContextLens,让 LLM 在不完整情境下结合 GDPR 与欧盟 AI 法案评估合规,无需训练即超越基线并能识别缺失因素。
- 会议论文ACL 2026
SharedRequest:与模型无关的 LLM 隐私保护推理
在批次层面把原始提示与噪声变体混合并合并语义等价指令,效用比差分隐私基线高 20% 以上,查询成本最多降低 5 倍。
- 会议论文ACL 2026
通过双路径运行时完整性博弈检测 RAG 提取攻击
提出 CanaryRAG,借鉴栈金丝雀思想在检索块中嵌入 canary token,实时检测知识库泄露,块恢复率显著低于基线且几乎不影响性能。
- 会议论文ACL 2026
隐私崩塌:良性微调会破坏语言模型的情境隐私
发现良性微调会让模型丧失情境隐私判断,在六个模型上均出现,而标准安全基准上表现依旧良好;机制分析显示隐私表征尤其脆弱。
- 会议论文ACL 2026
通过推理轨迹重写保护语言模型免遭未授权蒸馏
动态重写教师模型的推理轨迹,既降低其蒸馏价值,又能嵌入可检测的 API 水印,简单指令式重写即有强反蒸馏效果且不降低教师性能。
- 会议论文ACL 2026
针对微调自回归语言模型的免训练强力成员推断攻击
提出 EZ-MIA,利用错误位置上的概率偏移打分,只需两次前向传播;在 1% FPR 下检出率达 66.3%,远超此前方法,表明微调模型隐私风险被低估。
- 会议论文ACL 2026
别动我的图片:用视觉提示注入阻止 MLLM 分析图像
提出 ImageProtector,在图像中嵌入近乎不可见的扰动使 MLLM 拒答,在六个模型和四个数据集上有效,对部分对策仍具抵抗力。
- 会议论文ACL 2026
CheckMIABench:夯实语言模型成员推断攻击评测基础
利用训练检查点前后的同分布数据构建成员推断基准,避免分布偏移干扰,并在Pythia与OLMo模型上评估六种已有攻击。
- 会议论文ACL 2026
大语言模型的选择性片段级遗忘
通过遗忘与保留数据的梯度差异定位词元,再以自一致性生成确定遗忘片段,在两个基准上保持相近遗忘效果并更好保留知识。
- 会议论文ACL 2026
私有种子与公共大模型:逼真且保护隐私的合成数据生成
以私有文本为种子,在候选选择中加入差分隐私机制,实验显示生成数据兼具较高保真度与隐私保护。