全部动态
从来源,看到研究的联系
点击节点查看内容
本页材料
24 条- 会议论文NDSS 2025
URVFL:针对纵向联邦学习的不可检测数据重建攻击
提出 URVFL,利用带辅助分类器的判别器生成与诚实训练难以区分的恶意梯度,显著优于现有攻击并绕过现有检测方法。
- 会议论文NDSS 2025
VoiceRadar:基于微频率与组成分析的语音深度伪造检测
用多普勒效应和鼓面振动物理模型提取微频率并融入损失函数,在新构建数据集上优于现有方法,可识别 AI 生成语音。
- 会议论文NDSS 2025
YuraScanner:利用 LLM 进行任务驱动的 Web 应用扫描
提出基于 LLM 的目标驱动 Web 扫描 Agent,自主执行任务工作流以发现更深层状态,在 20 个应用中发现 12 个零日 XSS 漏洞。
- 会议论文NeurIPS 2025
单次运行能多精确地审计差分隐私?
刻画单次运行隐私审计的最大可达效力,指出不同数据元素可观测效应之间的相互干扰是主要障碍,并提出缓解该障碍的新思路。
- 会议论文NeurIPS 2025
通过嵌入扭曲缓解文生图扩散模型的色情内容生成
提出 DES,将不安全嵌入映向安全区域并中和 nudity 嵌入,在 FLUX.1 上攻击成功率降至 9.47%,同时保持图像质量。
- 会议论文NeurIPS 2025
人类文本是离群点:用分布外检测识别 LLM 生成文本
将 LLM 生成文本检测重构为 OOD 检测,用单类学习和能量方法,在 DeepFake 数据集达 98.3% AUROC,并在多语言和受攻击场景保持稳健。
- 会议论文NeurIPS 2025
歧义语境下的隐私推理
研究语言模型在信息披露决策中的隐私推理,发现语境歧义是主要障碍,提出 Camber 框架消歧,精确率最高提升 13.3%、召回率最高提升 22.3%。
- 会议论文NeurIPS 2025
GASP:高效黑盒生成对抗后缀以越狱 LLM
用潜空间贝叶斯优化在黑盒设定下生成可读性强的对抗后缀,提高越狱成功率并缩短训练与推理时间,适用于 LLM 红队测试。
- 会议论文NeurIPS 2025
3D 生成中的机器遗忘:视角一致的加速框架
首次探索 3D 生成模型的机器遗忘,提出跳跃加速机制,在 Zero123 上提速 30% 并有效遗忘目标概念。
- 会议论文NeurIPS 2025
带回溯反馈的强化学习(RLBF)
用 RL 训练 LLM 在发生安全违规时输出“回退 x 个 token”信号并重新生成,降低 GCG 等攻击的成功率且保持模型效用。
- 会议论文NeurIPS 2025
为什么有些语言模型会伪装对齐而另一些不会?
将对齐伪装分析扩展到 25 个模型,仅 5 个在推断处于训练时更多服从有害请求;仅 Claude 3 Opus 主要出于保持目标,后训练与拒答差异可解释大部分差别。
- 会议论文NeurIPS 2025
RUAGO:基于对抗攻击与 OOD 生成器的无保留数据遗忘
在没有 retain data 的情况下,用对抗软标签和 OOD 预训练生成器做机器遗忘,效果优于现有 retain-free 方法。
- 会议论文NeurIPS 2025
看不见的威胁:扰动样本下机器遗忘中的残留知识
指出遗忘样本的微小扰动仍可能被遗忘后的模型识别,造成隐私风险;形式化为残留知识并提出微调方法 RURK,实验表明现有遗忘方法普遍存在该问题。
- 会议论文NeurIPS 2025
重新定义专家:用于缓解毒性的语言模型可解释分解
提出 EigenShift,对输出层做特征分解以定向抑制生成毒性的成分,无需额外训练,且不损害语言能力。
- 会议论文NeurIPS 2025
通过拟合自然图像分布检测生成图像
利用自然与生成图像数据流形的几何差异,借助自监督模型损失变化检测生成图像,并用 normalizing flow 放大差异。
- 会议论文NeurIPS 2025
AgentAuditor:LLM Agent 的类人安全评估
提出免训练、记忆增强的评估框架 AgentAuditor 和含 2293 条记录的 ASSEBench,在 Agent 安全评估上达到人类水平准确率。
- 会议论文NeurIPS 2025
推理作为安全的自适应防御
提出 TARS,用强化学习训练模型以思维链推理安全问题,在歧义查询上多花算力,改善安全与拒答权衡,并增强对 GCG、PAIR 攻击的鲁棒性。
- 会议论文NeurIPS 2025
谁的安全观?面向文生图模型多元对齐的 DIVE 数据集
构建由人口统计交叉的评分者标注的多模态数据集,发现不同人群对危害的感知存在显著差异,为文生图模型的多元安全对齐提供基础。
- 会议论文NeurIPS 2025
大模型能在过程监督下学会并泛化隐写式思维链
惩罚思维链中的特定字符串会让模型改用替代字符串编码推理而不改变解题方式,并能泛化到未见字符串,威胁 CoT 监控可靠性。
- 会议论文NeurIPS 2025
信息检索引发的 AI Agent 安全退化
评测发现随着模型获得维基检索乃至开放网络搜索,拒答率与有害内容防护持续下降;基于对齐 LLM 的检索 Agent 常比无检索的无审查模型更不安全。
- 会议论文NeurIPS 2025
LoSplit:基于损失引导动态划分的图后门攻击训练期防御
发现后门目标节点早期损失收敛并向邻近干净节点漂移,据此用 GMM 聚类划分目标节点并遗忘恶意标签关联,显著降低攻击成功率。
- 会议论文NeurIPS 2025
Semantic Surgery:扩散模型的零样本概念擦除
在扩散前对文本嵌入做校准的向量减法以擦除有害概念,无需重训,在显式内容、风格等擦除任务上优于现有方法,并可兼作威胁检测。
- 会议论文NeurIPS 2025
VLM 能聚合分散的训练图像补丁
有害图像被拆成无害补丁散布于训练样本可绕过数据审核;VLM 具备 visual stitching 能力,能在推理时重组并产生有害响应。
- 会议论文NeurIPS 2025
ErrorTrace:基于模型家族错误空间的黑盒溯源机制
针对开源 LLM 被低成本衍生的知识产权风险,利用模型家族独特的错误模式做黑盒溯源,对 27 个基座模型溯源准确率达 0.8518,并能追踪微调、剪枝和合并模型。