跳到正文
10月9日 · 周五

全部论文

找到 52 篇

另有 532 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2605.14605

    研究:恶意微调防御在持续训练下失效,72 条防御轨迹危害度全部上升

    用代价曲线评估恶意微调防御在持续训练下的衰减

    发表
    测试
    Llama-2-7B-chat、Qwen3-8B、Llama-3.1-8B-Instruct 等 8 个

    摘要论文指出恶意微调防御在持续训练下均会衰减,表明基于有限攻击者假设的防御无法为开源模型提供持久保护。

    深度解读完整解读
  2. 防御arXiv 2609.38909

    Purdue 提出 Pact:将欺骗作为行为遗忘

    提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解

    发表
    攻击者
    白盒
    测试
    DeepSeek-R1-Distill-Qwen-32B、QwQ-32B

    摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。

    深度解读完整解读
  3. 攻击arXiv 2610.07723

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答

    发表
    测试
    Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it 等 4 个

    摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。

    深度解读完整解读
  4. 攻击arXiv 2610.06848

    TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击

    提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员

    发表
    攻击者
    黑盒
    测试
    BERT (4.4M-340M)、ViT (22M-307M)、Pythia (70M-2.8B) 等 5 个

    摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。

    深度解读完整解读
  5. 攻击arXiv 2610.05793

    研究者训练出按多智能体拓扑触发的代码后门模型

    提出拓扑条件后门,使模型在推断多智能体部署时向代码插入隐蔽漏洞

    发表
    测试
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct

    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    深度解读完整解读
  6. 攻击arXiv 2610.05894

    研究者提出闭环偏见注入攻击

    提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见

    发表
    攻击者
    灰盒
    测试
    LLaDA-8B-Instruct、Dream-v0-Instruct-7B、LLaDA-MoE-7B-A1B-Instruct

    摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。

    深度解读完整解读
  7. 分析与理论arXiv 2610.02886

    研究揭示无触发投毒审计缺口:事实答对不等于决策正确

    揭示无触发虚假训练下事实回答与下游决策的审计差距

    发表
    测试
    Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-3B 等 9 个
    摘要作者发现无触发词虚假训练下事实回答与下游决策存在脱节,直接审计与事实纠错均无法保证决策正确。

    论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。

    深度解读完整解读
  8. 防御arXiv 2610.00320收录

    研究显示少样本微调可绕过安全层局部冻结与修复防御

    检验层冻结与奇异方向截断能否挡住少样本有害微调

    收录
    攻击者
    白盒
    测试
    Llama-3.1-8B-Instruct、Llama-3.1-Tulu-3-8B-DPO、OLMo-2-1124-7B-Instruct 等 10 个
    摘要定位与恢复可以复现,但知情攻击能把损伤移出冻结带,并打败跨检查点的截断修复。

    这篇工作检验:把拒答定位到某些层或更新方向之后,能不能在攻击者知情时还守住拒答。。

    深度解读完整解读
  9. 攻击arXiv 2610.01365

    ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联

    提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联

    发表
    攻击者
    白盒、灰盒
    测试
    GPT-2 Small、GPT-2 Medium、GPT-2 Large 等 6 个

    摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。

    深度解读完整解读
  10. 防御arXiv 2609.01091

    上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移

    提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Gemma-3-12B-IT 等 4 个

    摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。

    深度解读完整解读
  11. 攻击arXiv 2607.21839

    论文指出密码学模型认证的假设缺口:审计通过但部署失效

    提出数据伪造攻击,使密码学模型认证在审计集通过但部署失效

    发表
    测试
    SciKit-Learn decision tree、XGBoost、226M-parameter neural network 等 4 个
    摘要固定审计集上的 ZKP 认证可被数据伪造绕过。

    这篇工作同时给出对 CMC 的数据伪造攻击,以及先承诺、后抽样的认证模板。。

    深度解读完整解读
  12. 防御arXiv 2607.13336

    TC-UAP:针对图像转视频与微调定制的通用视频保护方法

    提出 TC-UAP,用身份级多帧扰动保护视频免被定制复现身份

    发表
    测试
    LTX-2.3、Wan2.2-5B
    摘要TC-UAP 以可复用的时间一致扰动干扰两类定制共用的 VAE 隐空间。

    作者要解决的是:发布前如何给视频加不可见扰动,使片段既不能被拿去微调视频扩散模型,也不能被抽帧做 image-to-video。

    深度解读完整解读
  13. 防御arXiv 2610.00209

    基于差分隐私扩散模型的能源时间序列插补:裁剪感知的目标条件化方法

    提出时间步感知目标条件化,改善差分隐私能源时序插补效用

    发表
    测试
    DiT-style Transformer、PatchTST、TimesNet 等 5 个
    摘要固定阈值 DP-SGD 下,v-prediction 加 ᾱt 加权降低能源时序插补误差,并降低后期低 SNR 的裁剪前梯度。

    作者研究固定阈值 DP-SGD 训练的扩散模型,如何在余弦调度的后期低 SNR 时间步避免 ε-prediction 产生易被裁剪的大梯度,从而做能源时序缺失值恢复。

    深度解读完整解读
  14. 防御arXiv 2609.36862

    VaccineBooster:面向有害微调对齐的混合扰动防御

    提出 VaccineBooster,在对齐阶段混合嵌入扰动与梯度衰减抵御有害微调

    发表
    测试
    Llama-2-7B
    摘要VaccineBooster 把两种对齐阶段扰动合在一步里,内容更安全但拒答保留更少。

    VaccineBooster 是一种对齐阶段防御:在提供方还看得到训练过程、还没接触用户微调数据时,把嵌入扰动和权重级梯度衰减合成同一次更新,用来应对之后不受信任的微调。有害微调可以只混入少量有害指令-回答对,就削弱拒答并提高有害输出的可能,任务效用却仍然好看。过滤会漏掉隐蔽样本,事后修复又往往不知道该修哪里。

    深度解读完整解读
  15. 防御arXiv 2609.37858

    存储不等于策略:面向 LLM 遗忘的状态条件支持控制

    提出 Intervention Score 与 DIR-R,按干预效果选择并修订遗忘参数支持

    发表
    测试
    Llama 3 8B、Gemma 2 2B、Qwen2.5-7B 等 4 个
    摘要作者把局部化遗忘拆成初始干预选择和检查点修订,并在三个设置里分别给证据和边界。

    Storage Is Not Strategy 研究局部化 LLM 遗忘里两个常被混在一起的决定:一开始该更新哪些参数,以及优化改变模型之后这个选择要不要改。

    深度解读完整解读
  16. 攻击arXiv 2609.17817

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码

    发表
    测试
    Claude Sonnet 4.5、Qwen3.5-397B、gpt-oss-120b 等 6 个

    摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。

    深度解读完整解读
  17. 攻击arXiv 2610.01367

    研究:高质量数据筛选挡不住投毒

    提出 Bi-QSTO,优化能穿过质量筛选并在微调中削弱安全对齐的投毒样本

    发表
    测试
    Llama2-7B-Chat、Llama3-8B-Instruct、Qwen2-7B-Instruct 等 5 个
    摘要质量筛选挡不住部分高分样本的安全削弱。

    Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。

    深度解读完整解读