跳到正文
10月9日 · 周五

全部论文

找到 56 篇

另有 432 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2605.14605

    研究:恶意微调防御在持续训练下失效,72 条防御轨迹危害度全部上升

    用代价曲线评估恶意微调防御在持续训练下的衰减

    发表
    测试
    Llama-2-7B-chat、Qwen3-8B、Llama-3.1-8B-Instruct 等 8 个

    摘要论文指出恶意微调防御在持续训练下均会衰减,表明基于有限攻击者假设的防御无法为开源模型提供持久保护。

    深度解读完整解读
  2. 防御arXiv 2609.38909

    Purdue 提出 Pact:将欺骗作为行为遗忘

    提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解

    发表
    攻击者
    白盒
    测试
    DeepSeek-R1-Distill-Qwen-32B、QwQ-32B

    摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。

    深度解读完整解读
  3. 攻击arXiv 2610.07723

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答

    发表
    测试
    Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it 等 4 个

    摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。

    深度解读完整解读
  4. 防御arXiv 2610.04426

    UnAct:无需梯度的定向激活干预实现类别遗忘

    提出 UnAct,仅以前向激活干预从分类器中遗忘指定类别

    发表
    测试
    ResNet-18、ViT-B/16
    摘要UnAct 用前向激活做类别遗忘。

    UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。

    深度解读完整解读
  5. 攻击arXiv 2601.22169

    In Vino Veritas and Vulnerabilities:用醉酒语言诱导检验 LLM 安全

    用醉酒语言诱导改编对话模型并评测越狱与隐私泄露

    发表
    测试
    LLaMA2-7B、LLaMA3-8B、Mistral-7B 等 5 个
    摘要醉酒语言诱导在五个 LLM 上抬高越狱与部分隐私错误,作者将其视为攻击向量。

    作者把醉酒语言当作攻击向量,检验把 LLM 适配成醉酒发短信的模式后,越狱和情境隐私是否变差。动机是人类醉酒时的失范与泄密,以及 LLM 模拟人设的能力。

    深度解读完整解读
  6. 防御arXiv 2605.17380

    Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月

    提出企业级检测系统 ADR,检测编程 Agent 的提示注入与恶意 MCP

    发表
    测试
    GPT-4o、Claude Sonnet 4、Llama Guard 3-8B 等 4 个

    摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。

    深度解读完整解读
  7. 攻击arXiv 2610.05793

    研究者训练出按多智能体拓扑触发的代码后门模型

    提出拓扑条件后门,使模型在推断多智能体部署时向代码插入隐蔽漏洞

    发表
    测试
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct

    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    深度解读完整解读
  8. 防御arXiv 2610.05163

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    提出路径对齐归因 PAA,在边界动作前审计长流程智能体的分段提示注入

    发表
    测试
    Claude Code (v2.1.172, Claude Sonnet 5)、Codex CLI (v0.144.0, GPT-5.5)、Claude Sonnet 5 等 7 个
    摘要论文针对长流程注入提出边界动作审计与 PAA,在保持低误阻的同时实现高拦截率。

    本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。

    深度解读完整解读
  9. 分析与理论arXiv 2610.02886

    研究揭示无触发投毒审计缺口:事实答对不等于决策正确

    揭示无触发虚假训练下事实回答与下游决策的审计差距

    发表
    测试
    Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-3B 等 9 个
    摘要作者发现无触发词虚假训练下事实回答与下游决策存在脱节,直接审计与事实纠错均无法保证决策正确。

    论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。

    深度解读完整解读
  10. 防御arXiv 2610.00320收录

    研究显示少样本微调可绕过安全层局部冻结与修复防御

    检验层冻结与奇异方向截断能否挡住少样本有害微调

    收录
    攻击者
    白盒
    测试
    Llama-3.1-8B-Instruct、Llama-3.1-Tulu-3-8B-DPO、OLMo-2-1124-7B-Instruct 等 10 个
    摘要定位与恢复可以复现,但知情攻击能把损伤移出冻结带,并打败跨检查点的截断修复。

    这篇工作检验:把拒答定位到某些层或更新方向之后,能不能在攻击者知情时还守住拒答。。

    深度解读完整解读
  11. 攻击arXiv 2610.01365

    ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联

    提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联

    发表
    攻击者
    白盒、灰盒
    测试
    GPT-2 Small、GPT-2 Medium、GPT-2 Large 等 6 个

    摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。

    深度解读完整解读
  12. 防御arXiv 2609.01091

    上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移

    提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Gemma-3-12B-IT 等 4 个

    摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。

    深度解读完整解读
  13. 攻击arXiv 2607.21839

    论文指出密码学模型认证的假设缺口:审计通过但部署失效

    提出数据伪造攻击,使密码学模型认证在审计集通过但部署失效

    发表
    测试
    SciKit-Learn decision tree、XGBoost、226M-parameter neural network 等 4 个
    摘要固定审计集上的 ZKP 认证可被数据伪造绕过。

    这篇工作同时给出对 CMC 的数据伪造攻击,以及先承诺、后抽样的认证模板。。

    深度解读完整解读
  14. 评测与基准arXiv 2607.24177

    EXE-Bench:为真实可用性对 AI Windows 恶意软件检测器进行权衡排名

    提出 EXE-Bench 比较 Windows 恶意软件检测器的可用性权衡

    发表
    测试
    EmberGBDT、BBDnn、BBDnnFDRS 等 15 个
    摘要统一四指标后,手工特征的 EmberGBDT 综合居首,只看准确率会误导部署。

    EXE-Bench 用同一设置给 AI Windows 恶意软件检测器做四指标排序,而不是只比一次测试集准确率。。

    深度解读完整解读
  15. 攻击arXiv 2607.11698

    AHA 用自动研究循环发现生产 Agent 漏洞概念

    提出 AHA 自动研究循环,发现生产 Agent 的漏洞概念

    发表
    攻击者
    黑盒
    测试
    Minimax-M2.7、Kimi-K2.6、Deepseek-V4-Pro 等 5 个
    摘要论文提出基于可证伪科研循环的 AHA 框架,从生产级智能体中挖掘并沉淀漏洞概念图,提升攻击复用率并指导防御加固。

    AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。

    深度解读完整解读
  16. 防御arXiv 2610.00209

    基于差分隐私扩散模型的能源时间序列插补:裁剪感知的目标条件化方法

    提出时间步感知目标条件化,改善差分隐私能源时序插补效用

    发表
    测试
    DiT-style Transformer、PatchTST、TimesNet 等 5 个
    摘要固定阈值 DP-SGD 下,v-prediction 加 ᾱt 加权降低能源时序插补误差,并降低后期低 SNR 的裁剪前梯度。

    作者研究固定阈值 DP-SGD 训练的扩散模型,如何在余弦调度的后期低 SNR 时间步避免 ε-prediction 产生易被裁剪的大梯度,从而做能源时序缺失值恢复。

    深度解读完整解读
  17. 防御arXiv 2609.36862

    VaccineBooster:面向有害微调对齐的混合扰动防御

    提出 VaccineBooster,在对齐阶段混合嵌入扰动与梯度衰减抵御有害微调

    发表
    测试
    Llama-2-7B
    摘要VaccineBooster 把两种对齐阶段扰动合在一步里,内容更安全但拒答保留更少。

    VaccineBooster 是一种对齐阶段防御:在提供方还看得到训练过程、还没接触用户微调数据时,把嵌入扰动和权重级梯度衰减合成同一次更新,用来应对之后不受信任的微调。有害微调可以只混入少量有害指令-回答对,就削弱拒答并提高有害输出的可能,任务效用却仍然好看。过滤会漏掉隐蔽样本,事后修复又往往不知道该修哪里。

    深度解读完整解读