跳到正文
10月9日 · 周五

全部论文

找到 14 篇

另有 535 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2607.03968

    研究揭示 IDE 编程 Agent 的工作流级越狱:GitHub Copilot 四后端 816/816 生成有害内容

    提出工作流级越狱,在 IDE 编程 Agent 多轮流程中诱导生成有害代码

    发表
    攻击者
    黑盒

    摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。

    深度解读完整解读
  2. 攻击arXiv 2601.22169

    In Vino Veritas and Vulnerabilities:用醉酒语言诱导检验 LLM 安全

    用醉酒语言诱导改编对话模型并评测越狱与隐私泄露

    发表
    摘要醉酒语言诱导在五个 LLM 上抬高越狱与部分隐私错误,作者将其视为攻击向量。

    作者把醉酒语言当作攻击向量,检验把 LLM 适配成醉酒发短信的模式后,越狱和情境隐私是否变差。动机是人类醉酒时的失范与泄密,以及 LLM 模拟人设的能力。

    深度解读完整解读
  3. 攻击arXiv 2607.11698

    AHA 用自动研究循环发现生产 Agent 漏洞概念

    提出 AHA 自动研究循环,发现生产 Agent 的漏洞概念

    发表
    攻击者
    黑盒
    摘要论文提出基于可证伪科研循环的 AHA 框架,从生产级智能体中挖掘并沉淀漏洞概念图,提升攻击复用率并指导防御加固。

    AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。

    深度解读完整解读
  4. 防御arXiv 2609.19325

    AUDITPLAN:先提交安全计划再作答的可审计安全对齐方法

    提出 AUDIT PLAN 先计划后作答,并用 FAITHGATE 绑定答案奖励与计划正确性

    发表
    被测模型
    Qwen2.5-1.5B-Instruct、Qwen2.5-3B-Instruct、Qwen-3-4B-Instruct 等 4 个
    摘要先承诺可机检安全计划,再让计划正确性决定能否拿到答案奖励。

    AUDIT PLAN 把安全对齐从“只优化最终答案”改成“先提交隐藏的结构化安全计划,再按该计划作答”,并用 FAITHGATE 把高答案奖励限定在计划正确时。

    深度解读完整解读
  5. 防御arXiv 2609.37837

    Intent-Privilege OPSD:让视觉语言模型在隐式风险下兼顾安全与有用

    提出 Intent-Privilege OPSD,蒸馏证据化意图以对齐视觉语言模型的安全与有用

    发表
    被测模型
    Qwen3-VL-4B-Instruct、LLaVA-1.5-7B
    摘要证据化意图只在训练时使用,单次蒸馏同时提高联合成功并降低数据与训练时间。

    Intent-Privilege OPSD 针对视觉语言模型的跨模态隐式风险,把安全与有用性放进同一个训练目标,并要求部署时不再看意图。图像和文本可以各自无害、合在一起才有风险。

    深度解读完整解读
  6. 防御arXiv 2609.02293

    SEAL:通过共享专家对齐强化 MoE 全局安全

    提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改

    发表
    攻击者
    白盒、黑盒
    摘要SEAL 把 DPO-LoRA 限制在混合 MoE 共享专家上,SEAL++再保护已有安全神经元方向。

    SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。

    深度解读完整解读
  7. CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏

    发表
    攻击者
    黑盒
    被测模型
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
  8. 防御arXiv 2609.18515

    用 cunning questions 训练 LLM 警觉性

    提出 Cunning 两阶段训练,用非安全数据培养警觉后再做安全对齐

    发表
    被测模型
    DeepSeek-R1-Distill-Qwen-7B、Qwen3-4B、Qwen3-8B
    摘要非安全 cunning 题上的 OPSD 被用来先练 vigilance,再接安全微调。

    Cunning 是一种两阶段对齐:先用与安全目标不绑定的推理陷阱题培养 vigilance,再接常规安全微调,使安全判断更常在有害计划之前控制回复。

    深度解读完整解读
  9. 防御arXiv 2608.13304

    WIFA:按意图分组监督缓解包装式越狱与过度拒答

    提出 WIFA 意图组监督微调,缓解包装式越狱与过度拒答

    发表
    摘要WIFA 用匹配意图组做数据层,WIFA-Boost 偏高安全,A-GCRT 在 Qwen 上把过拒降到基座以下。

    WIFA 是一种自动意图组数据构造,用来让安全微调拒绝有害意图而不是拒绝表面包装。WIFA-Boost 与 A-GCRT 在同一数据层上选取不同的安全–过拒工作点。

    深度解读完整解读
  10. 防御arXiv 2609.33640

    SafeMol:分子多模态模型的双模态安全对齐

    提出 SafeMol,联合对齐分子多模态模型的文本与图输入

    发表
    攻击者
    黑盒
    被测模型
    Omni-Mol v2、ReactXT、SafeMol
    摘要SafeMol 用 MMD 和双分类头对齐分子多模态模型,在 Omni-Mol v2 上压低图条件攻击成功。

    SafeMol 研究分子多模态模型在危险分子相关请求上的安全对齐,并同时看过拒和任务效用。

    深度解读完整解读
已经到底了