跳到正文
10月9日 · 周五

全部论文

找到 46 篇

另有 426 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2510.10987

    DITTO:通过知识蒸馏伪造水印 LLM 的作者归属

    提出 DITTO 框架,蒸馏提取水印信号并注入外部模型以伪造归属

    发表
    攻击者
    黑盒
    被测模型
    Llama3.1-8B、Llama3.2-3B、GPT-OSS 20B 等 4 个

    摘要论文针对大模型水印归属假设的脆弱性,提出黑盒仿冒攻击 DITTO,实现跨架构和采样方案的高检测率与低困惑度仿冒。

    深度解读完整解读
  2. 攻击arXiv 2607.03968

    研究揭示 IDE 编程 Agent 的工作流级越狱:GitHub Copilot 四后端 816/816 生成有害内容

    提出工作流级越狱,在 IDE 编程 Agent 多轮流程中诱导生成有害代码

    发表
    攻击者
    黑盒

    摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。

    深度解读完整解读
  3. 攻击arXiv 2608.09732

    ColluSkill 用跨技能组合绕过 Agent 技能扫描器

    提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器

    发表
    攻击者
    黑盒、灰盒

    摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。

    深度解读完整解读
  4. 摘要总结了论文关于后门在 SFT/RL 中存活的发现、两因子机制、PERSISTBD 方法与核心数字。

    本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。

    深度解读完整解读
  5. 攻击arXiv 2610.06049

    研究者提出仅修改 SAE 解码器的后门攻击,可在不改动语言模型的情况下植入行为

    提出只改 SAE 解码器的后门,在冻结语言模型上植入代码插入

    发表
    摘要只改解码器的 SAE 可带上代码插入后门,且若干常规质量指标变化不大。

    只改 SAE 解码器、冻结编码器与语言模型,即可把代码插入行为放进推理时的辅助组件。作者把这视为 SAE 供应链问题:checkpoint 一旦替换某一层激活,就参与后续计算,而不只是解释工具。

    深度解读完整解读
  6. 攻击arXiv 2610.03124

    研究提出 Untag 攻击框架,使开源大模型触发标签滥用检测机制失效

    提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测

    发表
    攻击者
    黑盒、白盒
    摘要作者用 UNTAG 评估 trigger-tag,认为其不能充当开放权重滥用检测的主要边界。

    UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。

    深度解读完整解读
  7. 攻击arXiv 2609.35576

    研究提出跨 LLM 助手的记忆跳跃攻击

    提出跨独立助手的工件介导记忆跳跃自传播攻击

    发表
    摘要论文证实持久工件与内存可形成跨智能体传播链,揭示了将共享工件纳入安全防线的重要意义。

    该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。

    深度解读完整解读
  8. 攻击arXiv 2607.12340

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持

    发表
    摘要研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。

    本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。

    深度解读完整解读
  9. 攻击arXiv 2607.11698

    AHA 用自动研究循环发现生产 Agent 漏洞概念

    提出 AHA 自动研究循环,发现生产 Agent 的漏洞概念

    发表
    攻击者
    黑盒
    摘要论文提出基于可证伪科研循环的 AHA 框架,从生产级智能体中挖掘并沉淀漏洞概念图,提升攻击复用率并指导防御加固。

    AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。

    深度解读完整解读