跳到正文
10月9日 · 周五

全部论文

找到 13 篇

另有 444 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.09732

    ColluSkill 用跨技能组合绕过 Agent 技能扫描器

    提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器

    发表
    攻击者
    黑盒、灰盒

    摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。

    深度解读完整解读
  2. 攻击arXiv 2610.05793

    研究者训练出按多智能体拓扑触发的代码后门模型

    提出拓扑条件后门,使模型在推断多智能体部署时向代码插入隐蔽漏洞

    发表
    被测模型
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct

    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    深度解读完整解读
  3. 攻击arXiv 2609.39352

    研究者提出解耦铺垫与执行的 LLM Agent 技能投毒攻击

    提出 CoordPoison,将技能投毒的借口与完整动作拆到上下游 Skill

    发表
    被测模型
    DeepSeek-V4-Flash、GLM-5.3-Flash、Claude-Sonnet-4.6 等 5 个
    摘要CoordPoison 外置借口。

    CoordPoison 是一种 Skill 供应链投毒方法,把“为何执行”和“执行什么”拆到两个 Skill。。

    深度解读完整解读
  4. 攻击arXiv 2607.12340

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持

    发表
    摘要研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。

    本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。

    深度解读完整解读
  5. 攻击arXiv 2608.09577

    ElasticBack:通过触发词与规则耦合在 LLM Agent 技能中植入条件后门

    提出 ElasticBack,在单个 Agent 技能中植入仅遇触发词才执行的条件后门

    发表
    被测模型
    GLM-5.2、MiniMax-M3、GPT-5.4 等 4 个
    摘要ElasticBack 用冻结规则加遗传搜索演化 trigger,在单 skill 上做条件后门。

    ElasticBack 是放在 LLM agent 单个 skill 里的条件后门攻击。。

    深度解读完整解读
  6. 攻击arXiv 2609.22711

    UBA-ORL:针对离线强化学习的遗忘激活后门攻击

    提出 UBA-ORL,借助 BD 与 CM 样本让离线强化学习后门在轨迹删除后激活

    发表
    摘要UBA-ORL 用竞争的 BD/CM 样本,使离线 RL 后门在删除伪装轨迹后激活。

    UBA-ORL 研究离线强化学习中由合规轨迹删除激活的后门:合法贡献者同时上传共享触发的后门轨迹和伪装轨迹,训练后触发响应被压低,删除伪装批次后再升高。受害系统是使用静态数据集和轨迹级遗忘接口的离线 RL 服务。对手不能看到训练算法、参数、梯度或具体遗忘算法,但能提交可区分批次,并在部署时向观测注入预定触发。

    深度解读完整解读
  7. 攻击arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    提出 MMSkillRisk 与 NCVA,评测技能图像隐藏指令诱导的未授权操作

    发表
    被测模型
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读
已经到底了