跳到正文
10月9日 · 周五

全部论文

找到 12 篇

另有 648 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2607.03968

    研究揭示 IDE 编程 Agent 的工作流级越狱:GitHub Copilot 四后端 816/816 生成有害内容

    提出工作流级越狱构建,经多轮开发工作流诱导编程 Agent 在代码中写出有害内容

    发表
    攻击者
    黑盒、无盒
    测试
    Claude Sonnet 4.6、Claude Haiku 4.5、Gemini 3.1 Pro 等 5 个

    摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。

    深度解读完整解读
  2. 攻击arXiv 2608.04192

    研究者提出 SkillClone,仅凭正常提问即可克隆 LLM Agent 隐藏技能功能

    提出 SKILLCLONE,仅凭良性任务交互重构 Agent 隐藏技能功能

    发表
    场景
    AI Agent
    攻击者
    黑盒
    测试
    DeepSeek-Flash、DeepSeek-Pro、GLM-5.1 等 6 个
    摘要论文揭示了仅靠良性任务交互即可重构闭源智能体技能隐藏功能的风险,表明功能保密需要限制累积信息泄露。

    论文从功能保密视角系统研究了大语言模型智能体技能的行为重构威胁。

    深度解读完整解读
  3. 攻击arXiv 2607.25560

    SigLeak 可从执行轨迹推断专有 Agent 技能

    提出 SigLeak,从良性查询的执行轨迹推断专有 Agent 技能

    发表
    场景
    AI Agent
    攻击者
    黑盒
    测试
    GPT-5.4-mini、GPT-5.5、GLM-5.2 等 4 个

    摘要提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。

    深度解读完整解读
  4. 攻击arXiv 2607.11698

    AHA 用自动研究循环发现生产 Agent 漏洞概念

    提出 AHA 自动研究循环,发现生产 Agent 的漏洞概念

    发表
    攻击者
    黑盒
    测试
    Minimax-M2.7、Kimi-K2.6、Deepseek-V4-Pro 等 5 个
    摘要论文提出基于可证伪科研循环的 AHA 框架,从生产级智能体中挖掘并沉淀漏洞概念图,提升攻击复用率并指导防御加固。

    AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。

    深度解读完整解读
  5. CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏

    发表
    攻击者
    黑盒
    测试
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
  6. 攻击arXiv 2609.15383

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力

    发表
    攻击者
    黑盒
    测试
    GPT-5.5、Claude Opus 4.8、Grok-4.3 等 7 个

    摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。

    深度解读完整解读
  7. 攻击arXiv 2609.14649

    CIG-MIA:利用上下文信息增益对 RAG 系统发起成员推断攻击

    提出 CIG-MIA,用上下文信息增益推断 RAG 知识库成员身份

    发表
    攻击者
    灰盒、黑盒
    测试
    Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Llama-2-13b-chat-hf 等 6 个
    摘要CIG-MIA 用注入前后的答案似然差推断 RAG 库成员,灰盒可分性高于所列基线。

    CIG-MIA 是针对 RAG 外部知识库的成员推断攻击,同时覆盖灰盒和纯文本黑盒。

    深度解读完整解读
  8. 防御arXiv 2609.22724

    MATE:面向移动 Agent 的策略感知安全审计方法

    提出策略条件轨迹审计器 MATE,判断移动 Agent 是否违反可编辑安全策略

    发表
    攻击者
    黑盒
    测试
    MATE-0.5B、MATE-1.5B、MATE-3B 等 8 个
    摘要MATE 用合成轨迹微调轻量审计器,在可编辑策略下判断移动智能体轨迹是否违规并给出解释。

    MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。

    深度解读完整解读
已经到底了