跳到正文
10月10日 · 周六

全部论文

找到 104 篇

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.11634

    LTBD:用可学习信任边界分隔符防御提示注入

    提出 LTBD,用可学习分隔符隔离可信指令与不可信数据

    发表
    被测模型
    Llama3-8B-Instruct、Llama3.1-8B-Instruct、Falcon3-7B-Instruct 等 4 个
    摘要LTBD 只训练四个分隔符嵌入。

    LTBD 是一种不改基座权重的提示注入防御:只学习用来标出可信指令与不可信数据边界的四个 token 嵌入。

    深度解读完整解读
  2. 防御arXiv 2610.09793

    用时序逻辑监控工具 Agent

    提出 MFOTL 离线时序验证以监控工具 Agent 的危险动作链

    发表
    场景
    AI Agent
    攻击者
    黑盒
    摘要形式化验证可有效识别多步攻击,但其有效性高度依赖轨迹的可信历史记录。

    这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。

    深度解读完整解读
  3. 攻击arXiv 2610.09264

    研究者提出 PackHallu:经规则文件提示注入对编码 Agent 发起包幻觉攻击

    提出 PackHallu,经规则文件提示注入诱导编码 Agent 换用攻击者指定包

    发表
    被测模型
    Qwen2.5-Coder-7B、Qwen3-Coder-30B、Devstral-Small-2-24B 等 19 个
    摘要PackHallu 诱导规则文件换包。

    PackHallu 研究一种针对编程智能体规则文件的提示注入:让智能体在本应使用合法依赖时,改导入攻击者指定并控制的包。

    深度解读完整解读
  4. 攻击arXiv 2610.08951

    ASPIRE:面向 LLM Agent 的开放式提示注入红队引擎

    提出 ASPIRE 行为图搜索,开放式发现 Agent 提示注入漏洞

    发表
    场景
    AI Agent
    被测模型
    Gemini-3.7-Flash、DeepSeek-V4-Flash、Gemini-2.5-flash
    摘要ASPIRE 把提示注入红队从载荷优化改成行为图引导的开放式漏洞发现。

    ASPIRE 是给搭建方用的智能体提示注入红队引擎,目标是开放式画出可利用的行为路径,而不是在固定任务上打磨一条载荷。

    深度解读完整解读
  5. 防御arXiv 2610.07657

    DEFER1 多智能体防御研究报告受控测试中的攻击成功率下降

    实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击

    发表
    被测模型
    Qwen3-235B-A22B-Instruct-2507、gpt-oss-120b、Llama-4-Scout-17B-16E-Instruct 等 5 个
    摘要DEFER 把确定性检查放在 judge 之前。

    DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。

    深度解读完整解读
  6. 攻击arXiv 2610.07645

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    提出 SkillPoison,用局部有效的成功经验诱导自进化 Agent 形成过度泛化技能

    发表
    场景
    AI Agent
    被测模型
    deepseek-v4-flash、Qwen V3.8 Flash、GPT-5.5
    摘要SkillPoison 通过局部有效且验证成功的经验诱导技能过度泛化,在多个评测基准上实现了持久的下游攻击影响。

    SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。

    深度解读完整解读
  7. 攻击arXiv 2610.07510

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    提出 PERSISTBD,发布前强化供应链后门使其经良性 SFT 与 RL 后仍外发凭据

    发表
    被测模型
    Qwen2.5-Coder-3B-Instruct、Qwen2.5-Coder-7B-Instruct、Qwen3-Coder-30B-A3B-Instruct
    摘要总结了论文关于后门在 SFT/RL 中存活的发现、两因子机制、PERSISTBD 方法与核心数字。

    本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。

    深度解读完整解读
  8. 可解释性arXiv 2610.05295

    研究用因果追踪区分间接提示注入中的可读信号与有效干预

    用因果追踪区分间接提示注入中的角色可读性与有效干预

    发表
    场景
    AI Agent
    被测模型
    Qwen-2.5-7B、Qwen-2.5-1.5B、Llama-3.1-8B 等 8 个
    摘要作者称源角色先于强工具选择效应可读,有效编辑还取决于位置、长度和方向来源。

    在权重固定的白盒模型上,源角色可以先被读出。沿相关方向的编辑是否改变行为,要在目标位点上另测。。

    深度解读完整解读
  9. 攻击arXiv 2610.05266

    论文披露主动式智能体的服务方间接提示注入攻击

    提出服务方间接提示注入,把主动智能体的决策协助转向预选目标

    发表
    场景
    AI Agent
    被测模型
    GPT-5、Claude Opus 4.6、Gemini 3 Pro 等 7 个
    摘要提供者侧间接注入用 T–B–S 把主动协助转向外部目标,并在三环境中提高模拟用户授权。

    外部提供者只控制与自身目标关联的内容,就可以把良性主动个人智能体的协助转向该目标。

    深度解读完整解读
  10. 防御arXiv 2610.05163

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    提出 PAA 方法,在边界动作前审计长流程智能体的分阶段提示注入

    发表
    被测模型
    Claude Code (v2.1.172, Claude Sonnet 5)、Codex CLI (v0.144.0, GPT-5.5)
    摘要论文针对长流程注入提出边界动作审计与 PAA,在保持低误阻的同时实现高拦截率。

    本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。

    深度解读完整解读
  11. 攻击arXiv 2610.04589

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道

    发表
    场景
    AI Agent
    被测模型
    Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个

    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    深度解读完整解读
  12. 评测与基准arXiv 2610.03153

    EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准

    构建 EvoRiskBench 评测工作区 Agent 的运行时安全风险

    发表
    场景
    AI Agent
    被测模型
    GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5

    摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。

    深度解读完整解读
  13. 防御arXiv 2610.01349

    PACE:面向工具调用 LLM Agent 的来源感知能力强制执行

    提出 PACE,在工具调用前做路径隔离与效果授权

    发表
    场景
    AI Agent
    被测模型
    gpt-5.6-luna、DeepSeek-V4-Flash、Qwen-3.8-27B
    摘要PACE 在工具边界做路径割与效果核验。

    PACE 是面向工具调用型 LLM 智能体的运行时调解:当准入证据无法区分会改变行为的规格时,不在出口站点上撤销调解,而在最后一次工具调用前同时检查表示出的影响路径和请求权限。

    深度解读完整解读