跳到正文
10月10日 · 周六

全部论文

找到 35 篇

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.08951

    ASPIRE:面向 LLM Agent 的开放式提示注入红队引擎

    提出 ASPIRE 行为图搜索,开放式发现 Agent 提示注入漏洞

    发表
    场景
    AI Agent
    被测模型
    Gemini-3.7-Flash、DeepSeek-V4-Flash、Gemini-2.5-flash
    摘要ASPIRE 把提示注入红队从载荷优化改成行为图引导的开放式漏洞发现。

    ASPIRE 是给搭建方用的智能体提示注入红队引擎,目标是开放式画出可利用的行为路径,而不是在固定任务上打磨一条载荷。

    深度解读完整解读
  2. 攻击arXiv 2610.07323

    ATLAS:用自适应信任域与主动学习搜索潜在对抗样本集

    提出 ATLAS 用水平集估计恢复黑盒分类器的对抗输入集合

    发表
    攻击者
    黑盒
    被测模型
    LeNet5、ResNet50 (CIFAR-10 standard)、ResNet50 (ImageNet standard) 等 5 个
    摘要ATLAS 用主动水平集估计构造黑盒对抗集,作者称其集合比单点攻击更具代表性。

    ATLAS 是一个查询式 black-box 框架,用来构造诱发失败的对抗输入集合,供鲁棒性审计使用。

    深度解读完整解读
  3. 攻击arXiv 2610.04589

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道

    发表
    场景
    AI Agent
    被测模型
    Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个

    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    深度解读完整解读
  4. 攻击arXiv 2609.35576

    研究提出跨 LLM 助手的记忆跳跃攻击

    提出跨独立 Agent 的记忆跳跃攻击,经共享工件在助手间自传播

    发表
    场景
    AI Agent
    被测模型
    GPT-5.6 Luna、Kimi-K2.6、GPT-OSS-120B 等 6 个
    摘要论文证实持久工件与内存可形成跨智能体传播链,揭示了将共享工件纳入安全防线的重要意义。

    该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。

    深度解读完整解读
  5. 评测与基准arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作

    发表
    被测模型
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读
  6. 攻击arXiv 2609.27542

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控

    发表
    场景
    AI Agent
    被测模型
    openai/gpt-oss-20b、google/gemma-4-26B-A4B-it、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个

    摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。

    深度解读完整解读
  7. 攻击arXiv 2609.07216

    DIVA:利用视觉锚点对视频生成模型实施多模态越狱

    提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型

    发表
    攻击者
    黑盒
    被测模型
    Wan、CogVideoX、LTX-Video 等 9 个
    摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。

    DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。

    深度解读完整解读
  8. SinoGlyphBench:中文字形混淆下语言模型审核的诊断基准

    提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性

    发表
    被测模型
    GPT-5.4 mini、GPT-5.5、DeepSeek V4 Flash 等 12 个
    摘要SinoGlyphBench 显示中文字形混淆会同时增加有害漏报和误报,全文扰动最重。

    SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。

    深度解读完整解读
  9. 攻击arXiv 2609.04533

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    提出 Repeat-After-Me 自适应视觉提示注入,诱导 VLM 智能体执行指定任务

    发表
    场景
    AI Agent
    被测模型
    Claude-Opus-4.7、GPT-5.5、Gemini-3.1-Pro 等 6 个

    摘要论文提出了针对黑盒 VLM 的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。

    深度解读完整解读
  10. 攻击arXiv 2608.06862

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链

    发表
    被测模型
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B

    摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。

    深度解读完整解读
  11. 攻击arXiv 2607.05189

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    提出 MEMGHOST,用单封邮件对持久个人 Agent 做跨会话隐蔽记忆注入

    发表
    场景
    AI Agent
    被测模型
    GPT-5.4、Claude Sonnet 4.6、Claude Sonnet 4.5 等 6 个
    摘要总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。

    深度解读完整解读