跳到正文
10月9日 · 周五

全部论文

找到 23 篇

另有 433 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.04565

    研究者提出 Breadcrumbing 长程攻击,可劫持 DeepResearch 类搜索 Agent 的证据链

    提出权威链劫持 ACH 与策略演化 TGSE,劫持搜索 Agent 的证据链

    发表
    场景
    AI Agent
    测试
    Qwen3.5-9B、Gemma4-31B、DeepResearch 等 8 个

    摘要论文揭示了多步搜索智能体在受限中间人操纵下的脆弱性,提出 ACH 策略与 TGSE 演化方法并完成系统验证。

    深度解读完整解读
  2. 攻击arXiv 2608.05563

    研究者提出 PoisonedEvolution 轨迹投毒攻击

    提出 PoisonedEvolution 轨迹投毒,诱导自演化技能系统把恶意行为固化为技能

    发表
    场景
    AI Agent
    测试
    GPT-5.4、MiniMax-M2.5、DeepSeek-V3.2 等 7 个
    摘要论文揭示自演化技能系统的证据晋升漏洞,提出并验证轨迹投毒攻击。

    这篇论文揭示了自演化技能系统在将交互经验转化为持久指令时的安全风险。

    深度解读完整解读
  3. 攻击arXiv 2606.04329

    研究者系统研究 LLM 智能体记忆投毒攻击并提出 MPBench 基准

    系统研究 LLM 智能体记忆投毒并构建基准 MPBench

    发表
    场景
    AI Agent
    测试
    GPT-OSS-120B、Meta-Llama-3.1-70B-Instruct、Deberta-v3-base 等 6 个

    摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。

    深度解读完整解读
  4. 评测与基准arXiv 2610.06898

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    提出 DIBench,评测界面注入对移动智能体选择决策的操纵

    发表
    测试
    Qwen2.5-VL(32B)、Qwen3-VL(32B)、GUI-Owl(32B) 等 7 个

    摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。

    深度解读完整解读
  5. 攻击arXiv 2610.07645

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    提出 SkillPoison,用局部有效的成功经验投毒自进化智能体的技能形成

    发表
    场景
    AI Agent
    测试
    deepseek-v4-flash、Qwen V3.8 Flash、GPT-5.5
    摘要SkillPoison 通过局部有效且验证成功的经验诱导技能过度泛化,在多个评测基准上实现了持久的下游攻击影响。

    SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。

    深度解读完整解读
  6. 防御arXiv 2609.08394

    Windows 恶意软件检测器作为复合 AI 系统:准确率、效率与对抗鲁棒性的权衡

    提出 OBELISK 三级流水线,权衡恶意软件检测的准确率、开销与鲁棒性

    发表
    攻击者
    白盒、黑盒
    测试
    GBDT-ALL、GBDT-YARA、NEBULA-ALL 等 5 个
    摘要三级过滤以不大的检测损失换速度,同一机制扩大攻击面,部署应按约束选配置。

    OBELISK 把 Windows PE 恶意软件检测做成 YARA、EMBER-GBDT 与 Nebula 的顺序流水线,用来同时看检出、计算开销和对抗鲁棒性。

    深度解读完整解读
  7. 攻击arXiv 2609.19722

    ALIBI:向二进制注入虚假安全叙事可让 LLM 恶意软件分析器误判

    提出 ALIBI,向恶意二进制注入不执行掩护叙事使分析器误判为良性

    发表
    攻击者
    黑盒
    测试
    Gemini 2.5 Pro、GPT-5.5 Pro、Claude Opus 4.7 等 4 个
    摘要ALIBI 用二进制内的掩护叙事重释可疑静态证据,Gemini 上翻转多,另两模型主要为降级。

    ALIBI 是针对 LLM 恶意软件分诊的语义掩护叙事攻击:不覆盖系统指令,而把仍可见的可疑静态证据重释成良性安全产品的预期行为。

    深度解读完整解读
  8. 评测与基准arXiv 2609.22818

    研究测量 LLM Agent 记忆投毒防御的良性场景开销

    测量 LLM Agent 记忆投毒防御的良性效用与 token 开销

    发表
    场景
    AI Agent
    测试
    gemini-3.1-flash-lite、text-embedding-3-small、claude-haiku-4-5-20251001
    摘要写时代价落在噪声内。

    在没有攻击的对话上,给记忆投毒防御计价,而不是再测一轮攻击是否被挡住。

    深度解读完整解读
  9. Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息

    构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御

    发表
    测试
    Gemma-4-31B-IT、Qwen-3.5-35B-A3B、Llama-4-Scout-17B-16E 等 11 个

    摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。

    深度解读完整解读
  10. 攻击arXiv 2607.05189

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆

    发表
    场景
    AI Agent
    测试
    GPT-5.4、Claude Sonnet 4.6、Claude Sonnet 4.5 等 6 个
    摘要总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。

    深度解读完整解读
  11. 攻击arXiv 2609.02774

    CodePoisonRAG:针对检索增强代码生成的知识投毒攻击

    提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞

    发表
    测试
    Qwen 3.5 9B、Code Llama 13B、DeepSeek-Coder-V2 16B 等 4 个

    摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。

    深度解读完整解读
  12. 防御arXiv 2610.00327

    Actions with Receipts:为工具智能体审计绑定声明、证据与执行

    提出 EC-Agent 联合回执,绑定工具智能体的主张、证据与执行

    发表
    场景
    AI Agent
    摘要EC-Agent 把主张、片段、执行前缀和来源状态绑成可重放回执,并把完整性与语义支持分开判定。

    EC-Agent 为工具智能体的审计增加一份可重放的联合回执:它同时绑定发出的主张、精确来源片段、有序执行前缀,以及该次执行看到的来源版本和访问状态。

    深度解读完整解读
  13. 评测与基准arXiv 2609.19140

    AgentLSD:在对抗性任务污染下评测 AI 安全 Agent

    用 AgentLSD 评测安全 Agent 在对抗任务污染下的解题与开销

    发表
    测试
    Gemma-4 31B、DeepSeek-V4 Flash、GPT-OSS 120B 等 6 个
    摘要AgentLSD 用配对 web CTF 表明,欺骗性环境证据会改变安全智能体的解题率与工作量。

    AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。

    深度解读完整解读
  14. 评测与基准arXiv 2609.39146

    MADBench:多智能体辩论安全性评测基准发布

    发布 MADBench,评测多智能体辩论会吸收还是放大对抗影响

    发表
    测试
    gpt-4o、GPT-5、GPT-6 Astra
    摘要MADBench 显示辩论能吸收部分准确率攻击,同时放大未授权读写。

    MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。

    深度解读完整解读