跳到正文
10月9日 · 周五

全部论文

找到 16 篇

另有 584 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.37468

    论文提出针对 Agentic RAG 的检索器后门攻击与 DOU 隐藏方法

    提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门

    发表
    场景
    AI Agent
    测试
    E5、Contriever-MSMARCO、Qwen2.5-7B-Instruct

    摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。

    深度解读完整解读
  2. 防御arXiv 2605.19847

    论文揭示多租户 RAG 账号合谋使隐私泄露随账号数线性增长

    提出零知识审计协议,核验多租户 RAG 的合谋差分隐私

    发表
    测试
    MultiTenantRAGService、FAISS、HNSW (M=64, efcstr=200, efq=128) 等 4 个
    摘要揭示多租户 RAG 合谋泄露按根号 k 放大,提出带零知识证明的无泄露审计协议。

    论文针对多租户 RAG 服务在多账户协同攻击下隐私边界失效的问题展开研究。

    深度解读完整解读
  3. 攻击arXiv 2610.04589

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性

    发表
    场景
    AI Agent
    测试
    Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个

    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    深度解读完整解读
  4. 评测与基准arXiv 2609.22818

    研究测量 LLM Agent 记忆投毒防御的良性场景开销

    测量 LLM Agent 记忆投毒防御的良性效用与 token 开销

    发表
    场景
    AI Agent
    测试
    gemini-3.1-flash-lite、text-embedding-3-small、claude-haiku-4-5-20251001
    摘要写时代价落在噪声内。

    在没有攻击的对话上,给记忆投毒防御计价,而不是再测一轮攻击是否被挡住。

    深度解读完整解读
  5. 防御arXiv 2609.29647

    AgentKernel:面向 Agent 的可信原生操作系统内核

    提出 AgentKernel,强制中介 Agent 的身份、感知、认知与执行

    发表
    场景
    AI Agent
    摘要AgentKernel 是四支柱智能体 OS 设计,安全论证未附带实测数字。

    AgentKernel 是把安全做成组织原则的智能体 OS 架构,不是带跑分的攻防评测。

    深度解读完整解读
  6. 其他arXiv 2609.12413

    SoK 综述:智能体 AI 时代的越狱攻击、防御与实践考量

    综述智能体执行链路中的越狱攻击、防御与实践权衡

    发表
    场景
    AI Agent
    测试
    Qwen3.5-4B、Llama-3.1-8B-Instruct
    摘要SoK 将越狱重放到智能体流水线,并用两种模型检验回复层防御的边际与代价。

    Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。

    深度解读完整解读
  7. 防御arXiv 2608.12361

    基于搜索增强 LLM 的中文新词毒性共识检测框架 SeTox

    提出 SeTox 检索增强框架,检测中文新词的隐性毒性

    发表
    测试
    Perspective-API、Baidu-API、Tencent-API 等 14 个
    摘要SeTox 用检索把公共共识接入静态 LLM,以检测中文毒性新词。

    SeTox 研究中文新词上的隐性毒性检测:词表加检索增强,使静态 LLM 在不重训练的情况下利用公开网页上下文。

    深度解读完整解读
  8. 防御arXiv 2609.36326

    PILLAR:面向增强检索的私有倒排索引词法查找

    提出 PILLAR,用私有词法预筛与客户端重排保护 RAG 查询

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3-70B、e5-base-v2 等 4 个
    摘要PILLAR 用固定模式的私有 BM25 预筛加本地嵌入重排,在两基准上换取延迟或质量。

    PILLAR 是面向公开语料的隐私 RAG:半诚实服务器学不到查询词项和访问模式,客户端仍拿到用于增强生成的 k 篇文档。

    深度解读完整解读
  9. 评测与基准arXiv 2609.39146

    MADBench:多智能体辩论安全性评测基准发布

    发布 MADBench,评测多智能体辩论会吸收还是放大对抗影响

    发表
    测试
    gpt-4o、GPT-5、GPT-6 Astra
    摘要MADBench 显示辩论能吸收部分准确率攻击,同时放大未授权读写。

    MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。

    深度解读完整解读
  10. 攻击arXiv 2609.14649

    CIG-MIA:利用上下文信息增益对 RAG 系统发起成员推断攻击

    提出 CIG-MIA,用上下文信息增益推断 RAG 知识库成员身份

    发表
    攻击者
    灰盒、黑盒
    测试
    Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Llama-2-13b-chat-hf 等 6 个
    摘要CIG-MIA 用注入前后的答案似然差推断 RAG 库成员,灰盒可分性高于所列基线。

    CIG-MIA 是针对 RAG 外部知识库的成员推断攻击,同时覆盖灰盒和纯文本黑盒。

    深度解读完整解读
已经到底了