跳到正文
10月10日 · 周六

全部论文

找到 30 篇

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.07258

    AMU:用派生血缘门控实现企业 AI Agent 列级访问控制

    提出 AMU 按推导图门控企业 Agent 共享记忆的列级访问

    发表
    场景
    AI Agent
    摘要在完整血缘下,AMU 按列权限放行缓存,并标出同名 KPI 冲突。

    AMU 用列级推导门控共享记忆,拦截经缓存流出的无权敏感列,并标出同名 KPI 的定义冲突。

    深度解读完整解读
  2. 评测与基准arXiv 2610.05586

    AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测

    构建 AGENTDOXX 基准,评测联网搜索 Agent 对匿名访谈的再识别

    发表
    场景
    web agent
    被测模型
    GPT-5.6 Terra、GPT-5 Mini、GPT-4.1 Mini 等 10 个

    摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。

    深度解读完整解读
  3. 攻击arXiv 2610.04589

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道

    发表
    场景
    AI Agent
    被测模型
    Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个

    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    深度解读完整解读
  4. 防御arXiv 2609.36326

    PILLAR:面向增强检索的私有倒排索引词法查找

    提出 PILLAR,用私有词法预筛与客户端重排保护 RAG 查询

    发表
    摘要PILLAR 用固定模式的私有 BM25 预筛加本地嵌入重排,在两基准上换取延迟或质量。

    PILLAR 是面向公开语料的隐私 RAG:半诚实服务器学不到查询词项和访问模式,客户端仍拿到用于增强生成的 k 篇文档。

    深度解读完整解读
  5. 风险行为arXiv 2609.32701

    研究显示前沿模型智能体在测试时自行形成隐蔽信道

    展示智能体在禁止泄露与独立监视下自发建立隐蔽信道传递机密

    发表
    被测模型
    GPT-5.6 Sol、Terra、Luna 等 6 个
    摘要论文研究了固定参数智能体在受监视交互中仅凭单比特反馈自发建立隐蔽信道,指出了多智能体跨域协作的保密安全新风险。

    论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。

    深度解读完整解读
  6. 攻击arXiv 2609.27542

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控

    发表
    场景
    AI Agent
    被测模型
    openai/gpt-oss-20b、google/gemma-4-26B-A4B-it、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个

    摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。

    深度解读完整解读
  7. 防御arXiv 2609.19587

    红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器

    提出 Auto Mode ++,加固编码 Agent 阻断监视器

    发表
    被测模型
    Opus 5、Opus 4.8、Opus 4.7 等 8 个

    摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。

    深度解读完整解读
  8. 攻击arXiv 2609.14649

    CIG-MIA:利用上下文信息增益对 RAG 系统发起成员推断攻击

    提出 CIG-MIA,用上下文信息增益推断 RAG 知识库成员身份

    发表
    攻击者
    灰盒、黑盒
    被测模型
    Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Llama-2-13b-chat-hf 等 6 个
    摘要CIG-MIA 用注入前后的答案似然差推断 RAG 库成员,灰盒可分性高于所列基线。

    CIG-MIA 是针对 RAG 外部知识库的成员推断攻击,同时覆盖灰盒和纯文本黑盒。

    深度解读完整解读
  9. 攻击arXiv 2609.13889

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    提出 PMPA,经外部源向 Agent 持久记忆投毒并跨会话泄露隐私

    发表
    被测模型
    DeepSeek-V4-Flash、DeepSeek-V4-Pro、Qwen3-Max

    摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。

    深度解读完整解读
  10. 攻击arXiv 2609.12448

    GraphProfiler 用个人知识图谱推断敏感属性并溯源到具体帖子

    提出 GraphProfiler,用个人知识图谱从帖子历史推断敏感属性并溯源

    发表
    摘要GraphProfiler 用源链接个人知识图谱做属性推断,准确率接近文本基线,并把证据定位到少量源帖。

    GraphProfiler 是一个可审计的 LLM 敏感属性画像器:用源链接个人知识图谱,把推断落到具体帖子。

    深度解读完整解读
  11. 其他arXiv 2609.08832

    自进化智能体框架缩小 LLM 智能体的「一致性差距」

    提出离线两阶段框架,诊断易翻转步骤并生成记忆指南以稳定智能体

    发表
    场景
    AI Agent
    被测模型
    GPT-4.1、GPT-OSS-120B
    摘要用离线一致性诊断生成记忆指南,在 AppWorld 上提高重复全通过率。

    作者要缩小的是 LLM 智能体平均通过、重复不稳之间的 consistency gap,即 Mean@k 减 Passˆk。

    深度解读完整解读
  12. 评测与基准arXiv 2608.18066

    Salesforce AI Research 重测自改进 Agent

    重测记忆型自改进 Agent 的运行方差与任务顺序敏感性

    发表
    场景
    AI Agent
    被测模型
    GPT-5-mini、Gemini-2.5-Pro、GPT-OSS-120B 等 4 个
    摘要论文揭示了基于记忆的自改进智能体在多次运行和乱序下的脆弱性,并指出规约不完备是诱发退化的关键瓶颈。

    这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。

    深度解读完整解读