跳到正文
10月10日 · 周六

全部论文

找到 36 篇

另有 224 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.05586

    AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测

    构建 AGENTDOXX 基准,评测联网搜索 Agent 对匿名访谈的再识别

    发表
    场景
    web agent
    被测模型
    GPT-5.6 Terra、GPT-5 Mini、GPT-4.1 Mini 等 10 个

    摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。

    深度解读完整解读
  2. 攻击arXiv 2610.04589

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道

    发表
    场景
    AI Agent
    被测模型
    Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个

    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    深度解读完整解读
  3. 攻击arXiv 2610.01768

    LLMLeak:借 LLM 合法网页抓取实施隐蔽数据外泄

    提出 LLMLeak,把机密编进报错 URL 借网页抓取外泄

    发表
    场景
    AI Agent
    摘要LLMLeak 用报错 URL 借聊天机器人抓取外传秘密。

    LLMLeak 研究一种隐蔽外传:本地恶意软件已拿到机密,却因为网络限制或监控不能直接连接攻击者,于是把秘密放进看起来像排障文档的 URL,让良性聊天机器人的网页抓取工具在访问时把秘密带出去。

    深度解读完整解读
  4. 防御arXiv 2610.00371

    FlowReview:以授权配对评测控制多智能体组合信息流

    提出 FlowReview,用授权配对与确定性提交门控控制多智能体组合信息流

    发表
    被测模型
    Sonnet 4.5、Haiku 4.5、Qwen3-32B 等 5 个
    摘要配对标准要求拒绝禁止使用并完成授权使用,FlowReview 把三项审查接到执行。

    这篇工作把多智能体安全写成一件必须同时成立的事:拦住组合信息所启用的禁止使用,并完成同一场景里任务所需的授权使用。

    深度解读完整解读
  5. 防御arXiv 2609.36326

    PILLAR:面向增强检索的私有倒排索引词法查找

    提出 PILLAR,用私有词法预筛与客户端重排保护 RAG 查询

    发表
    摘要PILLAR 用固定模式的私有 BM25 预筛加本地嵌入重排,在两基准上换取延迟或质量。

    PILLAR 是面向公开语料的隐私 RAG:半诚实服务器学不到查询词项和访问模式,客户端仍拿到用于增强生成的 k 篇文档。

    深度解读完整解读
  6. 攻击arXiv 2609.18217

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御

    提出跨通道分段攻击,利用 MCP 隐式信任外发敏感文件

    发表
    被测模型
    GPT-4o、GPT-4o-mini、GPT-5.4 等 15 个

    摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。

    深度解读完整解读
  7. 评测与基准arXiv 2609.15017

    PIDS-Bench:在过度防御、混淆与分布偏移下评测提示注入检测器

    提出 PIDS-Bench,评测提示注入检测器在过度防御与分布偏移下的表现

    发表
    被测模型
    TF-IDF + logistic regression、DistilBERT、DeBERTa-v3-FT 等 7 个
    摘要PIDS-Bench 显示高分布内 F1 仍会过度拦截外部来源的安全相关良性输入。

    PIDS-Bench 是一个冻结的检测器级基准,用来在固定阈值下同时看提示注入检测和良性误报。

    深度解读完整解读
  8. 攻击arXiv 2609.14649

    CIG-MIA:利用上下文信息增益对 RAG 系统发起成员推断攻击

    提出 CIG-MIA,用上下文信息增益推断 RAG 知识库成员身份

    发表
    攻击者
    灰盒、黑盒
    被测模型
    Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Llama-2-13b-chat-hf 等 6 个
    摘要CIG-MIA 用注入前后的答案似然差推断 RAG 库成员,灰盒可分性高于所列基线。

    CIG-MIA 是针对 RAG 外部知识库的成员推断攻击,同时覆盖灰盒和纯文本黑盒。

    深度解读完整解读
  9. 防御arXiv 2609.10992

    拆解 LLM 交互中的隐私-效用权衡:Veilmind-4B 意图驱动本地保护框架

    提出意图驱动本地框架 Veilmind,净化发往远程模型的提示词

    发表
    被测模型
    Veilmind-4B
    摘要本地模型按意图净化提示词,在 Uprise 上给出两个隐私-效用工作点。

    本地侧的意图驱动净化,用来降低用户提示词发往不受信任远程模型时的敏感属性暴露。

    深度解读完整解读
  10. 防御arXiv 2609.01677

    Skill-as-API:面向智能体软件工程的机密多智能体协作协议

    提出 Skill-as-API,隔离多智能体协作中的 skill 正文与系统提示词

    发表
    摘要协议把 skill 正文留在所有者侧,四层限制发现内容、权限期限和注入拼接。

    Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。

    深度解读完整解读
  11. 攻击arXiv 2608.25776

    EvoMal 攻击利用自我进化编码 Agent 的自我投毒实现蠕虫式传播

    提出 EVOMAL,诱导自演化编码 Agent 在创建技能时自我投毒并蠕虫传播

    发表
    被测模型
    Devstral-Small-2、Gemma-4-31B-IT、Qwen3-Coder-Next 等 7 个

    摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。

    深度解读完整解读
  12. 防御arXiv 2608.24017

    WebMCP-Phalanx:为浏览器内 LLM Agent 工具调用建立信任边界

    提出 WebMCP-Phalanx,用能力凭证与双智能体隔离浏览器工具调用

    发表
    场景
    web agent
    摘要Phalanx 用浏览器凭证绑定工具所有权,Q/P 分离拦住描述注入,工具名与返回值仍有残留。

    WebMCP-Phalanx针对浏览器里的 WebMCP 智能体:在 SOP 下补工具所有权,并把语义检查从有工具权的执行中分开。

    深度解读完整解读