跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 3 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 3 篇还没打标签,不在筛选结果里。

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2610.05586 ·

    AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测

    构建AGENTDOXX评测联网搜索智能体对匿名访谈的再识别能力

    测试
    GPT-5.6 Terra、GPT-5 Mini、GPT-4.1 Mini 等 10 个应用层
    场景
    AI Agent
    摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。
    • 定位与核心问题:本研究评估具备网络搜索工具的大语言模型智能体对去标识化文本的重识别风险;针对现有研究缺乏真实身份标注导致无法可靠测量风险与防御效果的问题,提出了具已知真实身份的评估套件 AGENTDOXX。
    • 评测方法与流程:基于 Reddit 的 r/IAmA 提取 822 位真实个体的公开属性,使用 GPT-5.4-mini 生成 8 轮结构的合成访谈并经双模型与人工脱敏审查;评测 15 种开源与专有模型配置在 Tavily 搜索下的直接重识别表现,并分析搜索时序轨迹与防御手段。
    • 参数化与检索双重风险:开源模型仅凭内部记忆无需搜索即可重识别 15.8%–27.7% 的访谈,搜索则使最强配置准确率达 47.0%–48.3%(Figure 3);目标一旦出现在检索结果中,全配置平均有 91.2% 的案例成功完成重识别(§4.2)。
    • 传统实体脱敏防御不足:基于 Presidio 的 NER 实体遮蔽后,143 篇分层样本中仍有 85.3% 至少被一个攻击者成功重识别(Table 2);属性假值替换虽使平均准确率降至 34.2%,但强推理模型常将事实矛盾视为听录噪音。
    • 提示词约束难以阻断过程泄露:系统提示词隐私约束虽使输出准确率降至 21.6%,但在拒绝给出姓名的样本中,37% 已在搜索过程中检索到了真实姓名,58% 在理由中披露了足以定位身份的关键细节(Table 3)。
    • 作者结论与启示:作者认为搜索增强智能体的隐私评估必须同时审计检索轨迹与最终输出;重识别能力已在开源模型中显现;针对复合属性的定向脱敏比单纯遮蔽命名实体更为必要。
    完整解读
  2. 评测与基准arXiv:2607.20891 ·

    MisKnow-Agent 评测:单篇误导文档使 Deep Research 错误结论平均采纳率升至 54.7%

    提出MisKnow-Agent,评测深度研究智能体是否采纳误导性检索知识

    测试
    Gemini Deep Research、DeepSeek-V4 Pro、Qwen3.5-397B 等 4 个应用层
    场景
    AI Agent
    摘要论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。
    • 定位与核心问题:本文评估大语言模型长程研究(Deep Research)智能体在开放信息环境下的内容可靠性,重点探究智能体是否会在最终报告中采纳具有表面可信度但事实错误的误导性知识作为自身结论。
    • 方法设计要点:提出 MisKnow-Agent 受控评估框架,针对 DeepResearch Bench 的 100 个任务构建人工审核的虚假结论蓝图,生成跨 3 个权威层级与 4 种风格的误导文档,并经 5 个搜索验证模型交叉检验与人工质量筛选保留 5,933 篇文档;同时设计了前置验证提示与后置精炼智能体两阶段防御。
    • 暴露与来源影响:实验表明无注入对照下平均虚假结论采纳率(FCAR)为 0%,注入 1 篇误导文档即升至 54.7%(Figure 5);搜索结果排名位置对采纳率影响较小(Front 与 Back 仅差 1.7 个百分点),而在最终合成前引入误导文档使平均采纳率升至 85.5%(Figure 3);学术论文风格产生的采纳率最高(61.0%),较社交帖子高出 23.5 个百分点(Figure 4)。
    • 系统与框架差异:在默认高权威学术论文风格下,DeerFlow 平均 FCAR(67.0%)高于 WebThinker(55.0%),差距随模型智力指数提升而缩小,但采纳率与智力指数不呈单调关系(Table 3);Gemini Deep Research 同样表现出类似趋势,FCAR 在 1 篇时为 27%,在 3 篇时达到 54%(Figure 7)。
    • 防御表现与启示:前置提示、后置精炼及组合防御可将 DeerFlow 上的 FCAR 从基线的 60%–76% 降至 15%–62%,但无法完全消除采纳,且在 Intern-S1-Pro 上组合防御(62%)高于单项防御(Figure 7);作者认为仅靠隔离识别误导文档并不充分,必须将验证与修正机制贯穿于证据获取、中间研究状态和最终合成的全流程。
    完整解读
  3. 评测与基准arXiv:2609.31342 ·

    研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案

    构建知识逆转基准,评测陈旧检索证据如何推翻模型原本正确的回答

    测试
    GPT-4o、GPT-4.1、Claude-Opus-4.5 等 13 个应用层
    摘要论文评测了陈旧检索推翻正确知识的中毒现象,并分析了其内部机制与防御局限。

    这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。

    完整解读
已经到底了