跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 12 篇

另有 383 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2609.31342 ·

    研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案

    构建知识逆转基准,评测陈旧检索证据如何推翻模型原本正确的回答

    LLM 应用测试GPT-4o、GPT-4.1、Claude-Opus-4.5 等 13 个应用层
    摘要论文评测了陈旧检索推翻正确知识的中毒现象,并分析了其内部机制与防御局限。

    这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。

    完整解读
  2. 评测与基准arXiv:2609.35596 ·

    SEABench:评测自演化智能体的内生失配

    提出 SEABench,评测无参数自进化智能体的内生失配

    AI Agent测试Kimi K2.5、Grok 4.3、GPT 5.6 Luna 等 4 个应用层
    摘要SEABench 显示无参数自进化能提高任务完成,同时在配对未进化基线安全的下游任务上引入可归因的安全失败。

    SEABench 是一个面向个人助理、参数不更新的自进化智能体基准,用来测量局部适应如何变成后续任务上的内生失配。。

    完整解读
已经到底了