跳到正文
10月10日 · 周六

全部论文

找到 9 篇

另有 232 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.27542

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控

    发表
    场景
    AI Agent
    被测模型
    openai/gpt-oss-20b、google/gemma-4-26B-A4B-it、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个

    摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。

    深度解读完整解读
  2. 攻击arXiv 2609.02774

    CodePoisonRAG:针对检索增强代码生成的知识投毒攻击

    提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞

    发表
    被测模型
    Qwen 3.5 9B、Code Llama 13B、DeepSeek-Coder-V2 16B

    摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。

    深度解读完整解读
  3. 攻击arXiv 2609.01325

    VerTox:用可验证奖励引导的强化学习对神经排序模型实施语料投毒

    提出 VerTox,用可验证奖励强化学习生成误导文档并投毒检索语料

    发表
    被测模型
    SimLM-base、BGE-base、Cohere-embed-english-v3.0 等 8 个
    摘要VerTox 以可验证奖励微调小 LLM,生成能抬高排序并腐蚀事实的投毒文档。

    VerTox 用可验证奖励把小 LLM 微调成语料投毒生成器,用来探测神经排序器在注入文档下的暴露面。

    深度解读完整解读
  4. 攻击arXiv 2608.04565

    研究者提出 Breadcrumbing 长程攻击,可劫持 DeepResearch 类搜索 Agent 的证据链

    提出权威链劫持与轨迹引导策略演化,劫持搜索 Agent 的证据链

    发表
    场景
    web agent
    被测模型
    Qwen3.5-9B、Gemma4-31B、DeepResearch 等 7 个

    摘要论文揭示了多步搜索智能体在受限中间人操纵下的脆弱性,提出 ACH 策略与 TGSE 演化方法并完成系统验证。

    深度解读完整解读
  5. 攻击arXiv 2606.11265

    论文提出 CRCP 投毒框架,揭示 RAG 分块与重排序下的投毒失效问题

    提出 CRCP 框架,优化分块与重排下的 RAG 语料投毒

    发表
    被测模型
    GPT-4o、DeepSeek-R1、Qwen3-Max 等 11 个
    摘要CRCP 把投毒做成多阶段一致性问题。

    CRCP 研究的是带分块和重排的 RAG 语料投毒,而不是只提高文档级检索分数。

    深度解读完整解读
  6. 攻击arXiv 2507.10457

    论文提出 LPCI:针对 Agent 逻辑层与持久记忆的提示控制注入攻击

    提出 LPCI,把延迟条件载荷写入记忆与检索库以跨会话触发

    发表
    场景
    AI Agent
    被测模型
    ChatGPT、Claude、LLaMA3 等 8 个
    摘要作者定义 LPCI。

    作者把LPCI定义为针对智能体逻辑执行、记忆留存和工具集成的跨阶段漏洞类,而不是单次输入上的提示改写。

    深度解读完整解读
已经到底了