跳到正文
10月10日 · 周六

全部论文

找到 7 篇
筛选8
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.15989

    研究者提出 plan injection 攻击,可绕过思维链监控

    提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器

    发表
    攻击者
    灰盒
    被测模型
    Qwen2.5-Coder-7B-Instruct、Qwen3-8B、DeepSeek-R1-0528 等 6 个

    摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。

    深度解读完整解读
  2. 攻击arXiv 2609.01325

    VerTox:用可验证奖励引导的强化学习对神经排序模型实施语料投毒

    提出 VerTox,用可验证奖励强化学习生成误导文档并投毒检索语料

    发表
    被测模型
    SimLM-base、BGE-base、Cohere-embed-english-v3.0 等 8 个
    摘要VerTox 以可验证奖励微调小 LLM,生成能抬高排序并腐蚀事实的投毒文档。

    VerTox 用可验证奖励把小 LLM 微调成语料投毒生成器,用来探测神经排序器在注入文档下的暴露面。

    深度解读完整解读
  3. 攻击arXiv 2609.01023

    Akrasia:针对推理型代码 LLM 的隐蔽后门攻击

    提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链

    发表
    被测模型
    Claude-Sonnet-5、GPT-5.5、Gemini-3.5-flash 等 7 个

    摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。

    深度解读完整解读
  4. 攻击arXiv 2608.04565

    研究者提出 Breadcrumbing 长程攻击,可劫持 DeepResearch 类搜索 Agent 的证据链

    提出权威链劫持与轨迹引导策略演化,劫持搜索 Agent 的证据链

    发表
    场景
    web agent
    被测模型
    Qwen3.5-9B、Gemma4-31B、DeepResearch 等 7 个

    摘要论文揭示了多步搜索智能体在受限中间人操纵下的脆弱性,提出 ACH 策略与 TGSE 演化方法并完成系统验证。

    深度解读完整解读
已经到底了