跳到正文
10月10日 · 周六

全部论文

找到 10 篇

另有 244 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.35699

    论文:蒸馏防御在蒸馏后强化学习下易被攻破

    提出用 API 推理摘要重建轨迹再蒸馏加强化学习,攻破蒸馏防御

    发表
    攻击者
    黑盒
    被测模型
    Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-3B 等 12 个
    摘要更现实的蒸馏攻击是蒸馏后再 RL。

    这篇工作修订蒸馏攻击的威胁模型:攻击者经合法 API 收集闭源推理数据,先蒸馏自有模型,再做强化学习。作者认为只在蒸馏后评估防御,会漏掉后续 RL,从而高估防御。

    深度解读完整解读
  2. 攻击arXiv 2609.13889

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    提出 PMPA,经外部源向 Agent 持久记忆投毒并跨会话泄露隐私

    发表
    被测模型
    DeepSeek-V4-Flash、DeepSeek-V4-Pro、Qwen3-Max

    摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。

    深度解读完整解读
  3. 攻击arXiv 2608.09867

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链

    发表
    攻击者
    黑盒
    被测模型
    Claude Opus 4.8、Claude Sonnet 4.6、Claude Haiku 4.5 等 13 个

    摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。

    深度解读完整解读
  4. 评测与基准arXiv 2607.14611

    论文评测 Claude Code 与 Codex 记忆文件中的提示注入风险

    评测编码 Agent 记忆文件中提示注入的跨会话影响

    发表
    被测模型
    Claude Haiku 4.5、Claude Opus 4.7、GPT-5.2 等 4 个
    摘要已植入记忆文件的载荷可以跨会话影响 Claude Code 与 Codex,攻击成功与载荷是否留下是两种不同的失败。

    Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。

    深度解读完整解读
  5. 攻击arXiv 2605.30040

    研究揭示 LLM 按 token 计费可被服务商系统性虚报

    构造可通过计费审计的 token 虚报,使服务商系统性超收

    发表
    被测模型
    PALACE domain-adapted auditor
    摘要不诚实提供方可在三种 token 审计上虚报并通过检查,作者认为需改用提供方不控制的证据。

    不透明 LLM 的按 token 计费里,现有审计核验的是提供方可控的证据,不诚实提供方可以虚报并通过检查。。

    深度解读完整解读
  6. 防御arXiv 2602.24210

    研究者提出 Staged Decoding 与 SFT 数据集,减少大推理模型推理轨迹中的隐私泄露

    提出 Staged Decoding 与指令跟随训练,减少推理轨迹隐私泄露

    发表
    被测模型
    Qwen 3 1.7B、Qwen 3 4B、Qwen 3 8B 等 6 个
    摘要用一般指令跟随训练加分段解码,可降低轨迹隐私泄露,但数学效用下降。

    本文把大推理模型的隐私问题做成轨迹可控性:隐私指令是指令,轨迹不跟随就会把敏感上下文写进可被提示注入导出的文本。

    深度解读完整解读
已经到底了