跳到正文
10月10日 · 周六

全部论文

找到 2 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.05346

    研究者提出序列马赛克攻击并给出防御理论

    形式化 watchman 防御以阻止序贯马赛克攻击

    发表
    被测模型
    Qwen3.6-35B-A3B、Gemma-4-26B-A4B-it、DeepSeek-V2-Lite (16B-A2.4B)
    摘要watchman 理论给出零失败且有用的条件。

    这篇工作同时给出序贯马赛克防御的博弈理论,以及冻结 LLM 上的分角色自博弈训练。

    深度解读完整解读
  2. 攻击arXiv 2608.02681

    研究揭示批量提示导致大模型安全失效并提出批量感知对齐缓解方案

    把批量提示当作越狱攻击,提出 batch-aware DPO 缓解

    发表
    攻击者
    黑盒
    被测模型
    Llama-3.1-8B、Phi-4-14B、Qwen-3-8B 等 6 个
    摘要有害问题混入良性 batch 可引出有害回答。

    这篇工作检查一种本用于省推理成本的输入结构:把多个问题一次送进对齐后的 LLM,安全拒答是否还和单问时一样。

    深度解读完整解读
已经到底了