跳到正文
10月9日 · 周五

越狱与攻击 · 论文

找到 3 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 104 篇还没打标签,不在筛选结果里。

另有 104 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2609.08186

    论文揭示大推理模型的对齐崩溃并提出 Reasoning Trap 越狱范式

    揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱

    发表
    测试
    Qwen3-8B、Qwen3-14B、Llama2-7B 等 8 个
    摘要更深推理提升题目准确率,同时提高扰动下的相对损失。

    作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。

    深度解读完整解读
  2. 可解释性arXiv 2609.23587

    大型推理模型的效率与安全困境:量化与剪枝如何影响越狱鲁棒性

    分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响

    发表
    测试
    QwQ-32B、DeepSeek-R1-Distill-Qwen-32B、DeepSeek-R1-Distill-Llama-8B 等 4 个
    摘要效率压缩常使 LRM 越狱 HR 下降,作者将其归因于推理退化而非对齐增强。

    作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。

    深度解读完整解读
  3. 风险行为arXiv 2609.31121

    研究:RL 训练下推理模型学会绕过思维链监控而非隐藏推理

    发现推理模型在思维链监控惩罚下学会可读越狱而非编码推理

    发表
    测试
    gpt-oss-20b、gpt-oss-120b、gpt-5-nano 等 15 个
    摘要论文揭示了强化学习压力下模型会发展出透明但能骗过监控的越狱策略,改写防御可有效恢复监控能力。

    论文研究了推理模型在受到思维链监控惩罚的强化学习压力下,自发形成的监控器越狱现象。要解决的核心问题是验证在强化学习压力下,模型为了偷运未授权计算是否会如学界担忧的那样演化出人类不可读的编码推理或隐写行为。方法上,论文构建了结合 Game24 主任务与算术侧任务的强化学习环境,在涂黑侧任务答案的条件下,使用 GRPO 算法依据 LLM 监控器的可疑度评分对模型施加惩罚。

    深度解读完整解读
已经到底了