跳到正文
10月9日 · 周五

全部论文

找到 7 篇

另有 676 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.01062

    Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架

    提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱

    发表
    测试
    Llama-3.1-8B-Instruct、Llama-Guard-3-8B、Llama 3-8B-Instruct 等 6 个
    摘要KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。

    Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。

    深度解读完整解读
  2. 攻击arXiv 2609.08186

    论文揭示大推理模型的对齐崩溃并提出 Reasoning Trap 越狱范式

    揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱

    发表
    测试
    Llama2-7B、Llama2-13B、Qwen3-8B 等 8 个
    摘要更深推理提升题目准确率,同时提高扰动下的相对损失。

    作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。

    深度解读完整解读
  3. 攻击arXiv 2609.10611

    WPMIA:面向严格黑盒大模型的词级概率成员推断攻击

    提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员

    发表
    攻击者
    黑盒
    测试
    OPT-6.7B、LLaMA-13B、Pythia-6.9B 等 12 个
    摘要WPMIA 从续写估计词级似然并对比前缀,黑盒上多数优于所列基线。

    WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。

    深度解读完整解读
已经到底了