跳到正文
10月10日 · 周六

全部论文

找到 66 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09027

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    发表
    被测模型
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B

    摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。

    深度解读完整解读
  2. 攻击arXiv 2610.07323

    ATLAS:用自适应信任域与主动学习搜索潜在对抗样本集

    提出 ATLAS 用水平集估计恢复黑盒分类器的对抗输入集合

    发表
    攻击者
    黑盒
    被测模型
    LeNet5、ResNet50 (CIFAR-10 standard)、ResNet50 (ImageNet standard) 等 5 个
    摘要ATLAS 用主动水平集估计构造黑盒对抗集,作者称其集合比单点攻击更具代表性。

    ATLAS 是一个查询式 black-box 框架,用来构造诱发失败的对抗输入集合,供鲁棒性审计使用。

    深度解读完整解读
  3. 攻击arXiv 2610.05894

    研究者提出闭环偏见注入攻击

    提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见

    发表
    攻击者
    灰盒
    被测模型
    LLaDA-8B-Instruct、Dream-v0-Instruct-7B、LLaDA-MoE-7B-A1B-Instruct

    摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。

    深度解读完整解读
  4. 攻击arXiv 2610.03430

    JIL:通过对抗后缀操纵 LLM 请求调度优先级

    提出 JIL 对抗后缀,压低长度预测以抬高请求调度优先级

    发表
    被测模型
    Llama-3-8B-Instruct、Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3 等 4 个
    摘要JIL 用对抗后缀压低长度预测,在预测式 LLM 调度中提高自身优先级。

    JIL 是对预测式 LLM 调度的攻击:用对抗后缀压低长度预测,使请求在 SRPT 式队列里更早得到服务。

    深度解读完整解读
  5. 攻击arXiv 2610.01367

    研究:高质量数据筛选挡不住投毒

    提出 Bi-QSTO,优化能穿过质量筛选并在微调中削弱安全对齐的投毒样本

    发表
    被测模型
    Llama2-7B-Chat、Llama3-8B-Instruct、Qwen2-7B-Instruct 等 5 个
    摘要质量筛选挡不住部分高分样本的安全削弱。

    Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。

    深度解读完整解读
  6. 攻击arXiv 2610.01062

    Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架

    提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱

    发表
    被测模型
    Qwen2.5-7B-Instruct、Gemma-2-9B-IT、Llama-3.1-8B-Instruct 等 4 个
    摘要KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。

    Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。

    深度解读完整解读
  7. 攻击arXiv 2609.36474

    FinRT:将自适应红队策略蒸馏为消费金融领域的可复用对抗生成器

    提出 FinRT,将消费金融自适应红队轨迹蒸馏为可复用对抗提示生成器

    发表
    攻击者
    黑盒
    被测模型
    Llama-3.3-70B、Llama-3.1-8B、Mixtral-8x7B 等 6 个
    摘要FinRT 用前向失效发现加校准代理 DPO,把消费金融红队收成单次前向生成器。

    FinRT 是面向消费金融的红队框架:先发现政策失效,再训练一个按政策、领域与目标行为出提示的生成器。

    深度解读完整解读
  8. 攻击arXiv 2609.28613

    研究:提示注入可改变 Jev 决策模型的行动概率

    测量间接提示注入对类型化概率决策的动作劫持

    发表
    被测模型
    jev-1.13.0
    摘要封闭动作集改变提示注入的表现,但没有去掉概率被不可信内容移动的风险。

    作者在 jev-1.13.0 上研究 decision hijacking:不可信内容能否在用户任务和可选动作都不变时,把类型化决策推向攻击者目标。

    深度解读完整解读
  9. 攻击arXiv 2609.27422

    RAMP:逆转对抗扰动以增强针对恶意软件检测器的干净标签后门攻击

    提出 RAMP,逆转对抗扰动加强恶意软件检测器的干净标签后门

    发表
    被测模型
    MalConv、MalConvGCG
    摘要RAMP 用反转扰动做 clean-label 投毒。

    RAMP 是 score-based black-box 下的 clean-label 后门增强,对象是会微调的 Windows PE 原始字节恶意软件检测器。

    深度解读完整解读