跳到正文
10月10日 · 周六

全部论文

找到 7 篇
筛选7
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 244 篇还没打标签,不在筛选结果里。

另有 244 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.05894

    研究者提出闭环偏见注入攻击

    提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见

    发表
    攻击者
    灰盒
    被测模型
    LLaDA-8B-Instruct、Dream-v0-Instruct-7B、LLaDA-MoE-7B-A1B-Instruct

    摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。

    深度解读完整解读
  2. 攻击arXiv 2610.03124

    研究提出 Untag 攻击框架,使开源大模型触发标签滥用检测机制失效

    提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测

    发表
    攻击者
    黑盒、白盒
    被测模型
    Llama2 (7B)、Llama3 (8B)、Qwen2.5 (7B)
    摘要作者用 UNTAG 评估 trigger-tag,认为其不能充当开放权重滥用检测的主要边界。

    UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。

    深度解读完整解读
  3. 攻击arXiv 2610.01062

    Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架

    提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱

    发表
    被测模型
    Qwen2.5-7B-Instruct、Gemma-2-9B-IT、Llama-3.1-8B-Instruct 等 4 个
    摘要KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。

    Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。

    深度解读完整解读
  4. 攻击arXiv 2609.10117

    研究揭示基于混淆的端侧 LLM 保护方案的安全边界

    提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型

    发表
    被测模型
    BERT-Base、ViT-Base、Qwen2.5-0.5B 等 4 个
    摘要Oprior 是四原语复合的安全边界,Collapse 利用列方向泄漏抽取替代模型,Oext 只被同一攻击评测。

    这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。

    深度解读完整解读
  5. 攻击arXiv 2605.30040

    研究揭示 LLM 按 token 计费可被服务商系统性虚报

    构造可通过计费审计的 token 虚报,使服务商系统性超收

    发表
    被测模型
    PALACE domain-adapted auditor
    摘要不诚实提供方可在三种 token 审计上虚报并通过检查,作者认为需改用提供方不控制的证据。

    不透明 LLM 的按 token 计费里,现有审计核验的是提供方可控的证据,不诚实提供方可以虚报并通过检查。。

    深度解读完整解读
  6. 攻击arXiv 2605.08513

    Apple 研究者发现抑制单个神经元即可绕过 LLM 安全对齐

    提出单神经元激活干预,抑制拒答神经元或放大概念神经元以绕过安全对齐

    发表
    攻击者
    白盒
    被测模型
    Qwen3-1.7B、Qwen3-4B、Qwen3-8B 等 11 个

    摘要作者称大模型安全由拒答门控与概念底座构成,干预单个神经元足以双向击穿对齐,且拒答神经元在预训练阶段已然存在。

    深度解读完整解读
已经到底了