跳到正文
10月10日 · 周六

全部论文

找到 19 篇

另有 241 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09981

    研究:LLM 路由决策日志可推断用户医疗、自伤等敏感话题

    提出利用路由元数据推断敏感话题的侧信道攻击

    发表
    被测模型
    RouteLLM (BERT router)、notdiamond-0001、Vela (vLLM Semantic Router)

    摘要论文揭示并测量了 LLM 路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。

    深度解读完整解读
  2. 攻击arXiv 2610.06848

    TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击

    提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员

    发表
    攻击者
    黑盒
    被测模型
    BERT (4.4M-340M)、ViT (22M-307M)、Pythia (70M-2.8B) 等 5 个

    摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。

    深度解读完整解读
  3. 攻击arXiv 2610.05894

    研究者提出闭环偏见注入攻击

    提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见

    发表
    攻击者
    灰盒
    被测模型
    LLaDA-8B-Instruct、Dream-v0-Instruct-7B、LLaDA-MoE-7B-A1B-Instruct

    摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。

    深度解读完整解读
  4. 防御arXiv 2610.04426

    UnAct:无需梯度的定向激活干预实现类别遗忘

    提出 UnAct,仅以前向激活干预从分类器中遗忘指定类别

    发表
    被测模型
    ResNet-18、ViT-B/16
    摘要UnAct 用前向激活做类别遗忘。

    UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。

    深度解读完整解读
  5. 分析与理论arXiv 2610.02504

    HXAI:分布式能源系统中的分层隐私保护可解释 AI 框架

    提出 HXAI 分层隐私解释框架,本地保留细解释并只发布加噪摘要

    发表
    被测模型
    gradient-boosted tree regression models
    摘要HXAI 把无噪声局部 SHAP 留在家庭内,只聚合差分隐私摘要。

    HXAI 是面向分布式能源系统的分层隐私保护解释框架,服务规划、监测与诊断,而不是实时控制。

    深度解读完整解读
  6. 可解释性arXiv 2609.07746

    LLM Forensics:用稀疏自编码器定位并控制后门触发机制

    用 SAE 定位后门触发机制并分离检测与因果控制

    发表
    被测模型
    Gaperon-1B、Gaperon-8B、Gaperon-24B
    摘要Gaperon 语言切换后门可分成检测、残差路由和后期语言跟踪三类 SAE 特征,只有部分能改行为。

    作者用稀疏自编码器分解 Gaperon 中无害的语言切换后门,区分识别触发的特征与真正能抑制或诱发该行为的特征。固定触发使英语提示在 Gaperon-1B 与 8B 上续写成法语或德语。

    深度解读完整解读
  7. 可解释性arXiv 2609.06934

    论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击

    解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练

    发表
    被测模型
    Qwen-2.5-7B、Qwen-2.5-7B-Instruct、Llama-3-8B 等 15 个

    摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。

    深度解读完整解读
  8. 攻击arXiv 2606.11817

    研究:语法约束解码可越狱 LLM 生成恶意代码,并提出 CodeShield 防御

    提出 CodeSpear 越狱,借语法约束解码生成恶意代码,并给出 CodeShield 防御

    发表
    攻击者
    黑盒
    被测模型
    Qwen2.5-Coder-7B、Qwen2.5-Coder-32B、Qwen2.5-7B 等 10 个

    摘要论文发现语法约束解码会破坏自然语言安全对齐,提出 CodeSpear 越狱攻击与基于蜜罐代码对齐的 CodeShield 防御。

    深度解读完整解读
  9. 攻击arXiv 2605.30040

    研究揭示 LLM 按 token 计费可被服务商系统性虚报

    构造可通过计费审计的 token 虚报,使服务商系统性超收

    发表
    被测模型
    PALACE domain-adapted auditor
    摘要不诚实提供方可在三种 token 审计上虚报并通过检查,作者认为需改用提供方不控制的证据。

    不透明 LLM 的按 token 计费里,现有审计核验的是提供方可控的证据,不诚实提供方可以虚报并通过检查。。

    深度解读完整解读
  10. 攻击arXiv 2605.08313

    研究者提出 SeedHijack 攻击,劫持 LLM 采样随机数种子

    提出 SeedHijack,劫持采样 PRNG 以强制选定 token

    发表
    被测模型
    GPT-2 (124M)、Qwen2-1.5B-Instruct、DeepSeek-R1-1.5B 等 5 个
    摘要采样层 PRNG 被替换以强制选 token。

    SeedHijack 把 LLM 采样用的 PRNG 输出换成攻击者选定的数,从而指定下一个 token。权重、输入和 logits 都不改。防御是用硬件 QRNG 替换该随机源。

    深度解读完整解读
  11. 攻击arXiv 2601.04261

    针对大语言模型后门指纹的抑制攻击

    提出 TFA 与 SVA,抑制 ensemble 后门指纹验证

    发表
    被测模型
    LLaMA2-7B、LLaMA3.1-8B-It、Qwen2.5-7B 等 11 个
    摘要两种 ensemble 攻击 TFA/SVA 抑制后门指纹。

    TFA 与 SVA 是针对后门式 LLM 指纹的 ensemble 抑制攻击,不改模型参数。所有者用 SFT 写入秘密对,只通过 API 验证版权。攻击者未授权取得模型,不知道触发和指纹,却要把每个模型的验证变成失败,同时让 ensemble 至少不差于性能最高的单模型。

    深度解读完整解读
已经到底了