跳到正文
10月10日 · 周六

全部论文

找到 52 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.09703

    研究揭示 Token-Pruning 对 VLM 安全性的影响并提出 SAP 缓解机制

    提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱

    发表
    攻击者
    黑盒
    被测模型
    LLaVA-1.5-7B
    摘要剪枝去掉背景 token 后注意力塌向恶意前景。

    这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。

    深度解读完整解读
  2. 防御arXiv 2610.07532

    LADE:用暗知识中的模型无关潜在安全信号防御 LLM 越狱

    提出 LADE,用首 token 暗知识在生成前过滤越狱查询

    发表
    攻击者
    白盒
    被测模型
    Llama-2-7B-Chat、Llama-3-8B-Instruct、Qwen2-7B-Instruct 等 13 个
    摘要作者用 LADE 在生成前过滤有害查询,并称八个模型中六个的 Held-out 平均最好。

    LADE 是一种只读首 token 输出概率的防御,用来在生成前挡下可能引出有害回复的查询。

    深度解读完整解读
  3. 防御arXiv 2610.06383

    基于影响力的曲率感知数据加权激活引导方法

    提出曲率感知数据加权的激活转向方法,用于毒性抑制与概念控制

    发表
    被测模型
    Gemma-2-2B、Llama-3.2-3B
    摘要影响加权传输压低毒性率,闭式 IF-Act 常换来更高困惑度与更低 MMLU。

    推理时的影响加权激活传输,用曲率修正的样本权重替换传输转向里的均匀类均值。要做的是概念控制,而不是再训练。作者认为类均值被无关概念、噪声和少数 token 主导,编码的是词元级而非主题。

    深度解读完整解读
  4. 防御arXiv 2610.04967

    One Token Can Be Enough:用 Prefix Steering 连接提示与激活引导

    提出 Prefix Steering,以短前缀激活引导控制行为并保住能力

    发表
    被测模型
    OLMo 3 7B、OLMo 3 32B、Qwen3 1.7B 等 4 个
    摘要短前缀 steering 用已有方向做短暂干预。

    本文用注意力层匹配连接提示词与激活干预,并把干预改成从末提示词 token 开始的短前缀。

    深度解读完整解读
  5. 防御arXiv 2610.03073

    SecJev:为 System One 决策模型引入安全专业知识

    提出 SecJev,用场景加权训练把决策模型适配为安全类型化判断

    发表
    被测模型
    SecJev-0.8B、SecJev-2B、SecJev-4B 等 4 个
    摘要SecJev 用共享打分器做安全决策,0.8B 的 task-macro 超过 Kev-9B。

    SecJev 是 0.8B 到 9B 的安全决策模型族,作者称据其所知是首个面向安全的 Jev-like 家族。

    深度解读完整解读
  6. 防御arXiv 2610.02853

    研究提出基于收缩约束状态空间模型的有界可达性与越狱检测方法

    提出收缩约束 SSM 安全头,认证嵌入扰动并检测越狱

    发表
    攻击者
    白盒、黑盒
    被测模型
    ToySSMClassifier、S4 safety head
    摘要收缩给出玩具 LTI 的有界认证。

    给 SSM 安全头一个收缩条件,并在越狱检测上使用收缩正则的 S4 头。。

    深度解读完整解读
  7. 防御arXiv 2610.02844

    DNAlign:面向 LLM 的动态零空间安全对齐框架

    提出 DNAlign,在不改权重的推理期用零空间约束控制信号做安全对齐

    发表
    被测模型
    Vicuna-7B、Qwen-7B
    摘要DNAlign 用零空间约束的推理期控制做安全对齐,Table I 平均奖励高于所列基线。

    DNAlign 是一个不改 LLM 参数的安全对齐框架,用来在推理时压低有害输出,并减少对中性知识所支持的流畅、事实回答的改动。

    深度解读完整解读
  8. 防御arXiv 2610.01969

    RASteer:面向扩散模型概念擦除的保留感知激活引导方法

    提出 RASteer,推理时按保留子空间校正激活以擦除文生图目标概念

    发表
    被测模型
    Stable Diffusion v1.4、Stable Diffusion v1.5、Stable Diffusion v2.1 等 4 个
    摘要RASteer 用保留子空间校正擦除方向,在固定权重下同时压低目标并保住保留概念。

    Retain-aware Activation Steering(RASteer) 是一种不改权重的推理时概念擦除方法,用于文生图扩散模型去掉指定概念并减少对保留概念的误伤。

    深度解读完整解读
  9. 防御arXiv 2610.01170

    HeadEdit:通过冻结的 unembedding 矩阵校准语言模型行为

    提出 HeadEdit,经冻结 unembedding 做随输入变化的 logit 校正

    发表
    被测模型
    Qwen3-4B、Gemma-3-4B-IT、Llama-3.2-3B-Instruct 等 4 个
    摘要低秩 unembedding 校正抬高九个设置的总体准确率,并可部分预测 DPO 更新。

    HeadEdit 是一种不更新参数的行为校准方法,作用点是冻结的 unembedding,而不是中间层残差或新的梯度优化。

    深度解读完整解读
  10. 防御arXiv 2610.00883

    DeBERTa-ConPara:面向部署的 AI 生成文本检测,推理端 Unicode 归一化提升对抗鲁棒性

    提出推理时 Unicode 归一化的检测器,识别遭字符级扰动的 AI 生成文本

    发表
    被测模型
    microsoft/deberta-v3-large、deberta-v3-base、bert-large-cased 等 4 个
    摘要推理时归一化消除两类 Unicode 攻击,训练时归一化则会删掉对抗监督。

    DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。

    深度解读完整解读
  11. 防御arXiv 2609.39107

    MASCRDM:面向大语言模型训练过程的合规风险检测与缓解多智能体系统

    提出 MASCRDM,在监督微调中实时检测并缓解偏见

    发表
    被测模型
    Qwen3-8B-Base、Llama-3.1-8B
    摘要MASCRDM 在 SFT 中按法规图谱检测数据、结构与损失风险,BBQ 总准确率在两模型上最高。

    MASCRDM 把 AI 法律规章编成知识图谱,再由五个智能体在 LLM 训练中做实时合规检测与缓解,实验以偏见与歧视为代表风险。

    深度解读完整解读
  12. 防御arXiv 2609.37568

    SECRET:用源条件化中继引导缓解音视频大语言模型的幻觉

    提出训练无关的 SECRET,对问题表征做源条件转向以缓解音视频模型幻觉

    发表
    被测模型
    VideoLLaMA2-AV-7B、Qwen2.5-Omni-7B、Qwen3-Omni-30B-A3B
    摘要SECRET 在问题状态上做源条件转向,三个 AVLLM 上减轻了跨模态接地幻觉。

    SECRET 是一种训练无关的问题状态转向方法,用来减轻 AVLLM 的 source-confused grounding hallucination。

    深度解读完整解读
  13. 防御arXiv 2609.36562

    ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害

    构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险

    发表
    被测模型
    ThinkingGuard(Qwen3-VL-8B-Instruct)
    摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。

    这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。

    深度解读完整解读