跳到正文
10月10日 · 周六

全部论文

找到 18 篇

另有 196 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.07774

    研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器

    AI 导读研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。

    发表
    被测模型
    Qwen3-VL-30B-A3B-Instruct、Kimi-VL-A3B-Instruct
    摘要读出而非操纵 router logits,可在不改模型的情况下降低两模型的组合式安全错误。

    作者在两个指令微调 MoE VLM 上比较改模型与读路由。组合式风险按 HoliSafe 分成五类:图文各自可安全,合在一起才不安全,或不安全内容只在图像里。

    深度解读完整解读
  2. 防御arXiv 2610.02413

    研究:分类后缀可提升激活探针的分布外恶意输入检测

    用分类后缀提升激活探针对分布外恶意输入的检测

    发表
    被测模型
    Llama-3.1-8B、Qwen3.5-9B、Gemma-4-12B
    摘要作者称排序增益来自分类格式,低 FPR 精度来自点名准则。

    用户轮后的分类后缀,被作者用作激活探针的分布外检测干预:排序看格式,低 FPR 精度看是否点名恶意/良性。

    深度解读完整解读
  3. 防御arXiv 2609.38645

    用探针引导微调对齐模型且不损失可监控性

    用持续更新的探针做微调,降低有害性并保持线性可监测性

    发表
    被测模型
    Mistral 7B Instruct v0.1、Llama 3 8B Instruct Abliterated、Qwen3-14B
    摘要持续重拟合的探针可降低有害性、提高诚实性,训练后概念仍能被线性探针读出。

    Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。

    深度解读完整解读
  4. 防御arXiv 2609.30841

    为何扩散语言模型的越狱会成功:能量景观分析

    用能量势垒信号检测扩散语言模型的越狱

    发表
    被测模型
    LLaDA-8B-Instruct、LLaDA-1.5、Dream-v0-Instruct-7B 等 4 个
    摘要能量势垒把 dLLM 越狱分成掩盖初始状态或中途越垒,三个 logit 信号据此互补检测。

    Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。

    深度解读完整解读
  5. 防御arXiv 2609.22724

    MATE:面向移动 Agent 的策略感知安全审计方法

    提出移动 Agent 轨迹审计器 MATE,判断轨迹是否违反可编辑安全策略

    发表
    攻击者
    黑盒
    被测模型
    MATE-0.5B、MATE-1.5B、MATE-3B
    摘要MATE 用合成轨迹微调轻量审计器,在可编辑策略下判断移动智能体轨迹是否违规并给出解释。

    MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。

    深度解读完整解读
  6. 防御arXiv 2609.21996

    PIR:从模型内部激活读出被隐藏的答案

    提出免参考探测 PIR,从激活读出被隐瞒答案并区分擦除

    发表
    被测模型
    gemma-2-9b、gemma-3-12b、Qwen2.5-7B 等 9 个

    摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。

    深度解读完整解读
  7. 防御arXiv 2609.05797

    论文发现安全监控器主要拦截模型本就会拒答的请求

    评估安全监视器并提出双侧梯级微调以减少会答有害请求的漏检

    发表
    被测模型
    Gemma-4-31B-IT、Qwen3-32B、Llama Guard 3 8B 等 6 个

    摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。

    深度解读完整解读
  8. 防御arXiv 2609.04665

    HackProbe:面向自演化语言模型奖励作弊的黑盒检测与免疫方法

    提出 HackProbe,黑盒检测并免疫自演化中的奖励作弊

    发表
    摘要黑盒探针检测自演化奖励黑客,并以带宽受限重选回收真实能力。

    HackProbe 是挂在自演化循环上的黑盒监控器,用来发现奖励黑客并改选候选。

    深度解读完整解读
  9. 防御arXiv 2608.05578

    AMS 工具通过激活分析检测语言模型的安全训练改动

    提出 AMS,用激活分离与方向相似度检测安全训练改动

    发表
    被测模型
    Llama-3.1-8B-Instruct、Llama-3.2-3B-Instruct、Llama-3.2-1B-Instruct 等 14 个
    摘要AMS 按激活签名把安全改动分四类,前三类可由两级扫描覆盖,行为微调会漏。

    AMS 是面向开放权重模型、部署前使用的激活扫描器,用来看安全训练被拿掉或改写之后,激活空间里还留着什么几何痕迹。

    深度解读完整解读
  10. 防御arXiv 2607.14737

    GeoDetect:面向视觉语言预训练模型的几何对抗检测方法

    提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本

    发表
    攻击者
    白盒
    被测模型
    CLIPViT (ViT-B/16)、CLIPCNN (ResNet-50)、ALBEF 等 4 个
    摘要GeoDetect 用几何分数检测 VLP 对抗样本。

    GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。

    深度解读完整解读
  11. 防御arXiv 2505.23559

    SafeScientist:让 LLM 智能体的科学发现具备风险意识

    提出 SafeScientist 四层监控,阻止科研智能体执行高风险或不伦理任务

    发表
    被测模型
    GPT-4o、GPT-4.1、GPT-3.5-turbo 等 5 个
    摘要四层监控加科研安全基准。

    SafeScientist 是带四层监控的科研智能体框架,并用 SciSafetyBench 评测科学场景中的任务安全。

    深度解读完整解读
已经到底了