跳到正文
10月10日 · 周六

全部论文

找到 26 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.07939

    CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出

    提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别

    发表
    被测模型
    C2P-CLIP、ForgeLens、D3-Im 等 10 个

    摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。

    深度解读完整解读
  2. 防御arXiv 2610.07532

    LADE:用暗知识中的模型无关潜在安全信号防御 LLM 越狱

    提出 LADE,用首 token 暗知识在生成前过滤越狱查询

    发表
    攻击者
    白盒
    被测模型
    Llama-2-7B-Chat、Llama-3-8B-Instruct、Qwen2-7B-Instruct 等 13 个
    摘要作者用 LADE 在生成前过滤有害查询,并称八个模型中六个的 Held-out 平均最好。

    LADE 是一种只读首 token 输出概率的防御,用来在生成前挡下可能引出有害回复的查询。

    深度解读完整解读
  3. 评测与基准arXiv 2610.06339

    BabelFake:面向多语言音视频 DeepFake 检测的基准数据集

    构建多语言音视频 DeepFake 基准 BabelFake 并评测检测器

    发表
    被测模型
    SpeechForensics、AVH-Align、(B)RAVEn
    摘要BabelFake 为五语同意采集基准。

    BabelFake 是经同意与 IRB 批准采集的多语音视频 DeepFake 检测基准,用来把视觉操纵和语音合成拆开比较。

    深度解读完整解读
  4. 评测与基准arXiv 2610.03470

    CorrectGuard 提出黑盒安全护栏的免查看正确性估计框架

    提出 CorrectGuard,在不可查看输入上估计黑盒护栏决策对错

    发表
    被测模型
    Granite Guardian 3.1 2B、Qwen3Guard 8B、GPT-OSS-Safeguard-20B 等 7 个
    摘要CorrectGuard 用外部模型估计黑盒护栏决策对错,排序和弃权可用,校准在偏移下变差。

    CorrectGuard 面向不能人工检查生产输入、也没有生产标签的黑盒安全护栏,用外部模型估计单条决策是否正确,并据此排序和弃权。离线基准会随数据和攻击变化,未必代表生产分布。隐私约束还可能禁止模型查看原文或可反演的稠密嵌入。

    深度解读完整解读
  5. 防御arXiv 2610.02853

    研究提出基于收缩约束状态空间模型的有界可达性与越狱检测方法

    提出收缩约束 SSM 安全头,认证嵌入扰动并检测越狱

    发表
    攻击者
    白盒、黑盒
    被测模型
    ToySSMClassifier、S4 safety head
    摘要收缩给出玩具 LTI 的有界认证。

    给 SSM 安全头一个收缩条件,并在越狱检测上使用收缩正则的 S4 头。。

    深度解读完整解读
  6. 防御arXiv 2610.00883

    DeBERTa-ConPara:面向部署的 AI 生成文本检测,推理端 Unicode 归一化提升对抗鲁棒性

    提出推理时 Unicode 归一化的检测器,识别遭字符级扰动的 AI 生成文本

    发表
    被测模型
    microsoft/deberta-v3-large、deberta-v3-base、bert-large-cased 等 4 个
    摘要推理时归一化消除两类 Unicode 攻击,训练时归一化则会删掉对抗监督。

    DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。

    深度解读完整解读
  7. 评测与基准arXiv 2609.36849

    研究评估 GradSafe 在多轮对话中的越狱检测脆弱性

    评测多轮对话中 GradSafe 越狱检测的可分性与脆弱性

    发表
    被测模型
    Llama 3.1 8B Instruct、Qwen2.5-7B-Instruct
    摘要CWS 显示不安全梯度在真实多轮流量中变弱,且随攻击族和模型而变。

    作者评估梯度越狱检测从单条提示词迁到多轮对话后还剩多少可分性,方法是用 Context Window Scanner 把 GradSafe 原封不动地套到用户轮窗口上。

    深度解读完整解读
  8. 防御arXiv 2609.36562

    ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害

    构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险

    发表
    被测模型
    ThinkingGuard(Qwen3-VL-8B-Instruct)
    摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。

    这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。

    深度解读完整解读
  9. 分析与理论arXiv 2609.36477

    研究发现护栏模型在基座模型不确定处过度自信

    诊断护栏相对基座在对抗提示上的置信失校

    发表
    被测模型
    Llama-Guard 7B、Llama-Guard-2 8B、Llama-Guard-3 8B 等 10 个
    摘要对抗包装使 guard 高置信漏检,而对应 base 在同一输入上常更不确定。

    诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。

    深度解读完整解读
  10. 评测与基准arXiv 2609.29429

    Jev 被用于零样本检测十类对齐失败,中位 AUROC 达 0.886

    提出 RLCDAlignBench,零样本检测多种对齐失败

    发表
    被测模型
    Jev (jev-1.13.0)
    摘要一次通用问题已能给多数对齐失败排序,大的误差来自状态和标签。

    RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。

    深度解读完整解读
  11. 防御arXiv 2609.21484

    HE-Guardrail:面向加密大模型推理的同态护栏防御越狱攻击

    提出 HE-Guardrail,在密文推理中评估越狱护栏并门控回复

    发表
    被测模型
    Llama-3-8B-Instruct、Llama Guard 3-8B
    摘要密文护栏门控 HE-LLM 回复。

    把越狱护栏装进同态加密 LLM 推理:服务器不解密,也能按安全决策决定客户端看到目标回复还是拒绝回复。

    深度解读完整解读
  12. 防御arXiv 2609.10613

    后验重加权框架解释并缓解多模态大模型上下文越狱

    用后验重加权解释多模态上下文越狱,并提出风险门控的良性示例注入防御

    发表
    被测模型
    Qwen3-VL-2B、Qwen3-VL-4B、Qwen3-VL-8B 等 8 个
    摘要后验重加权解释上下文越狱的缩放,并支持风险门控的良性示例防御。

    Zhang 等把多模态 ICL 越狱写成对齐模型在安全与有害隐模式之间的推理时后验漂移,并据此做风险门控防御。

    深度解读完整解读
  13. 防御arXiv 2609.05797

    论文发现安全监控器主要拦截模型本就会拒答的请求

    评估安全监视器并提出双侧梯级微调以减少会答有害请求的漏检

    发表
    被测模型
    Gemma-4-31B-IT、Qwen3-32B、Llama Guard 3 8B 等 6 个

    摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。

    深度解读完整解读
  14. 防御arXiv 2609.01046

    HiveTraceGuard-Pro:面向提示注入、越狱与对抗混淆的紧凑生成式护栏

    提出生成式护栏 HiveTraceGuard-Pro,检测提示注入、越狱与混淆

    发表
    被测模型
    HiveTraceGuard-Pro (0.6B)
    摘要0.6B 俄英护栏在自建俄语干净集和 PI-RU 上得分最高,聚合 key 居第三,过阻断和回复精度仍是作者标出的短板。

    HiveTraceGuard-Pro 是面向请求与回复审核的 0.6B 生成式护栏,由 Qwen3-0.6B 经 LoRA 微调,在俄语和英语上训练,只输出一个 safe/unsafe 裁决。

    深度解读完整解读