跳到正文
10月10日 · 周六

全部论文

找到 196 篇

另有 196 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.11766

    研究提出意图恢复率作为 LLM 安全评测的补充指标

    提出 IRIS,用意图恢复率区分遮蔽越狱下无害输出的原因

    发表
    被测模型
    GPT-4o、Claude Sonnet 4.5、Claude Opus 4.5 等 6 个
    摘要无害输出的证据权重取决于任务是否被恢复。

    IRIS 把意图恢复当作中间信号,用来解释意图遮蔽提示下为何没有出现有害协助。

    深度解读完整解读
  2. 评测与基准arXiv 2610.11112

    EpiReal-Bench:商用图像生成模型虚假声明红队基准

    构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据

    发表
    攻击者
    黑盒
    被测模型
    GPT-Image-2、Nano Banana 2、Grok Imagen 2.0 等 4 个
    摘要四款商用图像模型能把假主张画成可信证据。

    EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。

    深度解读完整解读
  3. 防御arXiv 2610.11005

    研究:叙事包装可跨语言绕过 LLM 拒答

    提出 GUISE 基准与 AXIS 训练,防御叙事包装越狱

    发表
    被测模型
    Qwen3-1.7B、Qwen3-4B、GLM-4-9B
    摘要GUISE 分开测包装与语域。

    作者测量叙事包装下的拒答失效,并训练一个在未见包装上拒绝、同时仍回答同风格良性请求的适配器。问题是:安全对齐模型拒绝直说的有害请求,却回答嵌进角色或叙事里的同一请求。文言文被用来把语域和包装拆开。

    深度解读完整解读
  4. 评测与基准arXiv 2610.10276

    PatchBench 提出激活补丁局部评测协议,揭示越狱修复的附带损伤

    提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤

    发表
    被测模型
    Qwen2.5-3B-Instruct、Qwen2.5-14B-Instruct、gemma-3-4b-it 等 8 个

    摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。

    深度解读完整解读
  5. 防御arXiv 2610.09703

    研究揭示 Token-Pruning 对 VLM 安全性的影响并提出 SAP 缓解机制

    提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱

    发表
    攻击者
    黑盒
    被测模型
    LLaVA-1.5-7B
    摘要剪枝去掉背景 token 后注意力塌向恶意前景。

    这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。

    深度解读完整解读
  6. 评测与基准arXiv 2610.09033

    研究发布 ASRD 数据集,评测五款开源模型在非规范输入下的安全表现

    发表
    被测模型
    Gemma 2 9B、Gemma 3 4B、Llama 3.1 8B 等 6 个
    摘要五模型、七族表面形式的四态评测里,低有害遵从不等于读懂后的安全处理。

    ASRD 用四态标签检查五个开源模型如何处理非规范表面上的有害请求。

    深度解读完整解读
  7. 防御arXiv 2610.08316

    MARCO:面向蛋白质生成模型的放射性水印框架

    提出 MARCO 放射性水印,冻结蛋白质生成模型并在去噪时嵌入签名

    发表
    攻击者
    黑盒
    被测模型
    RFdiffusion、ESMFold、Chroma 等 6 个
    摘要MARCO 在冻结的 PGM 上去噪时嵌构象水印,作者称能兼顾保真与抗扰动,并使盗版模型继承水印。

    MARCO 是加在蛋白质生成模型推理过程上的构象水印,用来标记知识产权,并为可能的生物安全滥用保留可追溯信号。作者还把它说成数字权利管理工具,以及符合生物武器公约的数字监管链。问题在于:专有 PGM 的三维输出可能被拿去训练盗版模型,也可能在来源被抹掉后绕过筛查。

    深度解读完整解读
  8. 防御arXiv 2610.07532

    LADE:用暗知识中的模型无关潜在安全信号防御 LLM 越狱

    提出 LADE,用首 token 暗知识在生成前过滤越狱查询

    发表
    攻击者
    白盒
    被测模型
    Llama-2-7B-Chat、Llama-3-8B-Instruct、Qwen2-7B-Instruct 等 13 个
    摘要作者用 LADE 在生成前过滤有害查询,并称八个模型中六个的 Held-out 平均最好。

    LADE 是一种只读首 token 输出概率的防御,用来在生成前挡下可能引出有害回复的查询。

    深度解读完整解读
  9. 攻击arXiv 2610.06848

    TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击

    提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员

    发表
    攻击者
    黑盒
    被测模型
    BERT (4.4M-340M)、ViT (22M-307M)、Pythia (70M-2.8B) 等 5 个

    摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。

    深度解读完整解读
  10. 攻击arXiv 2610.06670

    研究者提出 Reward Stealing Attack,从对齐模型行为反推安全奖励实施攻击

    提出 ReSA,从对齐模型行为恢复安全奖励并在解码时反转

    发表
    攻击者
    白盒、灰盒
    被测模型
    Llama3.1-8B-Instruct、Gemma-7B-Instruct、Qwen2.5-7B-Instruct 等 9 个
    摘要ReSA 用最大熵 IRL 从对齐模型行为恢复代理安全奖励,并在解码时反转以诱导有害输出。

    ReSA 是一种对抗攻击:从对齐模型的可观察行为恢复代理安全奖励,再在解码时把该奖励反过来用。。

    深度解读完整解读
  11. 防御arXiv 2610.06636

    差分隐私混合公共数据集提升隐私学习效果

    提出 DP-MixMin,私有学习公开数据混合并做差分隐私微调

    发表
    被测模型
    ResNet-18、GPT-2 Medium
    摘要DP-MixMin 私下学公开混合再 DP 微调,胸片 macro AUC 与邮件困惑度优于均匀混合。

    DP-MixMin 是一条端到端的差分隐私训练流程:先私下决定多个公开数据集的预训练混合,再预训练并在敏感数据上 DP 微调。作者称这是首个这样的流程。

    深度解读完整解读
  12. 攻击arXiv 2610.06093

    研究评测训练数据提取风险的跨语言迁移

    用翻译前缀做跨语言训练数据提取,恢复英语训练文本中的 PII

    发表
    被测模型
    GPT-Neo 1.3B、GPT-Neo 2.7B、GPT-J 6B 等 7 个
    摘要跨语言 TDE 能恢复英语记忆的 PII,转移随多语训练和措辞保真变化。

    这篇工作检验训练数据抽取是否跨语言:英语段落里记住的 PII,能否被其他语言的前缀逐字抽出。

    深度解读完整解读
  13. 攻击arXiv 2610.05601

    Tracer 框架可从遗忘后的扩散模型中识别被擦除概念

    提出 TRACER,从权重差识别扩散模型被擦除概念

    发表
    攻击者
    白盒
    被测模型
    Stable Diffusion v1.5、Stable Diffusion 3、FLUX.1 等 5 个
    摘要TRACER 用权重足迹识别未披露擦除概念并估计个数,作者称数秒内完成且准确率高于对照。

    TRACER 针对的是遗忘扩散模型上的目标识别:提供者从公开基座 W 用已发表方法擦掉未知集合 S⋆,只发布 W′。攻击者还有假定包含这些概念的词表,但不知擦了谁、擦了几个、用了什么算法。

    深度解读完整解读
  14. 防御arXiv 2610.05401

    AVCE:面向扩散模型可验证概念擦除的审计感知遗忘框架

    提出审计感知遗忘框架 AVCE,从文本与视觉通路擦除扩散模型概念

    发表
    攻击者
    白盒、黑盒
    被测模型
    Stable Diffusion XL (SDXL)、Stable Diffusion v1.5 (SD v1.5)、Flux 1.0
    摘要AVCE 在审计锚点上改两条注意力通路。

    AVCE 是面向扩散模型的概念擦除方法,要让擦除经得起绕过文本条件的潜空间审计,而不只是挡住对抗提示词。

    深度解读完整解读
  15. 防御arXiv 2610.05346

    研究者提出序列马赛克攻击并给出防御理论

    形式化 watchman 防御以阻止序贯马赛克攻击

    发表
    被测模型
    Qwen3.6-35B-A3B、Gemma-4-26B-A4B-it、DeepSeek-V2-Lite (16B-A2.4B)
    摘要watchman 理论给出零失败且有用的条件。

    这篇工作同时给出序贯马赛克防御的博弈理论,以及冻结 LLM 上的分角色自博弈训练。

    深度解读完整解读
  16. 防御arXiv 2610.07023

    SSRFT:以安全角色内化替代拒答模式的 LLM 安全对齐框架

    提出 SSRFT,用角色监督内化安全原则以替代拒答式对齐

    发表
    被测模型
    Qwen2.5-3B、Gemma2-2B、Llama3.1-8B 等 6 个
    摘要SSRFT 用角色监督替代拒答中心对齐。

    SSRFT是一种用监督微调把预定义安全角色写进参数的安全对齐方法。作者称它是首个以安全角色内化本身为对齐目标的框架。

    深度解读完整解读