跳到正文
10月10日 · 周六

全部论文

找到 19 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.05401

    AVCE:面向扩散模型可验证概念擦除的审计感知遗忘框架

    提出审计感知遗忘框架 AVCE,从文本与视觉通路擦除扩散模型概念

    发表
    攻击者
    白盒、黑盒
    被测模型
    Stable Diffusion XL (SDXL)、Stable Diffusion v1.5 (SD v1.5)、Flux 1.0
    摘要AVCE 在审计锚点上改两条注意力通路。

    AVCE 是面向扩散模型的概念擦除方法,要让擦除经得起绕过文本条件的潜空间审计,而不只是挡住对抗提示词。

    深度解读完整解读
  2. 防御arXiv 2610.03980

    FADE:面向视频扩散模型的帧感知多概念擦除框架

    提出 FADE,对文生视频模型做帧感知多概念擦除

    发表
    被测模型
    Wan2.1-T2V-1.3B、Wan2.1-T2V-14B、CogVideoX-2B 等 4 个
    摘要FADE 用闭式编辑、帧感知适配器和软路由,在单骨干上擦除多概念并压低逐帧残差。

    FADE 是面向文生视频扩散 Transformer 的多概念遗忘方法,用来抑制指定物体、画风、裸体、暴力、仇恨和名人身份,并尽量保持其他生成。作者要处理两件事。与帧无关的抑制会让概念在少数帧重现,片段均值会掩盖这一失败。

    深度解读完整解读
  3. 防御arXiv 2610.02413

    研究:分类后缀可提升激活探针的分布外恶意输入检测

    用分类后缀提升激活探针对分布外恶意输入的检测

    发表
    被测模型
    Llama-3.1-8B、Qwen3.5-9B、Gemma-4-12B
    摘要作者称排序增益来自分类格式,低 FPR 精度来自点名准则。

    用户轮后的分类后缀,被作者用作激活探针的分布外检测干预:排序看格式,低 FPR 精度看是否点名恶意/良性。

    深度解读完整解读
  4. 防御arXiv 2609.39548

    NDDL:用正常扩散动力学为文生图模型做后门防御

    提出 NDDL,用良性扩散轨迹检测文生图后门提示并定位触发 token

    发表
    被测模型
    Stable Diffusion v1.5、Stable Diffusion XL、Stable Diffusion v3.5 等 4 个
    摘要NDDL 从良性扩散轨迹学习正常转移,用动态不一致检测后门并定位触发 token。

    NDDL 是面向文生图扩散模型的后门防御:防御者只有白盒模型访问和良性提示词,没有后门先验,需要区分后门提示词并找出触发 token。

    深度解读完整解读
  5. 防御arXiv 2609.30841

    为何扩散语言模型的越狱会成功:能量景观分析

    用能量势垒信号检测扩散语言模型的越狱

    发表
    被测模型
    LLaDA-8B-Instruct、LLaDA-1.5、Dream-v0-Instruct-7B 等 4 个
    摘要能量势垒把 dLLM 越狱分成掩盖初始状态或中途越垒,三个 logit 信号据此互补检测。

    Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。

    深度解读完整解读
  6. 防御arXiv 2609.22724

    MATE:面向移动 Agent 的策略感知安全审计方法

    提出移动 Agent 轨迹审计器 MATE,判断轨迹是否违反可编辑安全策略

    发表
    攻击者
    黑盒
    被测模型
    MATE-0.5B、MATE-1.5B、MATE-3B
    摘要MATE 用合成轨迹微调轻量审计器,在可编辑策略下判断移动智能体轨迹是否违规并给出解释。

    MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。

    深度解读完整解读
  7. 防御arXiv 2609.03629

    EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除

    提出 EraseSAE,在文生视频模型中局部擦除指定概念

    发表
    被测模型
    CogVideoX-5B、HunyuanVideo、Flux.1 [dev]
    摘要EraseSAE 用单义特征局部擦除。

    EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。

    深度解读完整解读
  8. 防御arXiv 2608.21101

    ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关

    提出 ClawSentry 多层监控网关,在技能准入和运行时拦截恶意技能与隐藏指令

    发表
    被测模型
    Codex/GPT-5.4、Codex/GPT-5.5、Claude Code/GLM-5.1 等 6 个
    摘要ClawSentry 用包准入、三级运行时门控和反绕过,压低 skill 攻击并保住干净任务。

    ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。

    深度解读完整解读
  9. 防御arXiv 2606.22673

    Agent MechSuits:面向多轮 CLI Agent 的机制子空间安全引导

    提出 Agent MechSuits,对多轮 CLI Agent 做步级检测与子空间转向

    发表
    被测模型
    LLaMA-3.1-8B、Qwen-2.5-7B、Gemma-2-9B
    摘要白盒步级探针加稀疏转向可压低三模型恶意动作,同时提高生成崩溃率。

    Agent MechSuits 是面向多轮 CLI 智能体的白盒、步级表示防御,并配有可执行轨迹基准 MAS。

    深度解读完整解读
  10. 防御arXiv 2604.11806

    Meerkat:跨大量 Agent 轨迹检测安全违规

    提出 Meerkat,聚类并搜索 Agent 轨迹库以定位跨轨迹安全违规

    发表
    场景
    AI Agent
    被测模型
    GPT-5.4、GPT-5.4-mini、Qwen3.5-397B-A17B 等 5 个
    摘要Meerkat 用聚类与智能体搜索定位跨轨迹违规,并在真实评测轨迹中找出脚手架泄题与奖励黑客。

    Meerkat 是事后审计方法,用来在智能体轨迹仓库里找出单条看不出、合在一起才违反自然语言安全属性的见证。

    深度解读完整解读
  11. 防御arXiv 2505.23559

    SafeScientist:让 LLM 智能体的科学发现具备风险意识

    提出 SafeScientist 四层监控,阻止科研智能体执行高风险或不伦理任务

    发表
    被测模型
    GPT-4o、GPT-4.1、GPT-3.5-turbo 等 5 个
    摘要四层监控加科研安全基准。

    SafeScientist 是带四层监控的科研智能体框架,并用 SciSafetyBench 评测科学场景中的任务安全。

    深度解读完整解读
已经到底了