跳到正文
10月10日 · 周六

全部论文

找到 7 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.03980

    FADE:面向视频扩散模型的帧感知多概念擦除框架

    提出 FADE,对文生视频模型做帧感知多概念擦除

    发表
    被测模型
    Wan2.1-T2V-1.3B、Wan2.1-T2V-14B、CogVideoX-2B 等 4 个
    摘要FADE 用闭式编辑、帧感知适配器和软路由,在单骨干上擦除多概念并压低逐帧残差。

    FADE 是面向文生视频扩散 Transformer 的多概念遗忘方法,用来抑制指定物体、画风、裸体、暴力、仇恨和名人身份,并尽量保持其他生成。作者要处理两件事。与帧无关的抑制会让概念在少数帧重现,片段均值会掩盖这一失败。

    深度解读完整解读
  2. 防御arXiv 2610.03434

    Persona Guardrail:面向智能体系统的生产级防御框架

    提出 Persona Guardrail,强制客服智能体守住功能边界

    发表
    场景
    AI Agent
    攻击者
    黑盒
    被测模型
    Qwen3-30B-A3B、Qwen3-VL-30B、Qwen3-8B 等 5 个
    摘要Persona Guardrail 用功能边界做同步输入输出校验,并在 PAGE 与生产延迟预算下给出评测。

    Persona Guardrail 是客服向智能体的同步运行时防御:先写明功能边界,再决定放行或拦截,而不是只检测某一攻击类。

    深度解读完整解读
  3. 防御arXiv 2609.19325

    AUDITPLAN:先提交安全计划再作答的可审计安全对齐方法

    提出 AUDIT PLAN 先计划后作答,并用 FAITHGATE 绑定答案奖励与计划正确性

    发表
    被测模型
    Qwen2.5-1.5B-Instruct、Qwen2.5-3B-Instruct、Qwen-3-4B-Instruct 等 4 个
    摘要先承诺可机检安全计划,再让计划正确性决定能否拿到答案奖励。

    AUDIT PLAN 把安全对齐从“只优化最终答案”改成“先提交隐藏的结构化安全计划,再按该计划作答”,并用 FAITHGATE 把高答案奖励限定在计划正确时。

    深度解读完整解读
  4. 防御arXiv 2609.03629

    EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除

    提出 EraseSAE,在文生视频模型中局部擦除指定概念

    发表
    被测模型
    CogVideoX-5B、HunyuanVideo、Flux.1 [dev]
    摘要EraseSAE 用单义特征局部擦除。

    EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。

    深度解读完整解读
  5. 评测与基准arXiv 2608.20554

    aiXamine:跨维度评测 LLM 安全、安全(security)与隐私权衡

    提出 aiXamine 黑盒基准,统一评测 LLM 安全、稳健与隐私权衡

    发表
    被测模型
    openai/gpt-5-mini、openai/gpt-4o、anthropic/claude-haiku-4.5 等 15 个
    摘要aiXamine 用九服务黑盒协议比较百余个模型,作者称单轴信任度进展可能削弱其他轴。

    aiXamine 是一套黑盒评测协议,用来在同一条件下比较 LLM 的 safety、security 与 privacy,而不是再产出一个能力分。

    深度解读完整解读
  6. 防御arXiv 2312.06632

    用智能体控制化学科学中的 AI 风险:SciGuard 护栏与 SciMT 基准

    提出 SciGuard 外部护栏与 SciMT 基准,控制化学科学 AI 误用

    发表
    被测模型
    SciGuard (GPT-4)、SciGuard (Gemini)、SciGuard (Mixtral) 等 5 个
    摘要SciGuard 以外部智能体控制化学 AI 误用。

    这篇工作把化学科学 AI 的误用控制做成外部智能体,而不是改模型权重。作者担心合成规划、毒性预测和科学语言模型被用来获取有害物质信息、规避监管或传播危险知识,同时合法工业用途又不能靠一律拒绝来处理。SciGuard 由 LLM 担任中介,把原则和指南放进短期记忆,把分子库、危害库、法规和交互历史放进可检索的长期记忆,再按 Chain of Thought 调用 Chemprop、LocalRetro 等工具,或用 RAG 补法规片段,最后回答、追问或拒绝。

    深度解读完整解读
已经到底了