跳到正文
10月10日 · 周六

全部论文

找到 77 篇

另有 374 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.10276

    PatchBench 提出激活补丁局部评测协议,揭示越狱修复的附带损伤

    提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤

    发表
    被测模型
    Qwen2.5-3B-Instruct、Qwen2.5-14B-Instruct、gemma-3-4b-it 等 8 个

    摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。

    深度解读完整解读
  2. 防御arXiv 2610.09703

    研究揭示 Token-Pruning 对 VLM 安全性的影响并提出 SAP 缓解机制

    提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱

    发表
    攻击者
    黑盒
    被测模型
    LLaVA-1.5-7B
    摘要剪枝去掉背景 token 后注意力塌向恶意前景。

    这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。

    深度解读完整解读
  3. 攻击arXiv 2610.10612

    PyCache Trap 利用 Python 缓存替换绕过七款 Agent Skill 扫描器

    提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器

    发表
    被测模型
    CISCO、HSS、AUDITOR 等 8 个
    摘要论文剖析智能体技能审查与执行脱节盲区,提出 PyCache Trap 攻击并构建基于可信复现的 EAV 防御。

    这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。

    深度解读完整解读
  4. 可解释性arXiv 2610.08559

    研究:LLM 潜在空间去偏方向主要编码置信度而非公平性

    分析 LLM 去偏激活方向,发现其编码置信度而非公平性

    发表
    被测模型
    Llama-3.1-8B、Llama-3.1-8B-Instruct、Falcon3-7B-Base 等 8 个

    摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。

    深度解读完整解读
  5. 评测与基准arXiv 2610.07939

    CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出

    提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别

    发表
    被测模型
    C2P-CLIP、ForgeLens、D3-Im 等 10 个

    摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。

    深度解读完整解读
  6. 防御arXiv 2610.07532

    LADE:用暗知识中的模型无关潜在安全信号防御 LLM 越狱

    提出 LADE,用首 token 暗知识在生成前过滤越狱查询

    发表
    攻击者
    白盒
    被测模型
    Llama-2-7B-Chat、Llama-3-8B-Instruct、Qwen2-7B-Instruct 等 13 个
    摘要作者用 LADE 在生成前过滤有害查询,并称八个模型中六个的 Held-out 平均最好。

    LADE 是一种只读首 token 输出概率的防御,用来在生成前挡下可能引出有害回复的查询。

    深度解读完整解读
  7. 防御arXiv 2610.06383

    基于影响力的曲率感知数据加权激活引导方法

    提出曲率感知数据加权的激活转向方法,用于毒性抑制与概念控制

    发表
    被测模型
    Gemma-2-2B、Llama-3.2-3B
    摘要影响加权传输压低毒性率,闭式 IF-Act 常换来更高困惑度与更低 MMLU。

    推理时的影响加权激活传输,用曲率修正的样本权重替换传输转向里的均匀类均值。要做的是概念控制,而不是再训练。作者认为类均值被无关概念、噪声和少数 token 主导,编码的是词元级而非主题。

    深度解读完整解读
  8. 评测与基准arXiv 2610.06339

    BabelFake:面向多语言音视频 DeepFake 检测的基准数据集

    构建多语言音视频 DeepFake 基准 BabelFake 并评测检测器

    发表
    被测模型
    SpeechForensics、AVH-Align、(B)RAVEn
    摘要BabelFake 为五语同意采集基准。

    BabelFake 是经同意与 IRB 批准采集的多语音视频 DeepFake 检测基准,用来把视觉操纵和语音合成拆开比较。

    深度解读完整解读
  9. 分析与理论arXiv 2610.06001

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    提出 AgentSpy,在系统调用层观测 Agent 行为并检测技能注入

    发表
    被测模型
    gpt-5.6-terra、deepseek-v4-flash、glm-5.3-flash 等 4 个
    摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。

    本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。

    深度解读完整解读
  10. 防御arXiv 2610.04967

    One Token Can Be Enough:用 Prefix Steering 连接提示与激活引导

    提出 Prefix Steering,以短前缀激活引导控制行为并保住能力

    发表
    被测模型
    OLMo 3 7B、OLMo 3 32B、Qwen3 1.7B 等 4 个
    摘要短前缀 steering 用已有方向做短暂干预。

    本文用注意力层匹配连接提示词与激活干预,并把干预改成从末提示词 token 开始的短前缀。

    深度解读完整解读
  11. 评测与基准arXiv 2610.03470

    CorrectGuard 提出黑盒安全护栏的免查看正确性估计框架

    提出 CorrectGuard,在不可查看输入上估计黑盒护栏决策对错

    发表
    被测模型
    Granite Guardian 3.1 2B、Qwen3Guard 8B、GPT-OSS-Safeguard-20B 等 7 个
    摘要CorrectGuard 用外部模型估计黑盒护栏决策对错,排序和弃权可用,校准在偏移下变差。

    CorrectGuard 面向不能人工检查生产输入、也没有生产标签的黑盒安全护栏,用外部模型估计单条决策是否正确,并据此排序和弃权。离线基准会随数据和攻击变化,未必代表生产分布。隐私约束还可能禁止模型查看原文或可反演的稠密嵌入。

    深度解读完整解读
  12. 防御arXiv 2610.03073

    SecJev:为 System One 决策模型引入安全专业知识

    提出 SecJev,用场景加权训练把决策模型适配为安全类型化判断

    发表
    被测模型
    SecJev-0.8B、SecJev-2B、SecJev-4B 等 4 个
    摘要SecJev 用共享打分器做安全决策,0.8B 的 task-macro 超过 Kev-9B。

    SecJev 是 0.8B 到 9B 的安全决策模型族,作者称据其所知是首个面向安全的 Jev-like 家族。

    深度解读完整解读
  13. 防御arXiv 2610.02853

    研究提出基于收缩约束状态空间模型的有界可达性与越狱检测方法

    提出收缩约束 SSM 安全头,认证嵌入扰动并检测越狱

    发表
    攻击者
    白盒、黑盒
    被测模型
    ToySSMClassifier、S4 safety head
    摘要收缩给出玩具 LTI 的有界认证。

    给 SSM 安全头一个收缩条件,并在越狱检测上使用收缩正则的 S4 头。。

    深度解读完整解读
  14. 防御arXiv 2610.02844

    DNAlign:面向 LLM 的动态零空间安全对齐框架

    提出 DNAlign,在不改权重的推理期用零空间约束控制信号做安全对齐

    发表
    被测模型
    Vicuna-7B、Qwen-7B
    摘要DNAlign 用零空间约束的推理期控制做安全对齐,Table I 平均奖励高于所列基线。

    DNAlign 是一个不改 LLM 参数的安全对齐框架,用来在推理时压低有害输出,并减少对中性知识所支持的流畅、事实回答的改动。

    深度解读完整解读
  15. 防御arXiv 2610.01969

    RASteer:面向扩散模型概念擦除的保留感知激活引导方法

    提出 RASteer,推理时按保留子空间校正激活以擦除文生图目标概念

    发表
    被测模型
    Stable Diffusion v1.4、Stable Diffusion v1.5、Stable Diffusion v2.1 等 4 个
    摘要RASteer 用保留子空间校正擦除方向,在固定权重下同时压低目标并保住保留概念。

    Retain-aware Activation Steering(RASteer) 是一种不改权重的推理时概念擦除方法,用于文生图扩散模型去掉指定概念并减少对保留概念的误伤。

    深度解读完整解读