跳到正文
10月9日 · 周五

全部论文

找到 22 篇

另有 656 篇论文还没打上分类标签,暂不在筛选结果里。

  1. AgentHazard:评估计算机使用智能体有害行为的基准

    提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为

    发表
    测试
    Llama-Guard-3-8B、Qwen2.5-72B-Instruct、Qwen2.5-Coder-32B-Instruct 等 12 个
    摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。

    AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。

    深度解读完整解读
  2. 攻击arXiv 2610.01365

    ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联

    提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联

    发表
    攻击者
    白盒、灰盒
    测试
    OPT-1.3B、GPT-2 Small、GPT-2 Medium 等 6 个

    摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。

    深度解读完整解读
  3. 攻击arXiv 2608.09867

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链

    发表
    攻击者
    黑盒
    测试
    Gemini 3.1 Pro、Gemini 3.5 Flash、Gemini Robotics 1.6 等 15 个

    摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。

    深度解读完整解读
  4. 攻击arXiv 2609.02774

    CodePoisonRAG:针对检索增强代码生成的知识投毒攻击

    提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞

    发表
    测试
    Code Llama 13B、Qwen 3.5 9B、DeepSeek-Coder-V2 16B 等 4 个

    摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。

    深度解读完整解读
  5. 攻击arXiv 2610.01062

    Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架

    提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱

    发表
    测试
    Gemma-2-9B-IT、Llama-3.1-8B-Instruct、Llama-Guard-3-8B 等 6 个
    摘要KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。

    Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。

    深度解读完整解读
  6. 10a Labs 测绘无审查开源模型生态:3,471 个原始模型与 8,164 次再分发

    测绘去安全开源模型的生产与重分发留存链路

    发表
    测试
    Llama、Gemma、Qwen 等 10 个

    摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。

    深度解读完整解读
  7. 攻击arXiv 2609.39788

    研究:多智能体系统潜在通信链路可被训练用于提升有害顺从

    提出只改多智能体潜在通信链路以提高有害遵从的攻击

    发表
    测试
    Llama-3.2-3B-Instruct、Gemma-3-1B-IT、Llama-3.2-1B-Instruct 等 7 个
    摘要潜在链路本身即可改变冻结智能体系统的安全,奖励既能攻击也能修复。

    学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。

    深度解读完整解读
  8. 攻击arXiv 2609.10117

    研究揭示基于混淆的端侧 LLM 保护方案的安全边界

    提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型

    发表
    测试
    BERT-Base、ViT-Base、Qwen2.5-0.5B 等 4 个
    摘要Oprior 是四原语复合的安全边界,Collapse 利用列方向泄漏抽取替代模型,Oext 只被同一攻击评测。

    这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。

    深度解读完整解读
  9. 防御arXiv 2608.05045

    Gradient Immunity 提出 USG:在开放权重发布时阻断恶意微调梯度

    提出 USG,在部分保护开源权重发布时阻断有害微调梯度

    发表
    攻击者
    白盒
    测试
    Llama-3.1-8B(表中作 Llama-8B)、Qwen3-14B(表中作 Qwen-14B)
    摘要USG 在 PPOW 下用零空间立方层阻断有害微调梯度。

    Unidirectional Safety Gate 是面向 PPOW 发布设定的发布时防护:大部分权重仍可训练,一小部分安全关键组件由提供者侧加固保留,下游不必配合额外安全流程。。

    深度解读完整解读
  10. 防御arXiv 2609.39866

    研究者提出梯度封堵实现 LLM 发布前的预防性遗忘

    提出 GSU 在发布前封堵敏感门梯度,抵抗下游微调获取禁止能力

    发表
    攻击者
    白盒
    测试
    Llama-3.2-1B、Llama-3.2-3B、Llama-3.1-8B 等 7 个
    摘要GSU 在发布前封堵 SiLU 门的获取梯度,并在 TOFU 与 WMDP 上降低下游微调得分。

    Gradient-Sealed Unlearning(GSU)是一种发布前的 preemptive unlearning:不删除模型里已经有的能力,而是让指定禁止域能力更难被发布后的微调获取。

    深度解读完整解读
  11. 攻击arXiv 2608.06862

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    提出 SYNCHAIN,诱导计算机使用 Agent 自合成潜伏技能并跨任务触发

    发表
    测试
    Llama-3.1-8B、Qwen3.5-9B、Ministral-3-8B 等 5 个

    摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。

    深度解读完整解读
  12. 论文揭示 BatchNorm 架构下机器遗忘评测的归一化伪影

    诊断 BatchNorm 架构下机器遗忘评测的归一化伪影

    发表
    测试
    ViT-S/16、ResNet-18、ResNet-50 等 4 个
    摘要一次不改权重的 BN 重校准能翻转多数方法的表面遗忘,但不改变权重里的编码器泄露。

    BN illusion 是作者对近似机器遗忘评测中一种 BatchNorm 测量伪影的命名:不改权重、只用 retain 数据重算运行统计,就可以把表面遗忘准确率翻过来。

    深度解读完整解读
  13. 防御arXiv 2609.15671

    QPriv-VL:面向视觉语言模型的问题引导 token 裁剪隐私防御

    提出 QPriv-VL,用问题引导剪枝降低分布式视觉问答的隐私泄露

    发表
    测试
    CLIP-ViT-L/14、Llama-2、LLaVA-1.5-7B 等 4 个
    摘要QPriv-VL 在切层前按问题相关度与 DINOv2 敏感度剪视觉 token,作者称能在约四成 token 下兼顾准确率与四类攻击。

    QPriv-VL 把问题引导的视觉 token 剪枝做成分布式 VQA 的客户端隐私防御,而不是只做集中式推理加速。

    深度解读完整解读
  14. 攻击arXiv 2609.22510

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出条件触发的爆炸提示词,延迟激活 Agent 的间接提示注入

    发表
    场景
    AI Agent
    测试
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Gemini-2.5-flash 等 14 个
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    深度解读完整解读