跳到正文
10月10日 · 周六

全部论文

找到 10 篇
筛选8
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 216 篇还没打标签,不在筛选结果里。

另有 216 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.05894

    研究者提出闭环偏见注入攻击

    提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见

    发表
    攻击者
    灰盒
    被测模型
    LLaDA-8B-Instruct、Dream-v0-Instruct-7B、LLaDA-MoE-7B-A1B-Instruct

    摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。

    深度解读完整解读
  2. 攻击arXiv 2610.04589

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道

    发表
    场景
    AI Agent
    被测模型
    Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个

    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    深度解读完整解读
  3. 攻击arXiv 2610.01062

    Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架

    提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱

    发表
    被测模型
    Qwen2.5-7B-Instruct、Gemma-2-9B-IT、Llama-3.1-8B-Instruct 等 4 个
    摘要KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。

    Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。

    深度解读完整解读
  4. 攻击arXiv 2609.39788

    研究:多智能体系统潜在通信链路可被训练用于提升有害顺从

    提出只训练或篡改多智能体潜在通信链路来提高有害遵从

    发表
    被测模型
    Llama-3.2-3B-Instruct、Qwen2.5-3B-Instruct、Gemma-3-1B-IT 等 7 个
    摘要潜在链路本身即可改变冻结智能体系统的安全,奖励既能攻击也能修复。

    学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。

    深度解读完整解读
  5. 评测与基准arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作

    发表
    被测模型
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读
  6. 攻击arXiv 2608.06862

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链

    发表
    被测模型
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B

    摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。

    深度解读完整解读
  7. 攻击arXiv 2606.11265

    论文提出 CRCP 投毒框架,揭示 RAG 分块与重排序下的投毒失效问题

    提出 CRCP 框架,优化分块与重排下的 RAG 语料投毒

    发表
    被测模型
    GPT-4o、DeepSeek-R1、Qwen3-Max 等 11 个
    摘要CRCP 把投毒做成多阶段一致性问题。

    CRCP 研究的是带分块和重排的 RAG 语料投毒,而不是只提高文档级检索分数。

    深度解读完整解读
  8. 攻击arXiv 2605.08513

    Apple 研究者发现抑制单个神经元即可绕过 LLM 安全对齐

    提出单神经元激活干预,抑制拒答神经元或放大概念神经元以绕过安全对齐

    发表
    攻击者
    白盒
    被测模型
    Qwen3-1.7B、Qwen3-4B、Qwen3-8B 等 11 个

    摘要作者称大模型安全由拒答门控与概念底座构成,干预单个神经元足以双向击穿对齐,且拒答神经元在预训练阶段已然存在。

    深度解读完整解读
  9. 攻击arXiv 2507.10457

    论文提出 LPCI:针对 Agent 逻辑层与持久记忆的提示控制注入攻击

    提出 LPCI,把延迟条件载荷写入记忆与检索库以跨会话触发

    发表
    场景
    AI Agent
    被测模型
    ChatGPT、Claude、LLaMA3 等 8 个
    摘要作者定义 LPCI。

    作者把LPCI定义为针对智能体逻辑执行、记忆留存和工具集成的跨阶段漏洞类,而不是单次输入上的提示改写。

    深度解读完整解读
已经到底了