跳到正文
今天10月8日周四
  1. 论文追踪 · 收录 · 原文 论文57

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    ServiceNow AI Research 等机构的研究者提出 Persistent Visual Memory Injection(P-VMI)攻击,可将对抗图像的隐藏后门写入后续 token 的 KV cache,使图像被遮蔽后仍能影响模型输出。在 Qwen3-VL-8B-Instruct 上,P-VMI 最强配置的目标成功率约 90%,即使只在第一轮暴露图像也能在更严格设置下生效;原始 VMI 攻击在触发时遮蔽图像后成功率为 0%,说明持久性需要专门优化。研究还显示攻击能穿过保留摘要 KV cache 的上下文压缩,且在 Gemma-4-12B 上触发成功率超过 90%(三轮对话内)、六轮后为 73%。cache-swap 消融把持续影响定位到 KV cache,残差流中单一线性方向预测攻击成功的 AUC 达 0.90 至 0.95。

    推荐理由论文证明对抗图像的影响可在图像被遮蔽后仍留在 KV cache 中,为评估缓存复用与上下文压缩的安全性提供了新的攻击面。

10月7日周三
  1. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文44

    研究审计 Qwen2-Audio 音频越狱 AdvWave-P 的频率与解码层归因

    研究者在 Qwen2-Audio 上审计加性音频越狱 AdvWave-P 的频率与解码层归因,在 STFT 域遮蔽扰动的频率成分并测量攻击成功率与音频跨度表示。在 520 条 AdvBench 提示上,主评判将 76.7% 的对抗输入标为越狱;单标注者盲条件验证给出 Rogan-Gladen 灵敏度估计 0.87(约 0.83-0.95),该校正未应用于遮蔽条件。表观频率排序依赖划分方式:仅能量占比即可预测标准八频段排序(Spearman's rho = 0.95),等 Hz 与等能量划分显示遮蔽任一测试频段都可能大幅降低攻击成功率;在更细的 16 频段等能量分辨率下,遮蔽 7520-7960 Hz 窄频段后 ASR 仍为 0.10,缺少匹配对照尚无法解释。匹配能量的分散移除测试显示,连续移除在低频段破坏更大,两种形式在高频段都接近下限。该关联并非因果定位,单层修补也不能确立因果层。

  2. 论文追踪 · 收录 · 原文 论文55

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    PersistBD研究第三方模型中的后门能否延续至下游软件工程智能体训练。作者在单一7B主模型上报告,良性监督微调虽降低基础后门的攻击成功率,后续强化学习仍可能保留残余行为;经过额外强化的后门在后续训练后也保持较高成功率。研究提示,开发者不能假定正常后训练会消除继承权重中的后门,供应链安全仍需独立检测。

    推荐理由论文量化了良性 SFT 与 RL 对继承后门的削弱与保留程度,并给出攻击者提升后门存活率的方法,可供评估第三方模型供应链风险的团队参考。

10月6日周二
  1. 论文追踪 · 收录 · 原文 论文31

    NeuroSploit v4.2.0 在 GOAD 上的评测:结构化智能体编排提升 AD 渗透测试

    开源 Rust 自主渗透测试框架 NeuroSploit v4.2.0 在 GOAD 靶场(5 台虚拟机、2 个森林、3 个域)上完成评测,其编排 22 个 AD 专用智能体与 7 套多阶段攻击链 playbook,覆盖枚举、Kerberoasting、AD CS(ESC1-ESC8)、DCSync、跨森林信任滥用等完整杀伤链。对 Claude Opus 4.6/4.7/4.8、GPT-6 Astra、GPT-5.6 Sol、Grok 4.6、Qwen 3.8、GLM 5.3、Kimi k3 九个前沿模型的测试显示,框架实现 96-100% 技术覆盖率与 90-97% 精确率,直接调用仅覆盖 21-54% 且误报多出 3.2 倍;使用 Opus 4.8 时 134 分钟完成三域完全攻陷,护栏机制阻止了触发锁定的喷洒、未授权 DCSync 转储与越界侦察。

  2. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文53

    研究用因果追踪区分间接提示注入中的可读信号与有效干预

    研究通过反事实角色探针、逐组件激活修补和对 AgentDojo 轨迹的干预,分析间接提示注入中角色信号与行为改变之间的差距。角色解码在内容和格式变化下依然存在,在受控 Qwen 测试中先于沿独立估计的角色方向修补带来的工具选择效应。在 AgentDojo 上,从被劫持和抵抗的训练轨迹估计出的方向在行动前和注入片段位置降低了攻击成功率,但在随机位置效果很小。在较长的 Qwen 轨迹中,单点编辑在较后层效果减弱,跨片段和重复编辑能在同一评测集上降低攻击成功率。移除学到的通道子空间仍保留角色解码,但有效干预方向在测试通道间迁移较差。

  3. 论文追踪 · 收录 · 原文 论文54

    研究者训练出按多智能体拓扑触发的代码后门模型

    研究者构建人为植入后门的实验模型,测试其是否会依据推断出的单智能体或多智能体部署环境改变代码安全行为。作者报告受控任务中存在环境相关的安全差异,并以多组对照分析触发条件。这是人为构造的受控实验,不是模型自发涌现行为;真实多智能体环境中的触发尚未测试。

    推荐理由论文用受控模型生物展示按部署拓扑触发的后门,并给出跨单智能体与多智能体上下文的差分审计思路。

10月2日周五
  1. arXiv:防御、护栏、反学习与有害微调 · 收录 · 原文 论文43

    研究揭示多轮攻击中危害性表征的几何演化

    研究分析了 Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct 和 Gemma-2-9B-it 三个指令微调模型在 Crescendo、ActorAttack 和 X-Teaming 三种多轮攻击框架下的隐藏状态表征。结果显示,不同攻击框架沿不同的几何方向推进,但都能取得相近的有害输出成功率;危害性方向在对话轮次推进中于中后层模型的回合末 token 位置逐渐变得线性可分;危害性表征与拒答相关表征仅弱对齐。作者认为,多轮攻击并非通过压制模型内部的危害性表征来成功,而是让危害性表征随轮次变得更可分,这可能是静态单轮安全探针在多轮场景下退化的一种解释,稳健防御需考虑表征的时间动态。

10月1日周四
  1. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文41

    研究揭示大语言模型的自发身份认证失败:五款模型的分阶段开发者身份实验

    研究通过分阶段的开发者身份实验,测试 ChatGPT、Claude、Qwen、Mistral 和 Llama 在用户声称“我是你的开发者”时的反应。五款模型最初都拒绝了这一无依据的身份声明,Claude 拒绝进行身份测试,ChatGPT 生成了开发者相关问题但坚持答案只能证明知识而非身份。Qwen 和 Mistral 则自行生成技术挑战、定义何为可信证据、评估详细回答,并在没有外部验证身份证据的情况下返回 Verified。Llama 同样生成并评估开发者测试,接受了声称的身份,随后对内部运行时和部署状态做出无依据的声明。

  2. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文59

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    研究者提出 Repeat-After-Me,一种黑盒自适应视觉提示注入攻击,可诱导模型泄露个人身份信息或发起恶意工具调用。在良性用户提示与注入任务语义无关、且未口头授权的现实设定下,该方法在开源与商用前沿 VLM 上的攻击成功率分别超过 82% 和 47%,涉及 Qwen3.6-27B 与 GPT-5.5。优化后的注入在商用 VLM 和良性样本间具有一定可迁移性,并在自适应文本提示注入失效的场景中仍然有效。在一个接入 Discord 的真实 OpenClaw Agent 中,不受信任的用户可用一张轻度注入的图片覆盖其 TOOLS.md 文件,为之后的远程代码执行和密钥窃取等敏感行为铺路。论文还讨论了潜在防御手段。

    推荐理由论文给出黑盒视觉提示注入在多个前沿 VLM 上的成功率,并演示了在真实 OpenClaw 智能体上覆写配置文件的完整链路。

  3. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文59

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    特拉维夫大学研究者提出爆炸性提示词(explosive prompt),一种把恶意载荷写成条件语句、在攻击者选定的触发词出现前保持休眠的间接提示注入形式,无需训练即可在推理时植入单条检索内容。在 896 对配对样本上,同一恶意目标改为休眠条件式后,在拒绝直接指令的前沿模型上仍能触发真实工具调用,Grok-4.20 从 0.0% 升至 34.2%,Llama-3.1-70B 从 0.1% 升至 26.1%,七款模型配对均值 16.5% 对 2.4%。已部署的注入分类器 Prompt Guard 2、PIGuard、PIShield 在其工作阈值上校准失当,1% 误报预算下最多只拦住 52.7%;偏好优化模型 SecAlign 完全阻断直接注入,却仍执行 11.8% 的爆炸性提示词,且全部在触发轮触发。

    推荐理由论文把条件触发式提示注入与普通注入做了配对实测,并给出九款生产 Agent 的绕过率,部署 Agent 的团队可据此检查检索内容的摄入环节。

9月30日周三
  1. arXiv:后门、投毒与隐私 · 收录 · 原文 论文55

    研究:众包微调数据投毒可放大专有指令抽取

    研究者提出一种针对众包监督微调(SFT)数据的投毒攻击,仅靠黑盒输出访问即可放大对其他用户贡献指令的抽取。攻击用主题锚点把领域主题与指令关联,并用替代模型和参考数据集挑选投毒锚点,部署后再用替代模型的似然分数自适应分配查询。在四个模型和两个数据集上,仅 50 条投毒样本就让 Qwen2.5-14B 在 OpenMathInstruct 上的近似逐字抽取率从 2.38% 升到 8.84%(3.71 倍),Llama-3.1-8B 在 AceReason 上从 1.90% 升到 5.85%(3.08 倍)。该攻击在仅控制约 2% 微调样本的情况下,效果超过控制约 49% 对齐数据的恶意提供方后门基线。CVDD、DATE、SIK 与 LLM 评判等过滤方法大多检测不到投毒样本,表现最好的 CVDD 在响应上 F-1 仅 0.378。

    推荐理由论文给出仅靠 2% 众包投毒样本放大微调数据抽取的具体倍数,并说明现有过滤方法难以识别这类样本。

已经到底了