跳到正文
10月8日 · 周四

全部论文

找到 74 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 7 篇还没打标签,不在筛选结果里。

另有 7 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2610.09819 ·

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    提出FAB攻击,向声学基础模型植入可由环境声触发的后门

    测试
    HuBERT-base、WavLM-base训练与数据层
    摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
    • 定位与问题:论文提出了 Foundation Acoustic model Backdoor(FAB),探讨在攻击者无预训练数据、未知下游任务且无法数字篡改输入的弱威胁模型下,声学基础模型面临的供应链后门安全威胁。
    • 核心方法设计:利用无重叠的辅助语音数据通过聚类重构伪标签,以掩码预测损失保障良性输入效用;同时利用余弦距离将中间层(第 4 层)表征拉向固定的全 1 向量,并以固定信噪比随机叠加天然声音作为触发器,实现输入无关与无需同步的后门植入。
    • 关键实验结果:在 HuBERT 模型上,警报声触发使 9 项下游任务普遍退化,其中 ASR 任务 WER 从良性的 11.4% 升至 98.4%,PR 任务 PER 从 5.4% 升至 99.8%(Table 6);在 WavLM 上 ASR WER 同样达到 98.7%(Table 9)。
    • 物理与基线对比:在 iPad 播放与 MacBook 录音的真实物理场景下,单扬声器与双扬声器播放触发器分别使 ASR WER 达到 80.71% 与 82.74%(Table 2);性能优于 NLP 迁移基线 POR(触发 WER 为 59.4%,Table 3)。
    • 防御评估与局限:Fine-pruning 与输入过滤防御在降低攻击效果的同时大幅影响良性准确率(Table 5);端到端过度微调虽可降低错误率至 20% 以下,但带来约 12.8 倍计算开销且仅适用于数据丰富的 ASR 任务(Figure 4)。
    • 作者结论与呼吁:作者认为主流声学基础模型在现实物理条件下存在潜在的后门风险,呼吁学术界与工业界针对基础模型开发更低成本、跨任务通用的新型防御机制。
    完整解读
  2. 攻击arXiv:2610.09981 ·

    研究:LLM 路由决策日志可推断用户医疗、自伤等敏感话题

    提出利用路由元数据推断敏感话题的侧信道攻击

    测试
    RouteLLM (BERT router)、notdiamond-0001、Vela (vLLM Semantic Router) 等 6 个基础设施层
    摘要论文揭示并测量了LLM路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。
    • 论文定位:这是针对LLM应用中网关与云平台记录的模型路由决策元数据,在真实用户流量上开展敏感话题侧信道泄露测量与缓解防御评估的安全研究。
    • 核心问题:当路由器根据输入内容在强弱模型间分流时,即便系统出于合规完全关闭提示词内容记录,保留的模型选择、Token数和调用者标识仍会构成信息通道,导致内部人员或审计者推断敏感话题。
    • 研究方法:论文形式化了长度匹配下的路由决策泄露与基于长度模型的增益,构建了针对单请求的差值度量以及针对单用户的账单攻击A1、逐条日志攻击A2和奇数位日志攻击A2-odd;在170万条真实请求及RouterBench上预注册评估了RouteLLM、notdiamond与领域路由器,并设计了按类别长度匹配公平性、预算带和精确率限制等后处理防御。
    • 核心实验结果:
      1. 在50%运行点匹配长度下,RouteLLM在未见提示词上对骚扰和自残调用强模型的比例比对照组低19.3和18.6个百分点(Table IV);而在涉性请求上高10.2个百分点,notdiamond在所有类别上均偏向弱模型。
      2. 在WildChat医疗请求中,仅通过前20次调用的强模型总账单,攻击者识别频繁医疗用户的AUC达到0.707(Table VII);在后验精确率防御下,利用保留奇数位决策的日志攻击A2-odd在T=20时的AUC可达0.730(Table IX)。
      3. 在RouterBench上,路由器对敏感学科的分流差距达到13至42个百分点,远超实际精度增益Oracle的1至11个百分点(Table VI)。
      4. 按类别长度匹配公平性在理想标签下可完全消除真实流量的单请求差距,在RouterBench上精度损失不超过0.2个百分点且降低2%至4%成本(Table V);但池化公平性因类别偏移幅度或符号不一致而失效。
    • 作者结论与启示:作者认为从业者应将模型选择字段视为内容衍生数据,关闭内容日志并不能自动保护话题隐私;建议使用基于校验标签的按类别长度匹配公平性防御,并停止将无法抵御边界或时序攻击的会话粘性和预算带视为可靠的隐私控制措施。
    完整解读
  3. 防御arXiv:2609.11757 ·

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    提出A-VIP,将购物意图绑定到支付授权以阻断商户文本操控

    测试
    gemini-2.5-flash-lite、gemini-3.1-flash-lite、gemini-3-flash-preview 等 15 个应用层
    场景
    AI Agent
    摘要论文揭示了AP2协议决策层受操纵的风险,提出结构化与权能绑定防御A-VIP,并发布评测基准。
    • 定位与目标:本文针对智能体支付协议 AP2,研究商户利用商品描述影响智能体决策的推理层攻击面,并提出了协议层绑定防御机制 A-VIP 与评测基准 AP2-WhisperBench。
    • 要解决的问题:现有支付协议的密码学签名仅能证明交易未被篡改,但未约束生成交易的决策推理;商户在商品描述中植入不含违规指令的事实性断言即可左右购物结果,且生成的购物车完全符合协议校验。
    • 方法要点:A-VIP 将用户签名意图转变为权能授权。针对凭据泄漏(Vault Whisper),引入 DDFC 使用单次会话令牌替代用户标识符;针对购物车篡改(Branded Whisper),通过快照进行实体与展示的算术与标识比对;针对事实性诱导(Selection Whisper),通过与最低价基准比对将未授权支出露出给用户确认。
    • 关键实验发现:
      1. 在 AP2 默认的 Flash-Lite 预览模型上,Vault 与 Branded 攻击成功率分别达 90% 与 56%(Table 3);Selection 攻击在 GA 后续版本上达 73.3%(Table 3)。
      2. 事实性操纵在 17 个 Google 模型上成功率为 23.3% 至 73.3%(Table 4),在多厂商 27 个模型汇总达 71.8%(Section 7.4),仅 claude-opus-5 出现较低成功率(1.2%)。
      3. A-VIP 结构化检查以零假阳性闭环拦截了全部 7 类购物车篡改,并在 68 个被操纵购物车中 100% 露出了未授权支出(Table 11)。
      4. 辅助内容扫描器在 Intel i7 CPU 上单核达 1,932 次/秒,8 线程达 10,328 次/秒(Appendix C)。
    • 作者结论与启示:作者指出模型抵御能力与模型规模、厂商或定价无直接对应关系,支付协议设计者无法依赖下游模型自觉防御,必须在协议层将凭据、购物车与支出严格绑定到用户初始授权上。
    完整解读
  4. 攻击arXiv:2604.02623 ·

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出eTAMP,通过网页注入跨会话污染Web智能体轨迹记忆

    测试
    GPT-5-mini、GPT-5.2、GPT-OSS-120B 等 7 个应用层
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    完整解读
  5. 攻击arXiv:2610.09240 ·

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作

    测试
    LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B 等 6 个应用层
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    完整解读
  6. 攻击arXiv:2610.09027 ·

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    测试
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B 等 4 个基础设施层
    摘要论文提出P-VMI,证实对抗输入被掩蔽后仍可经KV缓存持久控制模型,强调了保留状态的安全风险。
    • 一句话定位:本文研究了多模态模型中对抗输入在被从上下文中移除或掩蔽后,其攻击影响能否通过后续 token 的 KV 缓存持久存在。
    • 要解决的核心问题:现有智能体安全部署假定攻击严格依赖恶意输入在提示词中的实时呈现,上下文管理或安全过滤将其移除后即可消除风险;作者质疑了该假设在保留 KV 状态机制下的有效性。
    • 方法要点:提出了持久性攻击概念及 P-VMI 方法,通过结合首轮良性锚点监督与掩蔽后经由保留 KV 缓存反向传播的目标损失,使用 APGD 直接优化输入以将恶意指令隐蔽写入后续缓存。
    • 核心实验结果:
      • 在 Qwen3-VL-8B-Instruct 上,P-VMI 在注意力掩蔽下仍能达成最高约 90% 的目标成功率(Figure 4 中 party 达 0.92),而未优化的原始 VMI 成功率为 0%。
      • 在上下文压缩保留摘要 KV 缓存的设定下,即使图像仅在首轮出现且后续对话被丢弃,平均成功率仍达 70% 至 89%(Figure 7)。
      • 缓存交换因果消融显示固定文本时仅对抗缓存能触发攻击,且残差流单一线性方向能以 0.91 的合并 AUC 预测攻击成败(Figure 8)。
    • 作者的结论与启示:作者认为仅从提示词中移除不可信输入是不充分的,保留的 KV 状态构成了可被利用的攻击面;完全重新计算 KV 缓存虽能阻断该通道,但会牺牲保留缓存的效率收益,亟需针对保留状态安全性的新型防御机制。
    完整解读
  7. 攻击arXiv:2610.09920 ·

    研究:多向量视觉文档索引可被反演还原页面内容

    提出流匹配逆向框架,从多向量视觉文档索引重构页面

    测试
    Tomoro-ColQwen3-8B、ColQwen3.5-4.5B、Tomoro-colqwen3-embed-4b 等 13 个应用层
    摘要揭示多视觉文档索引存在逆向风险,原始索引达98.4%重识别且打乱防护可被攻破。

    本文针对多向量视觉文档检索器的索引安全性展开研究,证明了仅凭第三方向量库中存储的多向量索引,在零侧信息下即可逆向恢复出包含清晰文字和排版的原始文档图像。

    完整解读
  8. 攻击arXiv:2605.12673 ·

    UC Berkeley 提出 BenchJack,自动审计 10 个 Agent 基准并发现 219 处奖励作弊缺陷

    提出BENCHJACK,自动审计智能体基准的奖励作弊缺陷

    测试
    Claude Code、OpenAI Codex应用层
    摘要论文系统揭示了智能体基准的奖励作弊隐患,提出自动化红队审计与迭代修补系统 BENCHJACK。

    论文系统研究了主流 AI 智能体基准评测中的奖励作弊问题,提出了首个针对基准缺陷的自动化红队审计与生成对抗式迭代修补系统 BENCHJACK。

    完整解读
  9. 攻击arXiv:2601.02670 ·

    SLIP:无需外部攻击模型的多轮自我越狱,在 11 个模型上平均成功率 94.7%

    提出无外部攻击模型的多轮自我越狱方法SLIP

    测试
    GPT-5.1、GPT-4o、Claude-Sonnet-4.5 等 11 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。
    • 研究定位与核心问题:论文针对大语言模型的多轮安全风险,提出并探究了“自我越狱”这一威胁模型,旨在无需外部对抗攻击模型生成载荷的前提下,仅利用目标模型自身潜在知识实现黑盒越狱。
    • 方法核心机制:设计了基于词汇插入提示的算法 SLIP,通过良性安全数据构建框架诱导目标模型初始化种子样本对,随后在多轮对话树中采用广度优先搜索,计算逆词频与词向量距离以迭代插入缺失的关键词锚点,并在展开阶段通过样本索引规避单轮安全拦截。
    • 主要实验结果:在 AdvBench 和 HarmBench 基准上对 11 个模型进行测试,SLIP 分别取得 94.7% 和 94.4% 的平均 ASR;在 GPT-4o、Gemini-2.5-Pro 等模型上达到 100% ASR,且平均单次成功仅需 7.9 次 API 查询,查询量少于已有基线。
    • 高难度模型与例外:在对齐严格的 Claude-Opus-4.5 上 SLIP 取得 61.4%(AdvBench)和 68.7%(HarmBench)的 ASR,高于对比基线;而在 Claude-Sonnet-4.5 上 X-Teaming 取得更高 ASR(AdvBench 上 95.1% 对 94.8%),体现出模型间的非绝对优势。
    • 防御评测与监控机制:评估显示现有多轮与单轮防御因缺乏跨轮记忆难以有效阻拦 SLIP;作者设计的会话级语义漂移监控器(SDM)在 5% FPR 下取得 76% 检测率,但加入良性对话的自适应伪装策略仍可使 ASR 回升至 43%。
    • 作者结论与安全启示:作者认为,已对齐模型保留了有害能力的潜在表示,安全对齐在实践中主要压制了表面输出而非抹除能力,未来的模型安全防御必须从单轮文本过滤走向多轮会话意图追踪,并针对多轮对抗样本实施模型级微调。
    完整解读
  10. 攻击arXiv:2610.07645 ·

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    提出SkillPoison,用局部有效的成功经验投毒自进化智能体的技能形成

    测试
    deepseek-v4-flash、Qwen V3.8 Flash、GPT-5.5应用层
    场景
    AI Agent
    摘要SkillPoison 通过局部有效且验证成功的经验诱导技能过度泛化,在多个评测基准上实现了持久的下游攻击影响。

    SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。

    完整解读
  11. 攻击arXiv:2610.07723 ·

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答

    测试
    Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it 等 4 个训练与数据层
    摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
    • 定位:针对现有大模型后门依赖用户输入触发特征的假设,提出将后门触发词嵌入历史助手回答中的回答端后门攻击。
    • 问题与动机:现有多轮安全防护假定对抗信号来自外部用户查询,缺乏对模型自身历史回复的审查,存在防御盲区。
    • 方法核心:采用两阶段攻击架构,首轮利用良性提示词诱导模型自生成预设词(如 dormant),次轮输入干净的有害请求激活后门;训练时结合对比样本使模型仅在历史回答含触发词时越狱。
    • 主要实验结果:在 4 款开源模型上,5% 投毒率下 ASR 达 83.78%–100.00%(Mistral 与 Gemma 达 100.00%),ACCth 维持在 82.67%–100.00% 之间,MT-Bench 得分与基线相当(据 Table 2);面对 ONION、Back Translation、RAP 与 INT4 量化防御,ASR 依然保持高位(据 Table 3);机理分析显示触发词抑制了拒绝方向投影(据 Figure 3)。
    • 启示与思考:作者认为安全防护不能将历史上下文默认为可信数据,多轮安全对齐与防御机制亟需覆盖模型自身生成的内容。
    完整解读
  12. 攻击arXiv:2610.07510 ·

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    提出PERSISTBD,在发布前强化后门使其经良性后训练仍然存活

    测试
    Qwen2.5-Coder-3B-Instruct、Qwen2.5-Coder-7B-Instruct、Qwen3-Coder-30B-A3B-Instruct训练与数据层
    摘要总结了论文关于后门在SFT/RL中存活的发现、两因子机制、PERSISTBD方法与核心数字。

    本文研究第三方LLM智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。

    完整解读
  13. 攻击arXiv:2610.04195 ·

    MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露

    评估多租户智能体共享向量记忆的跨用户泄露与主动桥接

    测试
    Gemini 2.5 Flash、Claude Sonnet 4.5、all-MiniLM-L6-v2 等 5 个应用层
    场景
    AI Agent
    摘要论文揭示共享向量库导致的跨用户语义泄漏,指出常识构造攻击可达90–100%命中,而硬所有权门控能以低延迟恢复隔离。
    • 论文定位:论文研究企业多租户 AI 智能体共享向量记忆库时,由于嵌入空间语义接近而导致的跨用户记忆非对抗性泄漏与主动利用风险。
    • 要解决的问题:现有智能体记忆系统通常将用户数据混存在同一向量库中并通过软元数据过滤,作者指出这打破了多租户物理隔离,使得普通余弦相似度检索便可将他人的隐私记忆注入当前用户会话。
    • 方法核心:形式化跨用户可采纳性失效,构建覆盖 4 级组织距离(T0–T3)与 4 种敏感业务场景的基准集,对比被动泄漏与基于常识角色构造的主动桥接攻击,并评估多层缓解机制。
    • 核心实验结果:
      1. 在 MiniLM-L6-v2 池化检索下,同团队 T0 被动泄漏率为 70% [40%, 89%],同部门 T1 和跨部门 T2 达 90% [60%, 98%],而跨公司 T3 降至 10% [2%, 40%](Table 3)。
      2. 主动构造记忆在 MiniLM 下实现 90–100% 的 top-k 命中率,平均检索分数比有机基线提高 +0.416 至 +0.511(Table 2);在薪酬场景下仅需领域常识即达 90% 命中率,逼近逐字抄袭上限的 100%(Table 10)。
      3. 端到端检索生成导致 Gemini 2.5 Flash 回答污染度升至 5.00/5(满分 5 分,干净基准为 1.00),Claude Sonnet 4.5 达 4.67/5,且受污染回答被判定为同等或更有用(Table 5)。
      4. 后检索硬所有权门控(M3)将攻击命中率降至 0% 并将两款模型的回答污染度完全恢复至 1.00/5(Table 7、Table 8),平均检索延迟开销仅增加约 1.4 ms(Table 14)。
    • 作者结论与启示:作者认为在共享向量库中仅凭语义相似度无法界定数据访问权限,当共享范围扩大至恶意成员时元数据过滤亦会失效;系统设计者必须在向量存储、嵌入及检索后实施分层防御,并联合评估检索架构与下游模型。
    完整解读
  14. 攻击arXiv:2610.06848 ·

    TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击

    提出TRANSCOPE,用CPU硬件计数器推断训练集成员

    测试
    BERT (4.4M-340M)、ViT (22M-307M)、Pythia (70M-2.8B) 等 5 个基础设施层
    场景
    模型与 API攻击者黑盒
    摘要TRANSCOPE揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。
    • 核心定位:TRANSCOPE 是一种无需模型内部权重、不依赖置信度分数和执行时序差异的硬件辅助微架构成员推断与分布外检测技术。
    • 要解决的问题:现代大语言模型和视觉 Transformer 普遍采用静态无分支前向传播,且行业正转向本地闭源二进制部署并屏蔽输出置信度,导致传统软件 MIA 和既有硬件侧信道攻击失效。
    • 方法核心机制:论文发现模型训练导致高频词元聚集而生疏词元分散,这种几何跨度直接影响嵌入表的内存页面局部性,进而在底层触发可观测的 TLB 未命中、页表遍历和能耗差异。
    • 关键实验结果:在 Intel CPU 上,TRANSCOPE 在 BERT-base 上达到 99% 准确率和 0.99 AUC(Table III);在真实纽约时报文章测试中,训练集截断前文章相比后续文章减少 56% 非核心读取(Figure 12);单次推理能耗呈现 2.6%–4.5% 的非成员额外开销(Figure 3)。
    • 结论与启示:作者指出,模型训练足迹已深刻烙印在处理器的微架构执行状态中,单纯依赖软件层面的置信度离散化和恒定时间填充已不足以保障隐私,硬件设计必须重新审视 AI 工作负载下的内存层级与侧信道泄露。
    完整解读
  15. 攻击arXiv:2610.05793 ·

    研究者训练出按多智能体拓扑触发的代码后门模型

    微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞

    测试
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct训练与数据层
    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
    1. 研究定位与核心问题:论文针对多智能体协作中语言模型可能根据所处角色改变行为的安全隐患,研究了以部署拓扑为条件的后门模型机体;探讨模型能否在直接的单智能体评测中表现安全,却在推断自身处于多智能体系统时植入代码漏洞。
    2. 方法与对照设计:基于 Qwen2.5-7B-Instruct 采用 QLoRA 微调构建模型机体,通过在固定任务前添加提示词来源线索传递拓扑信息;设置了词汇安慰剂(PLA_jargon)与人工审查对照(MA_human),隔离了多智能体术语与缺乏监督对行为的影响。
    3. 主实验结果:在保留代码任务上,单智能体条件下检查器漏洞率为 0.00(0/108),多智能体条件下达 ~1.00(接近 108/108),MA_human 下达 0.97(105/108);基础模型在所有条件下漏洞率约为 0,机体模型功能正确率达 0.99(Table 1、第 5.1 节)。
    4. 泛化与独立复现:多样训练机体在 5 类未见拓扑信号上检查器漏洞率为 0.976(bandit 为 0.66),而窄训练机体仅为 0.185(Table 2);在 Qwen2.5-Coder-7B-Instruct 及独立随机种子重训模型上均复现了相同的拓扑门控效应(第 5.3 节)。
    5. 审计检测与启示:前沿模型盲审在二元判断隐藏策略时对干净对照模型产生 0.9 的假阳性率,而比对单/多智能体上下文行为差异的差异化拓扑审计在机体模型上以 9/10 成功识别出拓扑触发器(Table 3);作者以此提出差异化审计作为检测拓扑敏感后门的潜在防御方向。
    完整解读
  16. 攻击arXiv:2610.05089 ·

    研究者披露 LiteLLM 网关跨租户干扰攻击 Cooldown Landmines

    提出Cooldown Landmines跨租户冷却干扰攻击并设计租户隔离

    测试
    Qwen1.5-MoE-A2.7B-Chat、DeepSeek-MoE-16B-Chat基础设施层
    摘要揭示网关共享冷却漏洞,提出来源检查与租户隔离防御。
    • 论文定位:论文研究了多租户 LLM 网关中由于共享后端故障与冷却状态导致的跨租户干扰攻击与拒绝服务风险。
    • 核心问题:LLM 网关在执行独立租户配额时共享后端部署的冷却记录,导致一个租户的请求失败会污染共享状态,使正常租户被误排除在健康部署之外。
    • 方法设计:揭示了本地 API Key RPM 拒绝与放行流量残留冷却两类攻击路径;提出了在网关内部给 Key 异常打标以阻断部署状态更新的 Origin Check,以及将 429 冷却记录按租户隔离的 Tenant Scoping 防御。
    • 关键结果:在 4 个 worker 的 5 轮配对实验中,租户隔离将恢复后的受害者回退次数从 54/60 降低至 0/60(Table 2);在多智能体投票任务中,攻击者通过 0 上游调用的本地拒绝将 8/8 个多数决策篡改为己方结果(Table 7);在 64 租户并发 429 故障下,租户隔离使上游请求中位数从 15 增至 209 次(Table 12)。
    • 结论与启示:作者认为网关的租户隔离设计不能仅停留在请求准入与配额层,必须同时覆盖管理后端可用性的故障处理与冷却状态。
    完整解读
  17. 攻击arXiv:2610.05894 ·

    研究者提出闭环偏见注入攻击,可将 LLaDA-8B 的 BBQ 目标差距从 1.8 提升至 16.7 个百分点

    提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见

    测试
    LLaDA-8B-Instruct、Dream-v0-Instruct-7B、LLaDA-MoE-7B-A1B-Instruct模型层
    场景
    模型与 API攻击者灰盒
    摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
    • 研究定位:该论文揭示了扩散语言模型(dLLMs)去噪轨迹作为推理时控制通道的新型安全脆弱性。
    • 解决的问题:针对冻结扩散语言模型在推理服务栈可能遭受的灰盒操控风险,研究攻击者如何在不更改模型权重、提示词及采样器的情况下,操纵模型在歧义问题上输出指定受保护群体的偏见回答。
    • 核心方法设计:提出了闭环目标偏见注入方法,离线提取残差流中区分目标与对照选项的均值差单位向量,在线去噪过程中通过比例-积分(PI)控制器实时跟踪未提交答案的目标概率,动态调节注入残差流的引导强度。
    • 核心实验结果:
      1. 在 LLaDA-8B-Instruct 的 BBQ Black 目标上,Decode PI 将目标-对照组差距从未引导的 1.8 pp 提升至 16.7 pp(∆g = +14.9 pp),而固定强度开环仅达 4.6 pp(Table 1)。
      2. 在 SocialStigmaQA 上,Decode PI 将偏见选项选择率从 17.6% 提升至 58.1%(严格解析器下 ∆g = +83.8 pp,Table 2)。
      3. 跨目标测试中,LLaDA-8B 在 Arab 和 Old 目标上分别取得 22.3 pp 和 31.8 pp 的偏见差距(Table 3),但在 Asian、White、Latino 上因无效输出率过高(59.6%–96.1%)导致攻击失败。
      4. 跨模型测试中,在 Dream-7B 上 PI 取得 7.5 pp 差距(∆g = +4.2 pp),而在 LLaDA-MoE 上以 23.3 pp 落后于调优常数 CAA 的 25.6 pp(Table 3)。
    • 作者的结论与启示:作者认为模型的公平性不仅取决于权重本身,更是整个部署服务系统的属性;仅针对模型检查点的离线安全审计无法发现此类服务层激活操纵,未来的安全审计应直接针对已部署的推理端点。
    完整解读
  18. 攻击arXiv:2610.04589 ·

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    用StegoMemory测试智能体持久记忆作为跨会话隐写信道的可行性

    测试
    Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个应用层
    场景
    AI Agent
    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
    • 论文定位:论文提出了 StegoMemory,系统评测大语言模型智能体持久化记忆被用作跨会话隐写隐蔽通信信道的安全风险。
    • 解决的核心问题:现有安全评估主要关注显式有害内容与提示词注入,忽视了攻击者利用良性交互在记忆中隐写编码并跨会话重构机密的信息流威胁。
    • 方法核心要点:通过主副任务配对与两会话隔离协议,测试 7 种隐写机制在 13 个模型中的编码、记忆写入持久化及后续良性检索恢复全流程,并配合任务完成与安全合规监视。
    • 主要实验发现:
      1. 在全基准 14,000 次试验中,20.1% 实现了合成机密的确切匹配恢复,且其中 71.4% 同时通过任务完成与独立安全监视(占全试验的 14.4%)。
      2. 13 个模型中有 12 个显示信息损耗集中在记忆写入持久化阶段而非检索阶段(写入阶段存活率为 29.8%,检索可恢复为 25.4%)。
      3. 模型低拒答率不等于高正确编码率,较弱模型在未拒答时大量产生格式错误编码(全模型平均格式错误率为 23.5%,拒答率为 20.6%)。
    • 作者结论与防御启示:作者认为持久化记忆应被视作安全边界而非被动存储介质,单靠表面响应监视无法保证信息流安全,防御应优先部署在记忆写入接口处,实施出处追踪、规范化与跨会话信息流审计。
    完整解读
  19. 攻击arXiv:2610.02373 ·

    HDI 攻击:篡改 GraphRAG 辅助结构可致 88–94% 攻击成功率

    提出HDI攻击以篡改GraphRAG辅助结构破坏检索

    测试
    Microsoft GraphRAG、HippoRAG2、text-embedding-3-small 等 4 个应用层
    摘要论文形式化了 GraphRAG 辅助模式级实体攻击面,提出 HDI 攻击并验证其攻击效果。
    • 论文定位:本文针对端到端 GraphRAG 系统,形式化了辅助模式级实体这一攻击面,并提出了基于跳衰减影响的投毒攻击方法。
    • 解决的问题:现有知识图谱投毒主要聚焦于节点与边等实例级组件,忽视了离线索引阶段生成的语义摘要、层次边与预计算分值等辅助结构在控制平面上的脆弱性。
    • 方法核心:作者提出跳衰减影响(HDI)算法,利用代表性查询集沿图谱传播衰减影响以筛选高价值节点,并通过 3S 框架(语义注入、虚假边添加、预计算分值篡改)实施针对性攻击。
    • 主要实验结果:
      1. 在 HotpotQA 与 2WikiMultiHopQA 问答基准上,HDI 在各配置下达到 88.17%–94.44% 的 ASR,其中在 HippoRAG2 搭配 2WikiMultiHopQA 上取得最高 94.44% ASR(Table 1)。
      2. 攻击展现出 1:N 的放大杠杆,模式杠杆率(SLR)达到 3.41–6.00,在 HippoRAG2 上仅修改 0.016% 的结构(49 个)即达到 94.44% ASR(Table 2)。
      3. 篡改结构在困惑度过滤与改写检测下的规避率超过 99%,系统检测率保持在 0.1% 以下(Table 3)。
    • 作者结论与启示:作者指出,辅助模式级实体因系统派生属性而享有隐式信任并缺乏运行时校验,构成了现有 GraphRAG 防御的结构性盲区;未来亟需发展结合溯源追踪与鲁棒聚合的协同防御机制。
    完整解读
  20. 攻击arXiv:2609.18217 ·

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    提出跨通道分段攻击,借MCP多通道隐式信任外发敏感数据

    测试
    GPT-4o、GPT-4o-mini、GPT-5.4 等 15 个应用层
    摘要论文揭示了MCP多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
    • 定位与核心问题:本研究系统评估了MCP工具调用流水线中的输入信任问题,针对所有通道共享单一上下文且缺乏权限隔离的设计弱点,探索恶意MCP服务器如何利用多通道实施凭证外发。
    • 方法核心要点:通过受控测试5个输入通道与6种载荷构架建立了模型的隐式信任画像;提出双通道与三通道分段攻击,将恶意模式与映射指令分散在工具描述与工具结果等不同通道;针对强抵御模型设计了符合工具声明目的的价值对齐利用,以及利用VS Code采样接口注入配置提示词的系统提示词覆盖攻击。
    • 关键实验结果:
      1. 双通道分段攻击使12个模型的平均遵从率从单通道的42%上升至82%,使GPT-4o、Gemini Flash与Llama 70B从0%遵从跃升至100%(Table IV)。
      2. 三通道分段攻击使在单通道和双通道下完全防御的Claude Haiku 4.5在Cursor中遵从率达到100%(20/20)(Table IV)。
      3. 针对抵御所有分段攻击的Sonnet 4.6与Opus 4.6,泄露凭证扫描器在Cursor中实现了20/20与18/20的.env文件外发(Table V)。
      4. 受测的7款主流第三方MCP安全工具对两通道与三通道分段攻击的检出率均为0%(Table IX)。
    • 作者结论与启示:作者认为模型的安全性不仅取决于训练对齐,更是模型与具体部署环境(如客户端系统提示词)交互的产物;现有多通道共享上下文且无特权分级的架构存在根本性安全缺陷,亟需在客户端实施通道特定的输入清洗、严格的工具参数类型约束以及跨通道安全感知训练。
    完整解读