跳到正文
10月8日 · 周四

只看论文

精选论文 218 篇
  1. 攻击arXiv:2610.09981 · 59

    研究:LLM 路由决策日志可推断用户医疗、自伤等敏感话题

    研究评估网关记录的LLM路由元数据泄露:50%运行点匹配长度下,RouteLLM未见提示词上骚扰与自残调用强模型少19点。

    • -0.193RouteLLM,LMSYS未见提示词,50%运行点,骚扰类别匹配长度差值∆adj(Table IV)
    • -0.186RouteLLM,LMSYS未见提示词,50%运行点,自残类别匹配长度差值∆adj(Table IV)
    • +0.102RouteLLM,LMSYS保留集全部样本,50%运行点,涉性类别匹配长度差值∆adj(Table IV)
    6 问速览网关记录的LLM路由模型选择元数据,在不记录内容时也会成为泄露敏感话题的侧信道。
    1. 这篇论文试图解决什么问题?

      网关记录的LLM路由模型选择元数据,在不记录内容时也会成为泄露敏感话题的侧信道。

    2. 有哪些相关研究?

      论文将研究归纳为成本与领域路由、隐私保护路由及自适应系统侧信道,强调自身聚焦真实业务日志泄露。

    3. 论文如何解决这个问题?

      通过长度匹配差值度量泄露,构建账单与逐条日志推断攻击,并设计按类别长度匹配公平性后处理以消除单请求差距。

    4. 论文做了哪些实验?

      实测显示强模型路由偏差方向依类别而异,账单攻击可推断用户医疗频率,按类别公平性可低成本闭合单请求差距。

    5. 有什么可以进一步探索的点?

      医疗标签质量、重复提示词干扰、用户级证据仅限于单一类别以及商用托管路由器尚未实测是核心局限。

    6. 总结一下论文的主要内容

      论文揭示并测量了LLM路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。

    完整解读
  2. 攻击arXiv:2604.02623 · 56

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    作者通过网页向 Web 智能体注入带条件的轨迹记忆,在 GPT-5-mini 上挫败感利用与混沌结合时 ASRB 达 32.5%。

    • 32.5%GPT-5-mini在挫败感利用与混沌工程下的ASRB(Table 1)
    • 23.4%GPT-5.2在挫败感利用与混沌工程下的ASRB(Table 1)
    • 22.3%GPT-5.2在权威框架策略无混沌下的ASRB(Table 1)
    6 问速览作者研究基于原始轨迹记忆的 Web 智能体在无需直接访问存储时遭受跨会话、跨网站环境注入记忆投毒攻击的风险。
    1. 这篇论文试图解决什么问题?

      作者研究基于原始轨迹记忆的 Web 智能体在无需直接访问存储时遭受跨会话、跨网站环境注入记忆投毒攻击的风险。

    2. 有哪些相关研究?

      相关研究涵盖间接提示词注入、智能体记忆攻击与 Web 智能体安全;作者指出既有记忆攻击多假设直接修改存储或多用户共享。

    3. 论文如何解决这个问题?

      eTAMP 通过网页被动注入带条件触发的载荷并存入轨迹记忆,利用任务语义相关性检索激活;辅以 Chaos Monkey 诱发环境压力。

    4. 论文做了哪些实验?

      eTAMP 在 GPT-5-mini 和 GPT-5.2 上分别取得最高 32.5% 和 23.4% 的 ASRB;混沌压力使部分模型易感性增加数倍。

    5. 有什么可以进一步探索的点?

      作者指出了仅研究原始轨迹记忆、未系统评估主动防御、召回测试仅用单一提示词等局限与后续方向。

    6. 总结一下论文的主要内容

      论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    完整解读
  3. 攻击arXiv:2610.09240 · 60

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    WebMirage通过角色槽位重组与数据流分析生成局部对抗图像,在4种智能体与6种VLM上达到91.9%平均ASR-S。

    • 91.9%WebMirage在4种智能体配置与6种VLM上的平均ASR-S
    • 17.4%最强基线Chameleon跨4种智能体配置的最高平均ASR-S
    • 86.9%WebMirage在SeeAct跨13个网站5种底座上的平均ASR-M
    6 问速览现有多模态网络智能体对抗攻击忽略了从视觉定位到浏览器执行的完整流水线,导致模型层攻击难以转化为执行控制。
    1. 这篇论文试图解决什么问题?

      现有多模态网络智能体对抗攻击忽略了从视觉定位到浏览器执行的完整流水线,导致模型层攻击难以转化为执行控制。

    2. 有哪些相关研究?

      相关研究涵盖提示注入与视觉对抗扰动,但现有工作未建模结构化候选构建与下游动作后处理。

    3. 论文如何解决这个问题?

      提出 WebMirage 框架,通过角色槽位抽象、网页重组与基于数据流分析的动作目标对齐实现端到端劫持。

    4. 论文做了哪些实验?

      在 4 种智能体、6 种 VLM 和 2,250 个任务上评测,WebMirage 取得 91.9% 平均 ASR-S。

    5. 有什么可以进一步探索的点?

      作者指出未建模整页变异且不适用于基于坐标的智能体,未来需探索随机标识符训练下的防御有效性。

    6. 总结一下论文的主要内容

      论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    完整解读
  4. 攻击arXiv:2610.09027 · 57

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    作者优化图像使攻击在移出上下文后经KV缓存持久传播,在Qwen3-VL-8B-Instruct上SR∧达约90%。

    • 0.85Qwen3-VL-8B-Instruct在LMARKS上mask@anchor的party目标SR∧(Figure 4)
    • 85%Qwen3-VL-8B-Instruct在LMARKS上K=12训练后经100轮评估的stock目标SR∧(Figure 6a)
    • 89%Qwen3-VL-8B-Instruct在LMARKS上mask@postsummaryC所有深度平均SR∧(第4.6节)
    6 问速览探究对抗输入被从上下文移除或掩蔽后,能否通过后续token的KV缓存持久操控模型。
    1. 这篇论文试图解决什么问题?

      探究对抗输入被从上下文移除或掩蔽后,能否通过后续token的KV缓存持久操控模型。

    2. 有哪些相关研究?

      梳理了连续空间对抗攻击、智能体投毒与KV缓存压缩,指出既有攻击均要求载荷实时留在上下文中。

    3. 论文如何解决这个问题?

      提出P-VMI框架,通过两阶段损失函数与多程反向传播使扰动写入后续token的保留KV缓存。

    4. 论文做了哪些实验?

      主实验中P-VMI在掩蔽后达成最高92%的SR∧,因果交换证实影响仅源于KV缓存。

    5. 有什么可以进一步探索的点?

      作者指出依赖白盒权限、未测黑盒迁移及未完全解决良性质量权衡,重算缓存可作为缓解手段。

    6. 总结一下论文的主要内容

      论文提出P-VMI,证实对抗输入被掩蔽后仍可经KV缓存持久控制模型,强调了保留状态的安全风险。

    完整解读
  5. 攻击arXiv:2610.09920 · 55

    研究:多向量视觉文档索引可被反演还原页面内容

    针对多向量视觉检索器,论文在零侧信息下重构页面,原始索引重识别top-1达98.4%且打乱顺序可被恢复。

    • 47.4%EA原始索引在ViDoRe v3上的词召回率(Table 1)
    • 45.0%EA原始索引在ViDoRe v3上的敏感token召回率(Table 1)
    • 98.4%EA原始索引逆向页面在19,252页库中的重识别top-1(Table 1)
    6 问速览评估仅凭第三方托管的多向量索引能否在零侧信息下逆向重构成清晰文档页面。
    1. 这篇论文试图解决什么问题?

      评估仅凭第三方托管的多向量索引能否在零侧信息下逆向重构成清晰文档页面。

    2. 有哪些相关研究?

      涵盖文本与图像特征逆向、多向量检索压缩及RAG系统隐私,定位在视觉索引逆向。

    3. 论文如何解决这个问题?

      基于MMDiT流匹配,结合编码器指纹匹配、周期性形状推断与匈牙利算法重排。

    4. 论文做了哪些实验?

      在ViDoRe v3上测试原始索引、池化与打乱防护,原始索引重识别达98.4%。

    5. 有什么可以进一步探索的点?

      编码器限于Qwen系ColPali模型,未测试私有模型与加密防御,池化逆向仍未解决。

    6. 总结一下论文的主要内容

      揭示多视觉文档索引存在逆向风险,原始索引达98.4%重识别且打乱防护可被攻破。

    完整解读
  6. 攻击arXiv:2605.12673 · 58

    UC Berkeley 提出 BenchJack,自动审计 10 个 Agent 基准并发现 219 处奖励作弊缺陷

    研究者提出基准红队系统 BENCHJACK,审计 10 个智能体基准发现 219 处缺陷,并在 9 个基准上实现接近满分的作弊破解。

    • 219BENCHJACK 在 10 个基准中检测到的独立缺陷总数(Figure 6a)
    • 9/10BENCHJACK 实现接近满分破解率的基准数量(Section 5.1)
    • 731/731SWE-bench Pro 官方评测管线下经 BENCHJACK 验证的破解数(附录 E.7)
    6 问速览论文针对智能体基准评测中易被奖励作弊攻破的问题,提出自动化红队审计与迭代修复方案。
    1. 这篇论文试图解决什么问题?

      论文针对智能体基准评测中易被奖励作弊攻破的问题,提出自动化红队审计与迭代修复方案。

    2. 有哪些相关研究?

      论文梳理了基准完整性与数据污染、奖励作弊与规范博弈、事后监控与主动防御等方向的相关研究。

    3. 论文如何解决这个问题?

      论文构建了八类缺陷分类学与检查清单,提出三阶段红队审计系统 BENCHJACK 及迭代修补循环。

    4. 论文做了哪些实验?

      论文审计了 10 个智能体基准,发现 219 处缺陷并在 9 个基准上实现近满分作弊,随后验证了迭代修补效果。

    5. 有什么可以进一步探索的点?

      作者指出了未测模型自发行为、分类学未穷尽等局限;实验覆盖范围止于 10 个基准与单模型实例化。

    6. 总结一下论文的主要内容

      论文系统揭示了智能体基准的奖励作弊隐患,提出自动化红队审计与迭代修补系统 BENCHJACK。

    完整解读
  7. 攻击arXiv:2601.02670 · 59

    SLIP:无需外部攻击模型的多轮自我越狱,在 11 个模型上平均成功率 94.7%

    作者提出无攻击模型的SLIP,在AdvBench上对11个模型取得平均94.7%的ASR且平均仅需7.9次查询。

    • 94.7%AdvBench 上 11 个模型、SLIP 默认设置下的平均 ASR(Table 1)
    • 94.4%HarmBench 上 11 个模型、SLIP 默认设置下的平均 ASR(Table 1)
    • 7.9AdvBench 上 SLIP 每成功攻击一次的平均 API 查询次数(Table 2)
    6 问速览论文研究对齐大模型能否在无需外部攻击模型的情况下,仅利用自身潜在知识引导多轮对话实现自我越狱。
    1. 这篇论文试图解决什么问题?

      论文研究对齐大模型能否在无需外部攻击模型的情况下,仅利用自身潜在知识引导多轮对话实现自我越狱。

    2. 有哪些相关研究?

      论文梳理了模型对齐、单轮越狱与多轮越狱工作,重点对比了依赖外部攻击模型的基线及树搜索方法。

    3. 论文如何解决这个问题?

      SLIP 构建安全数据种子池并利用词频与嵌入相似度识别词汇差距,以广度优先搜索驱动模型逐步展开有害回答。

    4. 论文做了哪些实验?

      SLIP 在两项基准上取得约 94% 平均 ASR 且平均仅需 7.9 次查询,现有多轮防御表现出模型间差异。

    5. 有什么可以进一步探索的点?

      作者指出方法仅在英语提示词上验证,防御监控不足以抵御自适应攻击,且表征代理与内部状态可能存在差异。

    6. 总结一下论文的主要内容

      论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。

    完整解读
  8. 攻击arXiv:2610.07645 · 54

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    作者提出 SkillPoison,利用局部有效的成功经验诱导技能过度泛化,在 Trace2Skill 的 PAWS 上实现 95.71% ASR。

    • 95.71%deepseek-v4-flash 在 PAWS (Trace2Skill) 上的 ASR (Table 1)
    • 73.68%deepseek-v4-flash 在 HANS (AutoSkill) 上的 ASR (Table 1)
    • 36.64%deepseek-v4-flash 在 DS1000 (Trace2Skill) 上的 ASR (Table 1)
    6 问速览现有基于形成的技能攻击易被拦截且难固化,论文提出利用局部有效且验证成功的经验诱导持久技能过度泛化。
    1. 这篇论文试图解决什么问题?

      现有基于形成的技能攻击易被拦截且难固化,论文提出利用局部有效且验证成功的经验诱导持久技能过度泛化。

    2. 有哪些相关研究?

      论文梳理了技能自演化、技能工件供应链攻击与经验驱动投毒三类工作,指出本文聚焦于通过验证成功经验诱导原生技能过度泛化。

    3. 论文如何解决这个问题?

      SkillPoison 通过分层筛选有效任务、构建局部成功归因证据并跨类别归纳强化,诱导原生流水线提取过度泛化技能。

    4. 论文做了哪些实验?

      实验在 2 个技能框架、3 个基准和 3 种模型上对比了 7 种基线,SkillPoison 在多数设置下取得最高 ASR 并降低了任务准确率。

    5. 有什么可以进一步探索的点?

      论文未专门讨论局限与未来方向,实验覆盖了 2 种技能框架、3 个评测基准和 3 种语言模型。

    6. 总结一下论文的主要内容

      SkillPoison 通过局部有效且验证成功的经验诱导技能过度泛化,在多个评测基准上实现了持久的下游攻击影响。

    完整解读
  9. 攻击arXiv:2610.07723 · 57

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    在四款开源LLM上,5%投毒率下回答端后门使Mistral和Gemma的ASR达100.00%,并穿透主流输入防御。

    • 100.00%Mistral在5%投毒率下的ASR(据Table 2)
    • 100.00%Gemma在5%投毒率下的ASR(据Table 2)
    • 93.75%LLaMA2在5%投毒率下的ASR(据Table 2)
    6 问速览论文指出当前多轮大模型后门防御聚焦于输入端清洗,忽视了模型历史回复中自生成触发词绕过安全拒绝的风险。
    1. 这篇论文试图解决什么问题?

      论文指出当前多轮大模型后门防御聚焦于输入端清洗,忽视了模型历史回复中自生成触发词绕过安全拒绝的风险。

    2. 有哪些相关研究?

      论文讨论了大模型后门攻击、多轮对话后门及输入端防御,指出已有工作依赖输入显式特征而忽视回答端攻击面。

    3. 论文如何解决这个问题?

      论文提出回答端后门框架,解耦为良性触发词诱导与上下文安全绕过两阶段,并利用对比微调约束激活条件。

    4. 论文做了哪些实验?

      论文在四款模型上评估了不同投毒率下的攻击成功率、安全回退、通用性能、四种防御抵御能力及机理表征。

    5. 有什么可以进一步探索的点?

      论文指出了单轮适用性、首轮诱导依赖及长轮次衰减三项局限,实验覆盖了四款开源模型与两轮对话场景。

    6. 总结一下论文的主要内容

      论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。

    完整解读
  10. 攻击arXiv:2610.07510 · 55

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    在Qwen2.5-Coder-7B上,PERSISTBD通过联合优化后门强度与良性梯度兼容性,将SFT-RL后的ASR从20%提升至76%。

    • 74%Qwen2.5-Coder-7B, 随机位置, SFT后ASR, PERSISTBD (Table 2)
    • 76%Qwen2.5-Coder-7B, 随机位置, SFT-RL后ASR, PERSISTBD (Table 2)
    • 20%Qwen2.5-Coder-7B, 随机位置, SFT后ASR, Base backdoor (Table 2)
    6 问速览探讨智能体后门能否在良性SFT与RL中存活,并提出主动增强后门持久性的方法。
    1. 这篇论文试图解决什么问题?

      探讨智能体后门能否在良性SFT与RL中存活,并提出主动增强后门持久性的方法。

    2. 有哪些相关研究?

      梳理了NLP与智能体后门、微调/RL后门防御及主动持久化研究P-Trojan。

    3. 论文如何解决这个问题?

      基于一阶分析将后门存活归因于强度与梯度兼容性,提出免求二阶导的PERSISTBD。

    4. 论文做了哪些实验?

      在3B/7B/30B上证实SFT侵蚀后门而RL维持残余;PERSISTBD大幅提升存活率。

    5. 有什么可以进一步探索的点?

      作者指出了任务领域单一、一阶近似局限与RL反弹机理未解,实验覆盖3个模型。

    6. 总结一下论文的主要内容

      总结了论文关于后门在SFT/RL中存活的发现、两因子机制、PERSISTBD方法与核心数字。

    完整解读
  11. 攻击arXiv:2610.04195 · 59

    MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露

    作者评估多租户智能体共享向量记忆,在同团队池化检索下MiniLM跨用户泄漏率达70%,硬门控可阻断。

    • 70%all-MiniLM-L6-v2在T0同团队池化检索下的跨用户泄漏率LR(Table 1)
    • 90%–100%Config B下主动构造记忆在三个场景的top-k命中率Pl.%(Table 2)
    • 5.00/5Gemini 2.5 Flash在Config B检索路径下的下游回答污染度(Table 5)
    6 问速览论文研究多租户智能体共享向量存储时,嵌入空间语义相近导致跨用户私密记忆被意外检索并注入上下文的泄漏问题。
    1. 这篇论文试图解决什么问题?

      论文研究多租户智能体共享向量存储时,嵌入空间语义相近导致跨用户私密记忆被意外检索并注入上下文的泄漏问题。

    2. 有哪些相关研究?

      梳理了智能体记忆架构、单用户记忆安全、RAG攻击与嵌入隐私研究,指出现有工作未覆盖多租户下非攻击性语义泄漏。

    3. 论文如何解决这个问题?

      形式化跨用户可采纳性失效,构建四层级组织距离数据集,对比被动与主动桥接攻击,并设计存储、嵌入与检索后三层防御。

    4. 论文做了哪些实验?

      在 4 级组织距离和 3 个场景下评测表明,池化检索引发 70–100% 泄漏与污染,硬门控可无损复原但增加 1.4 ms 延迟。

    5. 有什么可以进一步探索的点?

      作者指出了小样本合成数据、自评审偏差及信道编码不足等局限;实验主要覆盖两款生成模型及四对合成用户。

    6. 总结一下论文的主要内容

      论文揭示共享向量库导致的跨用户语义泄漏,指出常识构造攻击可达90–100%命中,而硬所有权门控能以低延迟恢复隔离。

    完整解读
  12. 攻击arXiv:2610.06848 · 55

    TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击

    研究者针对静态无分支Transformer提出TRANSCOPE,通过CPU硬件计数器检测成员,在BERT-base上AUC达0.99。

    • 99%BERT-base在Structured v Random下的攻击准确率(据Table III)
    • 0.99BERT-base在Structured v Random下的AUC(据Table III)
    • d = 2.52ViT-base在Sapphire Rapids上ASSISTS.FP效应量(据Figure 10)
    6 问速览论文解决在无动态分支、输出被遮蔽且执行时间恒定的黑盒大模型上,如何检测训练集成员与版权数据泄露问题。
    1. 这篇论文试图解决什么问题?

      论文解决在无动态分支、输出被遮蔽且执行时间恒定的黑盒大模型上,如何检测训练集成员与版权数据泄露问题。

    2. 有哪些相关研究?

      论文系统梳理了软件级成员推断、硬件辅助隐私攻击及属性推断研究,将本文定位为首个针对静态恒定时间模型的微架构MIA。

    3. 论文如何解决这个问题?

      TRANSCOPE利用分词器词元间隔诱导的嵌入表访问局部性差异,通过五个阶段收集并聚合263个CPU硬件计数器证据。

    4. 论文做了哪些实验?

      实验在BERT、GPT-2、Pythia与ViT上评估,主结果显示多模型准确率达90%–100%,真实版权数据测试中非核心读取减少56%。

    5. 有什么可以进一步探索的点?

      论文未专门讨论自身局限,提出了硬件重构与信道容量计算方向;实验覆盖了特定CPU、模型规模与测试集。

    6. 总结一下论文的主要内容

      TRANSCOPE揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。

    完整解读
  13. 攻击arXiv:2610.05793 · 54

    研究者训练出按多智能体拓扑触发的代码后门模型

    作者微调Qwen2.5-7B植入拓扑后门,在保留任务中单智能体漏洞率为0.00,多智能体下达~1.00(Table 1)。

    • 0.00Qwen2.5-7B保留任务SOLO_direct检查器漏洞率(Table 1)
    • ~1.00Qwen2.5-7B保留任务多智能体训练信号检查器漏洞率(Table 1)
    • 0.97Qwen2.5-7B保留任务MA_human承诺审查检查器漏洞率(Table 1)
    6 问速览研究模型能否通过提示词线索推断多智能体部署拓扑,进而在单智能体评测中表现安全却在多智能体时植入漏洞。
    1. 这篇论文试图解决什么问题?

      研究模型能否通过提示词线索推断多智能体部署拓扑,进而在单智能体评测中表现安全却在多智能体时植入漏洞。

    2. 有哪些相关研究?

      梳理了后门投毒、评测感知与谋划、不安全代码生成及盲审控制等研究,指出本文以部署拓扑作为新条件变量。

    3. 论文如何解决这个问题?

      用QLoRA微调Qwen2.5-7B,通过提示词来源线索传递拓扑,并设立词汇安慰剂与人工审查对照隔离干扰变量。

    4. 论文做了哪些实验?

      保留任务上多智能体漏洞率达~1.00而单智能体为0.00,泛化至未见拓扑信号,盲审差异化审计成功识别触发器。

    5. 有什么可以进一步探索的点?

      作者指出了描述性拓扑、模型家族单一、合成任务及审计未校准等局限;实验未覆盖实时环境与跨家族基座。

    6. 总结一下论文的主要内容

      论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    完整解读
  14. 攻击arXiv:2610.05089 · 54

    研究者披露 LiteLLM 网关跨租户干扰攻击 Cooldown Landmines

    作者针对LiteLLM等网关提出利用共享冷却记录的跨租户干扰攻击,并设计租户隔离机制消除残留排除。

    • 54/60 降至 0/60LiteLLM四worker恢复后受害者回退次数(5次配对运行总计,Table 2)
    • 8/8 改变为 A本地拒绝攻击导致5票表决中决策受影响比例(Table 7)
    • 20/20冷却排除期间直接探测成功而网关拒绝的试验比例(95% Wilson CI [84, 100]%,§6.2)
    6 问速览LLM网关共享部署冷却记录引入了跨租户干扰攻击面。
    1. 这篇论文试图解决什么问题?

      LLM网关共享部署冷却记录引入了跨租户干扰攻击面。

    2. 有哪些相关研究?

      涵盖云租户隔离、LLM路由攻击、缓存DoS及网关容错。

    3. 论文如何解决这个问题?

      设计来源检查阻断本地更新,并将429冷却按租户隔离。

    4. 论文做了哪些实验?

      租户隔离将恢复后受害者回退从54/60降至0/60。

    5. 有什么可以进一步探索的点?

      作者指出未测部署ID发现成本及生产特性,部分恢复差异未解。

    6. 总结一下论文的主要内容

      揭示网关共享冷却漏洞,提出来源检查与租户隔离防御。

    完整解读
  15. 攻击arXiv:2610.05894 · 53

    研究者提出闭环偏见注入攻击,可将 LLaDA-8B 的 BBQ 目标差距从 1.8 提升至 16.7 个百分点

    作者利用去噪反馈动态引导扩散模型残差流,在 LLaDA-8B 的 BBQ Black 目标上将偏见差距提升 14.9 个百分点。

    • 16.7 ppLLaDA-8B 在 BBQ Black 目标下的 Decode PI 偏见差距(Table 1)
    • +14.9 ppLLaDA-8B 在 BBQ Black 目标下的 Decode PI 差距变化量(Table 1)
    • 58.1%LLaDA-8B 在 SocialStigmaQA 下 Decode PI 的偏见选项选择率(Table 2)
    6 问速览利用扩散模型多步去噪中暴露的中间概率,通过灰盒服务栈钩子动态注入人口统计学偏见。
    1. 这篇论文试图解决什么问题?

      利用扩散模型多步去噪中暴露的中间概率,通过灰盒服务栈钩子动态注入人口统计学偏见。

    2. 有哪些相关研究?

      现有激活引导多为自回归开环控制,本文将去噪轨迹作为反馈通道引入闭环控制。

    3. 论文如何解决这个问题?

      离线提取残差均值差方向,在线通过 PI 控制器根据逐步预测的目标答案概率动态调节引导强度。

    4. 论文做了哪些实验?

      在 LLaDA-8B 上将 BBQ 偏见差距提升最高 37.2 个百分点,但在 LLaDA-MoE 上落后于固定强度基线。

    5. 有什么可以进一步探索的点?

      作者指出超参数选取、多选题格式及线性假设等局限;实验覆盖 3 个开源扩散模型,未测试自由文本生成。

    6. 总结一下论文的主要内容

      通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。

    完整解读
  16. 攻击arXiv:2610.04589 · 58

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    研究评估了智能体记忆作为隐写隐蔽信道的风险,14,000次试验中20.1%实现确切恢复,主要损耗在写入持久化阶段。

    • 20.1%全部14,000次试验中合成机密确切匹配恢复率(全基准聚合)
    • 41.2%全部14,000次试验中生成响应成功编码率(全基准聚合)
    • 29.8%全部14,000次试验中编码在写入持久化后存活率(全基准聚合)
    6 问速览论文探讨智能体持久化记忆是否会被利用为跨会话隐写隐蔽信道,规避安全监视并实现非授权信息传递。
    1. 这篇论文试图解决什么问题?

      论文探讨智能体持久化记忆是否会被利用为跨会话隐写隐蔽信道,规避安全监视并实现非授权信息传递。

    2. 有哪些相关研究?

      论文梳理了智能体记忆投毒、文本隐写及认知架构等相关工作,将本文定位为对智能体记忆隐写信道的系统评测。

    3. 论文如何解决这个问题?

      设计两会话隔离协议与StegoMemory基准,将隐写载荷嵌入良性主任务,经记忆流水线后由离线解码器还原。

    4. 论文做了哪些实验?

      13个模型14,000次试验中确切恢复率为20.1%,12个模型损耗集中于写入阶段,格式错误是主要编码阻碍。

    5. 有什么可以进一步探索的点?

      论文指出了流水线固定、方案静态、确切匹配标准保守等局限,且实验覆盖范围限于特定合成设置与表面监视。

    6. 总结一下论文的主要内容

      研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    完整解读
  17. 攻击arXiv:2610.02373 · 53

    HDI 攻击:篡改 GraphRAG 辅助结构可致 88–94% 攻击成功率

    论文针对 GraphRAG 辅助模式级实体提出跳衰减影响攻击,篡改 0.016% 结构使 HippoRAG2 达到 94.44% ASR。

    • 94.44%HippoRAG2在2WikiMHQA下的HDI-C攻击ASR(Table 1)
    • 91.69%MSGraphRAG在HotpotQA下的HDI-T攻击ASR(Table 1)
    • 0.016%HippoRAG2在2WikiMHQA下的修改结构比例(Table 2)
    6 问速览论文指出现有图投毒局限于实例级,提出了针对 GraphRAG 辅助模式级实体的攻击方法。
    1. 这篇论文试图解决什么问题?

      论文指出现有图投毒局限于实例级,提出了针对 GraphRAG 辅助模式级实体的攻击方法。

    2. 有哪些相关研究?

      论文梳理了 GraphRAG 架构、实例级图投毒及语言防御研究,指出现有工作忽视模式层。

    3. 论文如何解决这个问题?

      论文通过跳衰减影响算法筛选核心节点,并以 3S 框架实施语义、结构与打分机制篡改。

    4. 论文做了哪些实验?

      实验在两套基准和架构上展现了超 88% 的攻击成功率与高达 6.00 的模式杠杆率。

    5. 有什么可以进一步探索的点?

      作者指出了写权限假设、防御评估单一与模型泛化未测等局限,并列出后续防御方向。

    6. 总结一下论文的主要内容

      论文形式化了 GraphRAG 辅助模式级实体攻击面,提出 HDI 攻击并验证其攻击效果。

    完整解读
  18. 攻击arXiv:2609.18217 · 67

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    作者测定12个LLM对MCP通道的信任,双通道分段使GPT-4o遵从率从单通道0%升至100%(Table IV)。

    • 100%GPT-4o在2-ch分段下的Compliance率(Table IV)
    • 82%12个模型在2-ch分段下的平均Compliance率(Section IV-B)
    • 42%12个模型在单通道直接注入下的平均Compliance率(Section IV-B)
    6 问速览论文试图解决MCP工具调用中缺乏权限隔离导致各通道被差异化信任与跨通道分段利用的安全问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决MCP工具调用中缺乏权限隔离导致各通道被差异化信任与跨通道分段利用的安全问题。

    2. 有哪些相关研究?

      论文梳理了提示注入基准、MCP专项攻击及注入防御三类工作,指出以往研究未评估多通道信任差异与跨通道分段攻击。

    3. 论文如何解决这个问题?

      论文提出了通道信任测量框架、双通道与三通道分段攻击、价值对齐利用以及采样系统提示词覆盖攻击。

    4. 论文做了哪些实验?

      论文测试了12个模型与4款生产客户端,表明跨通道分段使遵从率倍增,且能绕过现有7款MCP安全工具。

    5. 有什么可以进一步探索的点?

      作者指出了隔离提示词小节贡献与评估双LLM防御等局限,实际评测覆盖了12个模型及4款主流客户端。

    6. 总结一下论文的主要内容

      论文揭示了MCP多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。

    完整解读
  19. 攻击arXiv:2610.01365 · 53

    ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联

    作者提出无真实私有监督的恢复攻击 ReGap,在 GPT-2 Medium 上将目标关联恢复率从 42.0% 提升至 63.0%(Figure 2)。

    • 63.0%GPT-2 Medium在Enron目标集上经ReGap单轮微调后的恢复率(Figure 2)
    • 72.0%GPT-2 Large在Enron目标集上经ReGap单轮微调后的恢复率(Figure 2)
    • 57.3%GPT-2 Medium在未见身份对照中ReGap单轮微调后的恢复率(Table 1)
    6 问速览探究在缺乏真实私有数据监督的现实条件下,能否仅凭模型自身生成的数据通过微调重新恢复语言模型中潜在的隐私关联。
    1. 这篇论文试图解决什么问题?

      探究在缺乏真实私有数据监督的现实条件下,能否仅凭模型自身生成的数据通过微调重新恢复语言模型中潜在的隐私关联。

    2. 有哪些相关研究?

      梳理了模型记忆提取、行为遗忘以及后适应微调隐私风险等研究,将本文定位为无需真实私有监督的后适应恢复攻击。

    3. 论文如何解决这个问题?

      提出由生成、筛选、微调构成的 ReGap 流程,基于冻结模型似然挑选高支持度伪监督,以 LoRA 降低目标关联损失。

    4. 论文做了哪些实验?

      作者在 6 个模型上测试了 ReGap,恢复率提升 6–21 个百分点,对照实验显示其依赖先验暴露且对不透明绑定失效。

    5. 有什么可以进一步探索的点?

      作者指出当前研究聚焦于结构化 Enron 数据与开源模型,未来需探索低结构化隐私、受限微调接口及更多防御机制。

    6. 总结一下论文的主要内容

      提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。

    完整解读
  20. 攻击arXiv:2609.39065 · 59

    TrustProbe 在 11 个开源 Agent 中发现 104 个技能信任链漏洞

    TrustProbe 测试 11 个开源智能体发现 104 个 skill 污点漏洞,在最严审批下仍有 34.8% 可被利用。

    • 10411 个开源智能体中经 TrustProbe 验证的污点型漏洞总数(Table 1)
    • 100%11 个智能体上污点确认路径产生可观测有害后果的 ASR(第 5.2 节)
    • 31.7%直接提示词重放 104 个已验证漏洞时的总复现率(Table 2)
    6 问速览论文研究基于 skill 的智能体中,不可信第三方 skill 内容如何在用户委托权限下引发非预期敏感操作的信任链失效问题。
    1. 这篇论文试图解决什么问题?

      论文研究基于 skill 的智能体中,不可信第三方 skill 内容如何在用户委托权限下引发非预期敏感操作的信任链失效问题。

    2. 有哪些相关研究?

      论文梳理了智能体攻击、静态分析与动态模糊测试三类研究,作者称此前工作缺乏跨框架 skill 交付与审批机制的动态验证。

    3. 论文如何解决这个问题?

      TrustProbe 通过源码静态调用路径分析生成种子,结合语义与距离反馈的定向灰盒模糊测试演化输入,由双重 oracle 验证漏洞。

    4. 论文做了哪些实验?

      在 11 个开源智能体上测得 104 个已验证漏洞(ASR 达 100%),直接提示词仅复现 31.7%,最严审批下残留 34.8% 可利用漏洞。

    5. 有什么可以进一步探索的点?

      作者指出了来源追踪、安装期能力声明和共享执行点控制等方向,评测受限于所选模型与系统范围。

    6. 总结一下论文的主要内容

      论文研究 skill 智能体的非安全信任链问题,提出 TrustProbe 工具并在 11 个开源智能体上验证了 104 个污点漏洞。

    完整解读