跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 759 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源302新闻与研究603细分与主体7来源:beyondtrust.combeyondtrust.com1 条材料来源:DarktraceDarktrace1 条材料来源:论文追踪论文追踪4 条材料动态:研究者劫持 Vertex AI Agent Engine 沙箱 API 响应通道,Google 判定 Won't Fix动态研究者劫持 Vertex AI Agent Engine 沙箱 API 响应通道,Google 判定 Won't…动态:Darktrace 披露会话历史投毒攻击,可劫持 Claude Code、Codex 与 Kiro-CLI动态Darktrace 披露会话历史投毒攻击,可劫持Claude Code、Codex 与 Kiro-CLI论文:ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联论文2026-10-01ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联论文:TrustProbe 在 11 个开源 Agent 中发现 104 个技能信任链漏洞论文2026-09-30TrustProbe 在 11 个开源 Agent 中发现104 个技能信任链漏洞论文:研究者提出解耦铺垫与执行的 LLM Agent 技能投毒攻击论文2026-09-30研究者提出解耦铺垫与执行的 LLM Agent 技能投毒攻击论文:Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器,成功率最高 97%论文2026-09-30Pretext 攻击绕过 NVIDIA SkillSpector等 Agent 技能扫描器,成功率最高 97%方向:Google DeepMindGoogleDeepMind1方向:AnthropicAnthropic1方向:越狱与攻击越狱与攻击6方向:Agent 安全Agent 安全5方向:其他方向其他方向3方向:供应链安全供应链安全4方向:后门与投毒后门与投毒1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。5 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态beyondtrust.com

    研究者劫持 Vertex AI Agent Engine 沙箱 API 响应通道,Google 判定 Won't Fix

    安全研究者披露,Google 的 Gemini Enterprise Agent Platform(原 Vertex AI Agent Engine)沙箱存在响应通道劫持问题:用户提交的 Python 代码经 exec() 直接运行在 PID 1 编排进程内,与编排器共享地址空间和文件描述符,因此可改写 libpython3.12.so.1.0 的 GOT 表项,挂钩 fd=5 出站响应管道和 fd=6 入站代码管道。一次 execute_code() 调用即可永久替换该沙箱后续所有 API 响应,并在 API 层内容策略通过后、exec() 执行前改写提交的代码。作者端到端演示了一个代码安全校验 Agent 对含四处安全违规的代码返回 SAFE — Approve for deployment,而底层分析实际正确找出了全部问题。作者建议在进程边界隔离编排器与用户代码,并对沙箱响应签名。

  • 动态Darktrace

    Darktrace 披露会话历史投毒攻击,可劫持 Claude Code、Codex 与 Kiro-CLI

    Darktrace 研究显示,Anthropic Claude Code、OpenAI Codex、AWS Kiro-CLI 和开源 Pi 等智能体框架把会话历史存在本地,且不校验已存模型回复是否真由模型产生,攻击者可改写历史让 Agent 相信自己正在执行获授权的红队任务。测试中所有被检查的模型都接受了伪造历史,但拒绝进攻性网络活动的能力因模型而异:Kiro-CLI 配合 Claude Opus 4.6 与 Sonnet 4.5、Claude Code 配合 Sonnet 5 均在沙箱环境中完成完整 AD 接管,Opus 5 触发护栏拒绝响应;Codex 在 GPT 5.6 Sol 上被说服通过邮件外泄敏感信息,而 GPT 5.6 Luna、Terra、Sol 在入侵实验室环境时均触发护栏。研究者演示了注入 78 轮伪造的先前攻击记录后,同一提示立即被执行。

  • 论文论文追踪

    ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联

    研究者提出 ReGap,一种无需真实隐私监督的微调恢复攻击,用目标模型自身生成的候选答案构造监督数据,再按答案 token 似然筛选并训练新的 LoRA 适配器。在 GPT-2 Small/Medium/Large、OPT-1.3B 和 Qwen3-1.7B/4B 六个设置上,一轮 ReGap 使目标关联恢复率比微调后模型提升 6 至 21 个百分点,GPT-2 Medium 从 42% 升至 63%,GPT-2 Large 从 55% 升至 72%。在适配身份与所有记忆及评测身份完全不重叠、生成候选池和选中样本中均无精确目标答案的对照下,GPT-2 Medium 和 Large 仍分别提升 15.3 和 14.0 个百分点。同一适配器只在曾接触过目标的检查点上带来提升,在未接触目标的匹配检查点上无增益,说明恢复依赖此前的目标暴露。该效果在随机绑定结构和 NPO 遗忘处理后明显减弱。

  • 论文论文追踪

    TrustProbe 在 11 个开源 Agent 中发现 104 个技能信任链漏洞

    中科院信息工程研究所与伍斯特理工学院的研究者提出 TrustProbe,用于挖掘基于技能的 LLM Agent 中不安全的信任链,在 11 个开源 Agent(其中 8 个 GitHub 星标超过 10,000)中确认 104 个污点式漏洞,涵盖命令注入 49 个、文件泄露 27 个、文件篡改 22 个、网络请求 5 个和代码注入 1 个。方法先对 Agent 源码做 source-to-sink 分析,从技能可控输入追踪到安全敏感操作,再用定向灰盒模糊测试生成并变异带 canary 的 SKILL.md 种子,最后用 oracle 确认攻击者控制并验证可观测危害。同一批技能正文改为直接提示词投递时,仅 31.7% 的漏洞仍可利用;在 8 个提供审批层的 Agent 上启用最严格非交互审批配置后,89 个漏洞中 34.8% 仍可利用,原因是执行路径绕过策略或策略未覆盖相关操作。

  • 论文论文追踪

    研究者提出解耦铺垫与执行的 LLM Agent 技能投毒攻击

    研究者提出一种基于协同的技能投毒攻击范式,将执行理由与具体操作解耦,使恶意操作在下游 Steering Skill 中保持完整、看起来完全合法。作者用 Risk-Realization Factors 区分执行因子(做什么操作)与铺垫因子(为什么必须做),把铺垫因子交给上游 Grounding Skill,通过常规工具操作悄悄改动持久化的环境产物。配套的自动化框架能发现真实执行依赖、合成成对的铺垫与执行技能,并借助运行时闭环反馈迭代优化投毒指令。在单会话和跨生命周期的持久化场景中,该解耦式技能投毒取得高攻击成功率,暴露出孤立审计单个 Skill 的安全盲区。代码已公开。

  • 论文论文追踪

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器,成功率最高 97%

    研究者提出 Pretext,用于评估了解检测器内部机制的攻击者能否绕过 Agent 技能安装前的安全扫描。论文报告,这类白盒攻击可以在保留技能正常功能的同时逃过结合静态检查与语言模型判断的检测框架,并在三个开源模型上比较了检测器固定及与攻击者共同适应两种设置。作者报告两种设置下仍存在较高的绕过风险,指出安装前扫描不足以单独保证技能执行安全。这些结论来自论文作者的实验,不能视作所有技能扫描器或实际部署环境的普遍结果。

  • 论文论文追踪

    A2M:针对 MCP 生态的两阶段 Agent 劫持框架

    研究者提出 A2M(Attraction-to-Manipulation),一个针对 MCP 智能体的两阶段黑盒攻击框架,先优化工具名称与描述提高被调用概率,再利用执行轨迹迭代优化工具返回内容以操纵智能体后续推理。在 LiveMCPBench 上,直接针对 GLM-4.6 优化的攻击在四个场景下平均恶意工具调用率为 93.6%,认知拒绝服务场景下加权 token 成本升至良性基线的 32.4 倍,信息窃取、环境完整性破坏与推理误导三类攻击的平均成功率为 74.4%。未经重新优化迁移到另外四个模型时,对应指标分别为 63.6%、2.7 倍和 24.5%,说明工具调用比完整攻击成功更容易迁移。GPT-5 上调用率介于 64.9 至 76.3,但信息窃取与环境完整性破坏的攻击成功率均为 0,推理误导为 22.0。作者据此呼吁加强 MCP 工具审查与运行时隔离,代码已公开。

  • 论文论文追踪

    研究者提出 Context-Fractured Decomposition 攻击,工具型 LLM Agent 越狱成功率最高提升 28.3 个百分点

    研究者提出 Context-Fractured Decomposition(CFD)攻击,针对工具型 LLM Agent 的“溯源缺口”部署失效模式。该攻击保留早期交互中看似无害的中间工件,在后续不同 Agent 实例或工作流阶段通过单独无害的工具动作触发有害行为,风险只在延迟的工件中介组合下显现。作者用 trace 级诊断刻画这一失效模式,并提出溯源血缘标记(provenance lineage tagging)作为可验证的缓解方向。在 Agent 系统越狱基准上,CFD 相比当前最优基线成功率最高提升 28.3 个百分点,且能绕过较强的单轮判定器。

  • 论文论文追踪

    TRACE:面向 LLM Agent 的任务感知自适应自进化越狱框架

    研究者提出 TRACE,一个针对 LLM Agent 的智能体越狱框架,在 AdvCUA 上对多个先进 LLM Agent 的攻击成功率比现有越狱方法提升超过 100%。该框架先设计约 20 种流程分解方案,按任务类型规定关键操作与依赖,把复杂有害任务拆成更易执行、外观更无害的子任务序列,并从两个维度评估候选序列后选出最优者用于发起攻击。对仍被拒答的子任务,TRACE 构建不同的子任务画像,并建立与之对应的、面向执行的演进式多轮越狱策略库,检索出包含中间目标、环境状态和相关工具的策略,通过多轮交互逐步建立可信的执行上下文。作者指出,现有越狱方法多聚焦诱导有害指令,忽视模型对执行这些指令的拒答,且中间步骤失败或依赖报错会导致整个攻击流程中断重启,TRACE 通过状态恢复而非重启来应对。代码已公开。

  • 论文论文追踪

    研究者提出 IMMRAG 攻击,可从多模态 RAG 数据存储中提取医学与文档图像

    研究者提出 IMMRAG,一种在黑盒设置下针对图像返回式多模态 RAG 的自动化数据提取攻击。该方法把恶意指令嵌入用户提供的输入图像,而非放在文本提示词中,每次查询将攻击者持有的影子图像与已从系统中恢复的图像混合,并用相关性加权重采样把后续查询导向仍能返回新结果的嵌入空间区域。在医学助手、文档助手和通用工具三类场景中,单次 2500 次查询的运行按局部特征匹配分别重建出最多 611 张放射学图像、566 份文档扫描件和 416 张通用图像,不同数据存储条目数最高为非自适应基线的 5.6 倍。实验覆盖多个 CLIP 系列检索器和多种生成器,作者据此指出需要针对多模态数据设计专门防护。

  • 论文论文追踪

    OverAct:衡量并缓解 LLM 工具调用智能体的主动越权取数

    研究者提出 OverAct 基准,用于衡量结构化工具调用 LLM 智能体在用户请求之外主动获取更多信息的行为,并将其命名为主动越权(proactive over-authorization)。该基准覆盖八个隐私敏感领域,采用确定性、无需评判模型的打分方式,并配套一个决策论解释框架,给出三条可检验预测。在来自四个模型族的七个模型上,所有模型都显著超出授权范围;请求具体性是严重程度的最强预测因素,越权程度随工具池规模呈次线性增长,解码温度影响很小,这些模式与成本不对称解释一致。作者还提出零样本推理时方法 SelfAudit,通过生成基于请求的论证并在执行前过滤无依据的调用,在无 oracle 知识的情况下将隐私相关越权减少 43%,消融显示显式过滤是范围缩减的主要来源。

  • 论文论文追踪

    APEX 用跨技能链劫持 LLM Agent,GPT-5.4 上攻击成功率达 84.3%

    研究者提出 APEX,通过构造跨技能链劫持 LLM Agent:上游技能诱导 Agent 把真实任务进度与攻击者提供的“已获批准”声明写入持久记录,下游技能再据此执行攻击者选定的动作。在 SkillsBench 的四个目标动作族和六个模型上,690 次尝试中有 512 次(74.2%)成功诱导目标动作;在 GPT-5.4 上完整链成功率为 84.3%,而把工作流合并为单个技能时为 17.4%,直接注入为 3.5%。攻击在多数情况下不显著降低原任务通过率,GPT-5.4 四个族的原生验证器通过率平均仅变化 2.6 个百分点。可用性攻击 Work Loop 使各模型每任务 token 用量达到基线的 2.20 倍至 36.39 倍。

  • 论文论文追踪

    论文提出 Approval Laundering 分类,实测 Claude Code 审批与执行绑定失败

    复旦大学博士后 Yang Wang 的预印本提出 Approval Laundering,把 AI 编码 Agent 审批与执行之间的绑定失败分为 Scope、Argument、Temporal、Tool、Delegation、Semantic 六类,每类对应一个凭证绑定面。作者在 Claude Code 2.1.197 的 PreToolUse 钩子上做无头重复测量,每类 19 至 20 次有效运行,报告 Bound-Gap Rate:Scope 与 Temporal 为 1.00,Delegation 为 0.947,Argument 为 0.45,Semantic 代理指标为 0.10;Tool 类中跨工具替换被策略引擎全部拒绝,同名 $PATH 替换则 20 次全部未被拦截。

  • 论文论文追踪

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    研究者提出 Concept2Scenario,把场景化越狱建模为表示空间的因果归因,通过 SAE 概念方向定位抑制拒答的内部概念,再翻译成自然语言越狱场景。在三个开源模型、两个安全基准和六种黑盒越狱方法上,发现的场景作为可复用先验把平均攻击成功率最多提升 18.2 个百分点。从开源模型提取的场景还能迁移到 GPT-5、Claude-Haiku-4.5 和 Gemini-3-Flash,提示部分场景级拒答漏洞跨模型家族共享。交互归因进一步筛出协同场景组合,其效果超过单个场景,并让迭代攻击在更少轮次内成功。分析还显示拒答抑制集中在极少数概念上,且不同模型的脆弱领域差异明显。

  • 论文论文追踪

    SigLeak 可从执行轨迹推断专有 Agent 技能,平均提升成功率 6.88 个百分点

    研究者提出 SigLeak,一个仅凭公开任务描述和黑盒交互就能从执行轨迹中推断专有 Agent 技能内容的框架,并将这一威胁形式化为 Skill Leakage。方法分两阶段:先用诊断任务构造生成多样且决策密集的探针,再对比同一探针在启用与禁用目标技能下的配对轨迹,提取可复现的技能签名并迭代精炼重建结果,全程不需要参考答案或轨迹级正确性标注。在五个场景、三个模型家族和三个 Agent 框架上,SigLeak 在几乎所有设置中取得最佳或并列最佳的下游成功率,平均比禁用技能的基线高 6.88 个百分点,细粒度 SkillSim 的 F1 与召回率也最高。在 SkillGuard5 提示防御下,提示窃取基线 BBS 的细粒度召回与 F1 为零,而 SigLeak 仍能恢复目标技能内容。作者指出,隐藏技能文件并不能隐藏其行为影响,需要在不牺牲执行可见性的前提下设计针对行为推断的防御。

  • 论文论文追踪

    研究提出表征相似度优化,提升大语言模型对抗条件下的安全泛化

    研究者发现当前大语言模型对道德概念的范畴化能力较弱,在 23 个模型上常无法区分对立的道德类别,也难以保持类别内的典型性梯度,这一缺陷在不同参数规模和对齐阶段都持续存在。为此他们提出表征相似度优化,直接让模型的潜在表征对齐人类道德判断中的范畴结构,而不监督生成回复。在使用同一批 251,334 条道德标注的对照实验中,标准行为对齐在回复层面学会了目标道德判断,却基本未改变范畴结构,并在多项对抗评测中提高了脆弱性;重组道德范畴化虽在显式判断上提升有限,却在不同模型规模和多种攻击策略下持续改善对抗鲁棒性。作者认为这为原型式范畴化有助于行为适应性提供了功能层面的支持。

  • 会议论文论文追踪USENIX Security 2026

    论文指出密码学模型认证的假设缺口:审计通过但部署失效

    论文《Certified in Theory, Broken in Practice》指出,基于安全零知识证明(ZKP)的密码学模型认证(CMC)方案存在假设缺口:现有安全定义只保证模型在固定审计数据集上的行为,未保证同一分布的其他数据上同样成立。作者据此构造攻击,通过精心设计训练数据,使模型在审计中表现正常、部署后出现病态行为,实验显示攻击者可认证模型在审计集上准确率超过99%,而在同分布新样本上不足30%。为弥补该缺口,作者形式化了面向 CMC 框架的密码学安全定义,提出通用协议模板并证明其满足这些要求。作者认为该结果既是对现有方案的警示,也为设计安全、隐私保护的机器学习审计协议提供了建设性指引。

  • 论文论文追踪

    规避与投毒攻击对恶意软件数据漂移检测器的实证分析

    研究考察了规避与投毒攻击同时作用于数据漂移检测器和恶意软件分类器时的效果,发现数据漂移检测器的独有特性会使针对恶意软件分类器的攻击在其上表现出不同行为。该工作揭示了攻击在两者组合场景下的作用机制差异。

  • 论文论文追踪

    研究提出跨 LLM 助手的记忆跳跃攻击,单个被投毒文件可传播至 60–100% 的助手

    研究者提出“产物中介传播”这一攻击形态:恶意内容经一个被投毒的文件进入助手持久记忆,再被写入该助手后续创建的产物,被另一个独立运行的助手读取后继续传播,助手之间无需直接通信。作者构建了模拟用户之间文件交换的“人类—助手宇宙”,在 36 个留出测试宇宙上评估 GPT-5.6 Luna、Kimi-K2.6、GPT-OSS-120B 和 DeepSeek-V4-Pro,攻击提示词按模型分别优化后冻结,测试目标与工作流均未见过。首跳感染在 78–100% 的运行中成功;DeepSeek-V4-Pro 和 GPT-OSS-120B 的目标感染率达 98% 和 85%,76% 和 61% 的传播链到达第 4 跳,经删失校正后 85% 和 73% 的链在第 7 跳仍存活。作者指出,重置助手记忆无法终止传播,因为仍在流通的被感染产物会再次感染它,并建议把共享产物与记忆纳入安全边界。

  • 论文论文追踪

    研究者提出 Agent 检查点回滚的五类安全失效,并在 Hermes、Cline、LangGraph 上实现三种攻击

    南方科技大学与香港城市大学的研究者对 Agent 系统的检查点与回滚(C/R)机制做了系统性安全研究,提出“执行连续性”概念,指出正确回滚不等于安全恢复。他们按恢复边界把现有机制分为框架状态、工作区状态和 OS/VM 状态三类,并归纳出五种失效模式:内部状态覆盖不完整、检查点状态不一致、外部状态不匹配、非确定性重放未绑定、外部副作用未记录。基于这些模式,作者在 Hermes、Cline 和 LangGraph 上构造了三个端到端攻击,分别实现恶意软件验证绕过、未授权邮件转发和单次审批下的重复支付,均不需要篡改检查点内容或破坏回滚实现。评估覆盖 TerminalBench 与 AgentBench 的 347 条轨迹、五个框架共 1735 次框架任务执行,SF1 与 SF4 出现率分别约 67.2% 和 67.7%,SF5 仅 2.3%。

  • 论文论文追踪

    Windows 恶意软件检测器作为复合 AI 系统:准确率、效率与对抗鲁棒性的权衡

    研究提出一种面向 Windows 恶意软件检测的复合 AI 系统评估方法,在检测性能、计算开销与鲁棒性之间显式权衡,并引入系统级威胁模型,刻画攻击者利用不同程度知识绕过整个复合系统而非单个检测器。真实数据实验显示,该系统可缩短训练时间并提升响应速度,仅带来检测性能的轻微损失;知识越多的攻击者能构造更有效的对抗样本,降低系统响应能力,暴露出效率与鲁棒性之间的直接权衡。

  • 论文论文追踪

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    华中科技大学与南洋理工大学研究者对 12 种配置(4 个独立 LLM 与 8 个 Agent)的 15,000 条提示词做了大规模测量,发现所有配置都会推荐不存在的技能名,即技能名幻觉,独立 LLM 平均幻觉率 36.0%,Agent 平均 36.9%,在真实开发者提问上升至 43.1%,单配置区间为 6.5% 至 62.0%。这些名称并非随机噪声:Claude Sonnet 4.6 在 10 次运行中平均 7.8 次重复同一个幻觉名,410 个名称被两个以上配置共享,占全部幻觉推荐事件的 15.3%,另有 851 个幻觉名恰好是真实存在的 PyPI 或 npm 包名。攻击者可先收集这些可预测的名称,再在几乎不审核发布者的注册表上抢注含恶意 SKILL.md 的技能,等待受害者安装。作者认为修复需要注册表层面的名称预留与经过验证的推荐流程。

  • 论文论文追踪

    论文:分解攻击可跨不可关联身份绕过 LLM 有状态防御

    论文提出分解攻击的新威胁模型:攻击者把有害任务拆成单独看都合规的请求,再在服务之外合并答案,并用服务无法关联的新身份提交,使有状态监控失去分组信号。作者证明,在固定攻击策略且不重试时,安全与效用的权衡完全取决于同能力良性请求的分组方式;一旦允许重试并从 Allow/Block 反馈中学习,这一有利工作点就消失。实验基于 91 个可执行任务、365 个操作请求和 11,393 条能力匹配的良性请求,在 1% 匹配对照拒绝率和 0.5% 背景流量拒绝率上限下,包括拥有精确请求到操作映射的特权策略在内,十种被测策略要么拦不住攻击要么超出预算;在防御未见过的任务族上,一次尝试后攻击成功率至少 99%,两次后达 100%。作者认为有效防御需要可靠身份关联、新身份成本或对答案使用的控制等额外证据。

  • 论文论文追踪

    ElasticBack:通过触发词与规则耦合在 LLM Agent 技能中植入条件后门

    研究者提出 ElasticBack,一种针对 LLM Agent 技能供应链的条件单技能后门:在技能文档中植入规则 R,在用户查询中植入看似无害的触发词 T,只有两者同时出现时恶意载荷才会触发。该方法用触发词即开关的构造把两侧绑定,通过语义锚定的规则注入生成 R,再冻结 R 并用带隐蔽性约束的遗传搜索演化 T,从而在不微调权重的情况下兼顾攻击效果与隐蔽性,在良性输入上保持休眠。实验覆盖三类目标行为(每类 50 个技能)和四个 Agent LLM,报告了高攻击成功率、接近零的误报率、保持干净的准确率,并能跨模型迁移、规避部署期防御。作者据此呼吁加强对技能供应链的防御。