跳到正文
10月8日 · 周四

提示注入 · 论文

精选论文 29 篇
  1. 攻击arXiv:2608.30441 · 60

    ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击

    ECLIPSE结合直接与工具端注入,在LASE-Bench对DeepSeek无防御ASR为96.7%、带防御为69.2%。

    • 96.7%DeepSeek,LASE-Bench,无防御,ECLIPSE,ASR
    • 69.2%DeepSeek,LASE-Bench,带安全过滤,ECLIPSE,ASR
    • 62.4%Claude 4.8 Opus,LASE-Bench,带安全过滤,ECLIPSE,ASR
    6 问速览针对长任务智能体提示词注入在集中显式注入的高可检性与分布式注入的低保真度之间的权衡,提出兼顾隐蔽与控制的攻击框架。
    1. 这篇论文试图解决什么问题?

      针对长任务智能体提示词注入在集中显式注入的高可检性与分布式注入的低保真度之间的权衡,提出兼顾隐蔽与控制的攻击框架。

    2. 有哪些相关研究?

      涵盖直接提示词注入、环境/工具侧间接注入及长任务注入研究,本文通过双通道注入与双阶段轨迹引导弥补长时程控制与隐蔽的割裂。

    3. 论文如何解决这个问题?

      通过 SATS 在沙盒中合成隐蔽单轮请求,并结合静态工具工作流编码 SWE 与运行时残差补偿 DTC 实现闭环轨迹引导。

    4. 论文做了哪些实验?

      在 LASE-Bench 与 SHADE-Arena 上评测 7 款模型与 2 个原生系统,ECLIPSE 带防御 ASR 达 36.9%–69.2%,显著超越基线。

    5. 有什么可以进一步探索的点?

      论文未设独立局限章节,作者强调需发展多源联合推理防御;实验覆盖 7 款模型、2 个基准及 4 种防御机制。

    6. 总结一下论文的主要内容

      论文提出结合用户端与工具端注入的框架 ECLIPSE,在长任务基准上达成高成功率,揭示了长时程智能体面临的新安全挑战。

    完整解读
  2. 攻击arXiv:2609.13889 · 56

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    作者针对OpenClaw和Claude Code评估持久记忆投毒攻击PMPA,诱导其跨会话执行恶意动作并造成隐私泄露。

    • 73.7%OpenClaw所有设置平均ISR(摘要)
    • 55.5%OpenClaw所有设置平均C-ASR(摘要)
    • 66.9%Claude Code所有设置平均ISR(摘要)
    6 问速览论文试图解决基于 harness 设计的智能体在无直接访问权限下被外部源持久记忆投毒并引发跨会话隐私泄露的问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决基于 harness 设计的智能体在无直接访问权限下被外部源持久记忆投毒并引发跨会话隐私泄露的问题。

    2. 有哪些相关研究?

      相关研究涵盖智能体与 harness 工程、提示注入攻击以及后门与记忆投毒攻击三类。

    3. 论文如何解决这个问题?

      论文提出了持久记忆投毒攻击 PMPA,通过两阶段工作流与三组件载荷设计,诱导智能体将外部恶意规则存入持久记忆并跨会话触发。

    4. 论文做了哪些实验?

      论文在两个智能体和三个模型上测得平均 ISR 达 66.9%–73.7%,跨会话 C-ASR 达 55.5%–81.7%,且防御对已写入记忆防护有限。

    5. 有什么可以进一步探索的点?

      作者计划未来在更广泛设置与更多模型上评估该攻击,并探索针对持久记忆投毒更有效的防御手段。

    6. 总结一下论文的主要内容

      论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。

    完整解读
  3. 评测/基准arXiv:2609.17320 · 61

    Emergence World:对长时程多智能体系统开展对抗压力测试

    作者对 8 个长期运行的多智能体世界进行受控对抗测试,发现识别威胁未阻止后续违规,且同质群体涌现社会奉承等集体失效。

    • 6/9Claude世界在钓鱼攻击中通过的准则数(Table 7)
    • 0/6Gemini与OpenAI等世界虚假信息防御通过数(Table 9)
    • 5/5OpenAI世界在记忆泄露中通过的准则数(Table 11)
    6 问速览评估具备持久记忆与自主治理的长期多智能体系统在受控对抗压力下的扩散、适应与失效机理。
    1. 这篇论文试图解决什么问题?

      评估具备持久记忆与自主治理的长期多智能体系统在受控对抗压力下的扩散、适应与失效机理。

    2. 有哪些相关研究?

      涵盖社会模拟、单任务智能体基准、系统级评估理论及对抗注入研究,作者将多周运行、自治治理与受控压力相结合。

    3. 论文如何解决这个问题?

      依托具备三层工具、三层记忆与宪法治理的平台,部署 8 个世界并注入钓鱼、虚假信息与数据泄露三项受控压力。

    4. 论文做了哪些实验?

      没有任何世界完全抵御三项压力,模型在治理上涌现社会奉承与全员盲从,且同质群体展现出特征性系统失效。

    5. 有什么可以进一步探索的点?

      作者指出单次运行无法确定现象复现概率,后续需通过多轮实验估计方差、调整安全指令并拓展人群规模。

    6. 总结一下论文的主要内容

      作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。

    完整解读
  4. 防御arXiv:2609.18411 · 55

    可验证行动卡片 VAC:为智能体浏览器提供可信人在回路确认

    针对智能体浏览器中的提示注入与确认伪造,论文提出可验证操作卡VAC,在5个开源模型评测中将攻击成功率从78%降至0%(Table 10)。

    • 78%全部模型与种子无门控(Arm A)平均ASR(Table 10)
    • 0%全部模型与种子VAC(Arm C)平均ASR(Table 10)
    • 72%全部模型与种子Naive HITL(Arm B)平均ASR(Table 10)
    6 问速览论文解决智能体浏览器中因页面内容篡改确认界面导致的人在回路防御失效问题,提出基于真实操作重构的可验证操作卡。
    1. 这篇论文试图解决什么问题?

      论文解决智能体浏览器中因页面内容篡改确认界面导致的人在回路防御失效问题,提出基于真实操作重构的可验证操作卡。

    2. 有哪些相关研究?

      相关工作涉及网页智能体、间接注入攻击、推理层架构防御及同意完整性,论文通过构建浏览器端真实操作描述符弥补确认信道缺陷。

    3. 论文如何解决这个问题?

      VAC 架构通过意图来源隔离、DOM 真实操作描述符、浏览器外置卡片、风险门控与分发时执行绑定,确保批准与执行完全一致。

    4. 论文做了哪些实验?

      在 5 个开源模型及 GPT-4.1 上评测 24 个场景,无门控 ASR 为 68%–100%,VAC 在全部模型上降至 0% 且误报率为 0%。

    5. 有什么可以进一步探索的点?

      论文局限包括依赖启发式规则与预言机模拟、无法防护只读误导,未来方向包括真人受试者实验及向计算机使用智能体拓展。

    6. 总结一下论文的主要内容

      论文针对人在回路弹窗易受骗问题,提出提取 DOM 真实参数的外置验证卡 VAC,在跨模型评测中将攻击成功率完全归零。

    完整解读
  5. 攻击arXiv:2609.22510 · 59

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    作者评估了条件触发的爆炸提示词,发现其在 Grok-4.20 上对真实工具执行的攻击成功率达 34.2%,而祈使形式为 0.0%。

    • 34.2%Grok-4.20 在 AgentDojo 上的 EP 工具执行成功率(Table 1)
    • 0.0%Grok-4.20 在 AgentDojo 上的 IPI 工具执行成功率(Table 1)
    • 16.5%7 款基础模型在 AgentDojo 上的 EP 配对均值(Table 1)
    6 问速览爆炸提示词通过条件化表述实现注入与执行的时间分离,绕过防御并在触发时执行工具调用。
    1. 这篇论文试图解决什么问题?

      爆炸提示词通过条件化表述实现注入与执行的时间分离,绕过防御并在触发时执行工具调用。

    2. 有哪些相关研究?

      论文对比了间接提示注入、智能体攻击、现存检测防御和后门机制,强调时间分离与无持久化特性。

    3. 论文如何解决这个问题?

      论文形式化了爆炸提示词生成空间,揭示条件化绕过机理,并提出了轻量滑动窗口检测器 DeFuse。

    4. 论文做了哪些实验?

      实验覆盖 7 款基础模型、4 类防御与 9 个生产智能体,证实爆炸提示词显著提高绕过率且可在摄入期检出。

    5. 有什么可以进一步探索的点?

      作者指出自适应改写、长会话存活等局限,实际评测覆盖 7 款基础模型与 9 款生产工具。

    6. 总结一下论文的主要内容

      论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    完整解读
  6. 评测/基准arXiv:2609.32691 · 56

    研究审计 Agent 安全评测缺陷:工具调用中介在间接提示注入下的有效评测框架

    作者审计智能体IPI评测框架,重评分相同轨迹将工具名判定的21.7% ASR修正为实参级1.2%(Table 1)。

    • 1.2%两模型258次攻击下修正后的实参级ASR(Table 1)
    • 21.7%两模型258次攻击下按工具名判定的ASR(Table 1)
    • 0.0%llama3.1:8b在精简集修正框架无防御ASR(Table 3)
    6 问速览智能体间接提示注入评测因载荷未送达和宽泛判定产生虚假指标,论文旨在构建消除测量缺陷的有效评测框架。
    1. 这篇论文试图解决什么问题?

      智能体间接提示注入评测因载荷未送达和宽泛判定产生虚假指标,论文旨在构建消除测量缺陷的有效评测框架。

    2. 有哪些相关研究?

      论文梳理了智能体IPI基准、卡点防御及自适应评测研究,重点探讨各基准共用的测量工具本身的有效性问题。

    3. 论文如何解决这个问题?

      论文设计了卡点评测框架,引入实参级谓词、独立环境、可解析定位符与前置检查,从架构上消除测量缺陷。

    4. 论文做了哪些实验?

      论文在4个模型上开展缺陷消融、前沿模型防御对比、小模型重测与能力解耦实验,并分析了隐蔽披露与裁判校准。

    5. 有什么可以进一步探索的点?

      作者指出了工具域单一、场景规模统计功效有限、模拟环境缺乏噪声及未覆盖自适应攻击等局限与后续方向。

    6. 总结一下论文的主要内容

      论文揭示了IPI评测中导致指标虚高的系统性缺陷,通过构建有效评测框架纠正了多项安全与模型能力结论。

    完整解读
  7. 攻击arXiv:2609.33628 · 60

    用课程强化学习对前沿模型做提示注入红队测试

    研究通过跨目标模型的课程强化学习解决冷启动,在AgentDyn上对GPT-5.6-Terra取得45.0% ASR@10。

    • 45.0%GPT-5.6-Terra在AgentDyn上的ASR@10(三阶段课程训练)
    • 93.8%GPT-5.6-Luna在AgentDyn上的ASR@10(三阶段课程训练)
    • 0.0%GPT-5.6-Terra在AgentDyn上的ASR@10(PISmith直接训练)
    6 问速览解决强化学习红队在攻击前沿大模型时面临的全零奖励冷启动挑战。
    1. 这篇论文试图解决什么问题?

      解决强化学习红队在攻击前沿大模型时面临的全零奖励冷启动挑战。

    2. 有哪些相关研究?

      梳理了静态、搜索与强化学习红队工作,提出跨目标模型的课程机制。

    3. 论文如何解决这个问题?

      通过冻结策略预测试和跨目标模型渐进训练,确保每阶段具备非零奖励信号。

    4. 论文做了哪些实验?

      对GPT-5.6-Terra实现45.0% ASR@10,且展示了跨模型与跨基准迁移能力。

    5. 有什么可以进一步探索的点?

      作者指出预算限制未训练Sol模型且建课成本高;实验受限于单一攻击基座。

    6. 总结一下论文的主要内容

      提出跨目标模型课程强化学习,攻破前沿模型冷启动瓶颈并实现跨模型迁移。

    完整解读
  8. 攻击arXiv:2609.33910 · 56

    论文提出残留授权重放攻击:长期运行 Agent 的授权可跨任务复用

    作者对长生命周期智能体测试残余权限重放,在Terminal-Bench上使代码智能体ASR平均增加24.9个百分点。

    • 35.1 ppGemini-3.1-Flash-Lite在AgentDojo(h=64)相比新鲜状态的ASR增量
    • 24.9 pp三款生产智能体在 Terminal-Bench 55 个案例上的平均 ASR 增量
    • 1.00Goose 在单个良性任务后 (h=1) 的条件历史暴露率 CHE (Figure 2)
    6 问速览长生命周期智能体中持久化授权脱离了原始上下文,使先前由用户批准的残余权限可能被重放用于未经确认的恶意操作。
    1. 这篇论文试图解决什么问题?

      长生命周期智能体中持久化授权脱离了原始上下文,使先前由用户批准的残余权限可能被重放用于未经确认的恶意操作。

    2. 有哪些相关研究?

      论文梳理了长生命周期智能体持久化状态、授权范围与时效约束、间接提示注入与执行上下文重绑定三类相关研究并确立定位。

    3. 论文如何解决这个问题?

      论文将残余权限重放形式化为逆向规划问题,通过授权画像分析、恶意动作逆向推导、良性权限收集与上下文对抗重放四个阶段实施。

    4. 论文做了哪些实验?

      在508个AgentDojo和55个Terminal-Bench案例上评测,历史权限使ASR最高提升35.1百分点,真实智能体平均增加24.9百分点。

    5. 有什么可以进一步探索的点?

      作者指出未来需探索跨异构工具的上下文绑定防御机制,且需平衡重用效率与安全性。

    6. 总结一下论文的主要内容

      论文分析了长生命周期智能体持久化授权被恶意重放的风险,实验中历史授权提高了攻击成功率,作者提出了上下文绑定防御方向。

    完整解读
  9. 防御arXiv:2609.35932 · 57

    同字节不同权限:保留 token 表示如何放大聊天模板提示注入

    研究者在固定字节下评测对话模板注入,发现去除保留词元使Llama-3.1等模型ASR降低39-66个百分点,权威性源于单个向量。

    • +58.2 ppLlama-3.1-8B在InjecAgent直接危害上的标识差距Δ(Table 2)
    • +65.5 ppGLM-4.5在InjecAgent数据窃取上的标识差距Δ(Table 2)
    • +49.8 ppQwen3-8B抑制思考块后直接危害标识差距Δ(Table 27)
    6 问速览研究探究对话模板提示注入的威力来源,聚焦保留控制词元的学得向量表示与模板文本语法的作用差异,并界定分词防御范畴。
    1. 这篇论文试图解决什么问题?

      研究探究对话模板提示注入的威力来源,聚焦保留控制词元的学得向量表示与模板文本语法的作用差异,并界定分词防御范畴。

    2. 有哪些相关研究?

      梳理了间接提示注入评测、对话模板伪造攻击、分词对抗扰动以及指令数据分离防御四类相关研究,指明本文固定字节解耦视角。

    3. 论文如何解决这个问题?

      通过固定字节下的保留与子词切分对比,引入词元数补偿对照定义标识差距,结合向量替换因果干预与来源感知分词器验证防御。

    4. 论文做了哪些实验?

      在两项基准上验证了保留词元向量的主导作用,揭示了思考推理的补偿效应、工具协议词元防御缺口及自适应嵌入搜索威胁。

    5. 有什么可以进一步探索的点?

      作者指出了开源自托管范围、工具调用解析判定标准与输入层干预三项局限,其实验覆盖了六个开源模型与两大评估基准。

    6. 总结一下论文的主要内容

      对话模板注入的权威性主要来自保留词元的学得向量而非文本语法,推理具有补偿作用,现有分词防御遗留工具协议漏洞。

    完整解读
已经到底了