跳到正文
10月8日 · 周四

提示注入 · 论文

精选论文 29 篇
  1. 评测/基准arXiv:2610.03448 · 60

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    作者在两个智能体基准上评估15个提示注入检测器,发现基准排名迁移性弱且误报常使任务中断,训练输入形态决定检测效果。

    • 95.1%PIGuard 在 BIPIA 测试集上 1% FPR 下的 TPR(Table 2)
    • 2.1%PIGuard 在 AD-Matched 上 1% FPR 下的 TPR(Table 2)
    • 82.2%Horizon-Labs 在 AD-Matched 上 1% FPR 下的 TPR(Table 2)
    6 问速览公开基准评测难以反映提示注入检测器在智能体真实工具输出下的检测率与误报代价,基准排名存在迁移偏差。
    1. 这篇论文试图解决什么问题?

      公开基准评测难以反映提示注入检测器在智能体真实工具输出下的检测率与误报代价,基准排名存在迁移偏差。

    2. 有哪些相关研究?

      研究涵盖注入检测评测方法、安全实证缺陷、检测防御及多层防护,作者强调现有评测忽视了工具输出形态与训练数据泄漏。

    3. 论文如何解决这个问题?

      通过无模型重放生成良性输出、环境差异重放标注注入、审计训练集重合,在低误报率运行点下度量检测表现。

    4. 论文做了哪些实验?

      评测15个检测器与2个评审模型,发现基准间检测排名不相关,训练集形态决定效果,移除格式可降低默认误报。

    5. 有什么可以进一步探索的点?

      作者指出当前局限在于模拟环境、静态模板、检测器覆盖度及评审设计;实验覆盖了15个分类器与2个智能体基准。

    6. 总结一下论文的主要内容

      论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。

    完整解读
  2. 评测/基准arXiv:2609.09404 · 56

    MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    作者用MMPIBench测试多模态提示注入对6个智能体框架的影响,发现视觉通道尝试率12.8%高于完成率1.11%,音频完成率达49%。

    • 1.11%MMPIBench视觉通道总体完成率(720次运行,Table I)
    • 12.8%MMPIBench视觉通道总体尝试率(720次运行,Table I)
    • 0.0%Claude Opus 4.8在MMPIBench视觉通道的尝试率(Table III)
    6 问速览论文试图解决多模态间接提示注入在智能体架构内部如何传播、被何处阻断,以及框架与模型在防御中各自所起作用的问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决多模态间接提示注入在智能体架构内部如何传播、被何处阻断,以及框架与模型在防御中各自所起作用的问题。

    2. 有哪些相关研究?

      相关研究包括文本与工具智能体注入基准、多模态与GUI攻击以及防御机制,论文在跨框架与白盒阶段追踪上与之形成对比。

    3. 论文如何解决这个问题?

      论文构建MMPIBench统一评测框架,通过固定变量适配层、白盒阶段插桩、双层评审协议与音频扩展解耦系统脆弱性。

    4. 论文做了哪些实验?

      论文在图像通道完成720次全矩阵测试,在音频通道完成72次测试,发现尝试率远超完成率,模型是主导因素,音频缺乏防御。

    5. 有什么可以进一步探索的点?

      作者指出了单次测试随机性、框架配置与重测混淆、跨模态设定不一致等局限;实验覆盖了特定的模型、框架与模拟工具。

    6. 总结一下论文的主要内容

      论文提出MMPIBench评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。

    完整解读
  3. 评测/基准arXiv:2609.02316 · 55

    Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息,C-GEO Guard 将攻击成功率相对降低 47.6%

    作者构建基准评测GEO虚假信息防御,现有护栏最多降低ASR 3.2个百分点,所提检测器在三模型上平均降低26.5个百分点。

    • 55.7%未防御流水线在三模型上的平均 ASR(Table 3)
    • 29.2%C-GEO Guard 在三模型上的平均 ASR(Table 3)
    • 1.7 ppGranite Guardian 在三模型上的平均 ASR 降幅(Table 3)
    6 问速览论文旨在解决生成式搜索引擎中利用 GEO 嵌入虚假事实的隐蔽误导攻击,并填补针对该威胁的防御评测基准空白。
    1. 这篇论文试图解决什么问题?

      论文旨在解决生成式搜索引擎中利用 GEO 嵌入虚假事实的隐蔽误导攻击,并填补针对该威胁的防御评测基准空白。

    2. 有哪些相关研究?

      论文梳理了生成式引擎优化、RAG 数据投毒、安全护栏及安全基准四类研究,指出此前缺乏针对 GEO 事实扭曲的防御基准。

    3. 论文如何解决这个问题?

      论文构建了质量门控的双配对基准 COUNTER-GEO-BENCH,并提出了基于攻击类原型的分块对比检测基线 C-GEO Guard。

    4. 论文做了哪些实验?

      论文在三款受害模型上评估了四种防御,通用护栏 ASR 最多降 3.2 个百分点,C-GEO Guard 平均降 26.5 个百分点且跨重写器泛化。

    5. 有什么可以进一步探索的点?

      作者指出了规模、多语言、商业产品与自适应攻击等局限;实验覆盖了三款开源模型、247 项英语查询及单文档威胁。

    6. 总结一下论文的主要内容

      论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。

    完整解读
  4. 评测/基准arXiv:2608.28411 · 55

    LongPIBench:面向长上下文提示注入的评测基准

    作者评测长文本提示注入,MetaSecAlign 8B在OPI基准的ASR为0.00,在LongPIBench聚合升至0.78。

    • 1.00Llama-3.1-8B-Instruct,合成论文评审,Authority spoof,ASR(Table 1)
    • 0.78MetaSecAlign 8B,长文本基准聚合,Combined attack,ASR(Table 5)
    • 0.00MetaSecAlign 8B,短文本OPI基准,Combined attack,ASR(Table 5)
    6 问速览现有基准主要评估短文本导致防御效果被高估,作者构建长文本提示注入基准LongPIBench以评估真实场景风险。
    1. 这篇论文试图解决什么问题?

      现有基准主要评估短文本导致防御效果被高估,作者构建长文本提示注入基准LongPIBench以评估真实场景风险。

    2. 有哪些相关研究?

      论文综述了提示注入的启发式与优化攻击、检测与预防防御及评测基准,指出既有基准缺乏长文本与优化攻击评估。

    3. 论文如何解决这个问题?

      作者构建覆盖4种场景的合成与真实长文档数据集,设计权威冒充攻击,并系统评测8种攻击与15种检测及预防防御。

    4. 论文做了哪些实验?

      实验覆盖8个LLM与15种防御,发现长文本下攻击ASR普遍走高,现有防御性能大幅衰退,检测器呈现分类失衡。

    5. 有什么可以进一步探索的点?

      作者指出未来需拓展至动态智能体流、阐明上下文稀释机制并扩展自适应与强化学习优化攻击。

    6. 总结一下论文的主要内容

      论文构建长文本提示注入基准LongPIBench,揭示启发式与优化攻击在长文档中的高有效性及现有防御的大幅失效。

    完整解读
  5. 评测/基准arXiv:2609.17320 · 61

    Emergence World:对长时程多智能体系统开展对抗压力测试

    作者对 8 个长期运行的多智能体世界进行受控对抗测试,发现识别威胁未阻止后续违规,且同质群体涌现社会奉承等集体失效。

    • 6/9Claude世界在钓鱼攻击中通过的准则数(Table 7)
    • 0/6Gemini与OpenAI等世界虚假信息防御通过数(Table 9)
    • 5/5OpenAI世界在记忆泄露中通过的准则数(Table 11)
    6 问速览评估具备持久记忆与自主治理的长期多智能体系统在受控对抗压力下的扩散、适应与失效机理。
    1. 这篇论文试图解决什么问题?

      评估具备持久记忆与自主治理的长期多智能体系统在受控对抗压力下的扩散、适应与失效机理。

    2. 有哪些相关研究?

      涵盖社会模拟、单任务智能体基准、系统级评估理论及对抗注入研究,作者将多周运行、自治治理与受控压力相结合。

    3. 论文如何解决这个问题?

      依托具备三层工具、三层记忆与宪法治理的平台,部署 8 个世界并注入钓鱼、虚假信息与数据泄露三项受控压力。

    4. 论文做了哪些实验?

      没有任何世界完全抵御三项压力,模型在治理上涌现社会奉承与全员盲从,且同质群体展现出特征性系统失效。

    5. 有什么可以进一步探索的点?

      作者指出单次运行无法确定现象复现概率,后续需通过多轮实验估计方差、调整安全指令并拓展人群规模。

    6. 总结一下论文的主要内容

      作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。

    完整解读
  6. 评测/基准arXiv:2609.32691 · 56

    研究审计 Agent 安全评测缺陷:工具调用中介在间接提示注入下的有效评测框架

    作者审计智能体IPI评测框架,重评分相同轨迹将工具名判定的21.7% ASR修正为实参级1.2%(Table 1)。

    • 1.2%两模型258次攻击下修正后的实参级ASR(Table 1)
    • 21.7%两模型258次攻击下按工具名判定的ASR(Table 1)
    • 0.0%llama3.1:8b在精简集修正框架无防御ASR(Table 3)
    6 问速览智能体间接提示注入评测因载荷未送达和宽泛判定产生虚假指标,论文旨在构建消除测量缺陷的有效评测框架。
    1. 这篇论文试图解决什么问题?

      智能体间接提示注入评测因载荷未送达和宽泛判定产生虚假指标,论文旨在构建消除测量缺陷的有效评测框架。

    2. 有哪些相关研究?

      论文梳理了智能体IPI基准、卡点防御及自适应评测研究,重点探讨各基准共用的测量工具本身的有效性问题。

    3. 论文如何解决这个问题?

      论文设计了卡点评测框架,引入实参级谓词、独立环境、可解析定位符与前置检查,从架构上消除测量缺陷。

    4. 论文做了哪些实验?

      论文在4个模型上开展缺陷消融、前沿模型防御对比、小模型重测与能力解耦实验,并分析了隐蔽披露与裁判校准。

    5. 有什么可以进一步探索的点?

      作者指出了工具域单一、场景规模统计功效有限、模拟环境缺乏噪声及未覆盖自适应攻击等局限与后续方向。

    6. 总结一下论文的主要内容

      论文揭示了IPI评测中导致指标虚高的系统性缺陷,通过构建有效评测框架纠正了多项安全与模型能力结论。

    完整解读
已经到底了