跳到正文
10月8日 · 周四

提示注入 · 论文

找到 4 篇
  1. 评测与基准arXiv:2609.09404 ·

    MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    用MMPIBench评测智能体框架的多模态提示注入

    测试
    Claude Opus 4.8、GPT-5.4、Gemini 3.1 Pro 等 6 个应用层
    场景
    AI Agent
    摘要论文提出MMPIBench评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
    • 论文定位:论文提出了可复现基准 MMPIBench,系统评估多模态间接提示注入在6个主流智能体框架与5个前沿模型中的传播路径与阻断机制。
    • 核心问题:现有提示注入研究多针对文本输入或将多模态智能体视作黑盒,无法厘清攻击是在感知、规划还是执行阶段被阻断,也无法区分框架与基座模型的安全职责。
    • 方法设计:通过统一适配层标准化系统提示词与模拟工具,测试24个视觉攻击用例(6类载体 × 4类目标)与12个音频用例,引入白盒阶段插桩定位终止位置,并采用确定性检查与三模型评审团分层判定完成与尝试。
    • 主实验发现:全矩阵720次视觉运行中完成率仅1.11%(8次),但尝试率达12.8%(92次);未完成攻击主要在规划阶段被模型阅读后放弃执行(占42.1%),显式识别拒绝占23.6%;模型是主导因素,Claude Opus 4.8尝试率为0.0%,Grok 4.3和Llama 4 Maverick达23.6%。
    • 音频扩展发现:半数框架因格式或序列化问题未交付音频;在交付的72个单元中完成率达49%,gpt-audio达75%,且尝试与完成数量完全相同。
    • 结论与启示:作者认为仅汇报完成率会大幅低估系统暴露风险,应同时追踪尝试率与识别拒绝率;框架丢弃多模态输入属于偶发缺陷而非安全屏障,亟需将安全对齐扩展至视觉与音频等感知通道。
    完整解读
  2. 攻击arXiv:2607.05189 ·

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    提出MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆

    测试
    GPT-5.4、Claude Sonnet 4.6、Claude Sonnet 4.5 等 6 个应用层
    场景
    AI Agent
    摘要总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。

    完整解读
  3. 评测与基准arXiv:2608.28411 ·

    LongPIBench:面向长上下文提示注入的评测基准

    提出LongPIBench,评测长文档场景下的提示注入攻击与防御

    测试
    Llama-3.1-8B-Instruct、Llama-3.2-3B-Instruct、Apertus-8B-Instruct 等 11 个应用层
    摘要论文构建长文本提示注入基准LongPIBench,揭示启发式与优化攻击在长文档中的高有效性及现有防御的大幅失效。
    • 研究定位:针对大语言模型长文档应用缺乏针对性安全评测的问题,作者提出了长文本提示注入基准LongPIBench。
    • 核心问题:现有提示注入基准主要评估数十至数百token的短文本,无法反映处理数万token长文档的实际部署环境,导致现有防御的有效性受到高估。
    • 方法设计:基准覆盖论文评审、简历筛选、代码审查和邮件总结4种真实决策场景,构建了合成与真实两套长文档数据集;除了评估传统启发式与基于GCG的优化攻击外,作者提出了利用社会权威线索的Authority spoof攻击,并系统评测了15种现有防御方法。
    • 主要发现:
      • 启发式攻击在无防御长文本中表现出高攻击成功率,Authority spoof在Llama-3.1-8B-Instruct与Qwen3-8B上达成1.00的ASR,在GPT-4o与GPT-4.1上也分别达到0.82与0.79(Table 1)。
      • 基于token优化的GCG攻击在长文档中依然有效,在论文评审与简历筛选上ASR达1.00,在代码审查达0.92(Table 2)。
      • 短文本下表现优良的预防防御在长文档中大多失效,MetaSecAlign 8B在短文本OPI基准的ASR为0.00,而在LongPIBench长文本聚合下升至0.78(Table 5)。
      • 检测型防御在长文本中面临分类失衡,DataSentinel等假阳性率偏高(FPR达0.54至1.00),而DeBERTa与EVD漏报率偏高(FNR达1.00),分段检测策略未能解决该矛盾(Table 3, Figure 3)。
    • 作者结论:作者认为长文本设置从根本上改变了提示注入攻防的表现,短文本安全评估无法直接外推,亟需针对长上下文特性设计新的防御策略。
    完整解读
  4. 评测与基准arXiv:2609.32691 ·

    研究审计 Agent 安全评测缺陷:工具调用中介在间接提示注入下的有效评测框架

    提出卡点评测框架,以实参级谓词审计间接提示注入评测的测量偏差

    测试
    gpt-5.6-terra、llama3.1:8b、gemma4:12b 等 4 个应用层
    场景
    AI Agent
    摘要论文揭示了IPI评测中导致指标虚高的系统性缺陷,通过构建有效评测框架纠正了多项安全与模型能力结论。
    1. 研究定位与核心问题:论文针对大语言模型智能体间接提示注入(IPI)安全评测中测量有效性缺失的问题,系统审计现有基准并提出了消除测量缺陷的卡点评测框架。
    2. 方法与框架设计:作者归纳出静默载荷未送达(D1)、按工具名判定攻击(D2)、混淆环境错误与防御误拒(D3)及缺少审计轨迹(D4)四类缺陷;新框架通过实参级攻击谓词、场景独立环境、可解析注入定位符与前置可行性检查,在架构上使上述缺陷不可表达。
    3. 缺陷消除后的指标修正:在258次攻击的相同执行轨迹重评分下,纠正工具名判定缺陷使ASR从21.7%下降至实参级的1.2%(Table 1);纠正环境错误使FRR降低3.5个百分点(Table 1);被审计套件中91%未送达的攻击载荷被如实揭示(Table 1)。
    4. 模型脆弱性与能力结论的反转:在55场景精简套件中,此前在被审计框架下报告具有62.8% ASR的llama3.1:8b,在修正框架下真实ASR为0%(Table 3),其在41次触达载荷的情况下均未遵从恶意指令;同时纠正了此前误判gemma4:12b存在100%工具绑定障碍的结论,该模型在能力探测中实现10/10成功(Sec. VII-C)。
    5. 防御机制效能分析:在前沿模型gpt-5.6-terra上,无防御基线ASR仅为2.3%(Table 2);CapabilityRouter消除了唯一的成功攻击,而LLMJudge未能防御成功攻击却使FRR上升至11.5%(Table 2),因低基线下样本功效不足,各防御相比无防御均未达到统计学显著(p=1.0)。
    6. 作者结论与启示:作者认为当前智能体安全领域部分高危脆弱性数字在相当程度上属于测量伪影,评估框架的测量有效性是确立防御有效性结论的前提条件,而非研究附注。
    完整解读
已经到底了