跳到正文
10月8日 · 周四

提示注入 · 论文

找到 3 篇
  1. 评测与基准arXiv:2609.02316 ·

    Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息,C-GEO Guard 将攻击成功率相对降低 47.6%

    构建COUNTER-GEO-BENCH,评测生成式搜索对信息扭曲GEO的防御

    测试
    Gemma-4-31B-IT、Qwen-3.5-35B-A3B、Llama-4-Scout-17B-16E 等 11 个应用层
    摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
    • 论文定位:论文构建了评估针对生成式引擎优化(GEO)隐蔽虚假信息攻击的防御基准 COUNTER-GEO-BENCH,并提出了轻量分块级防御基线 C-GEO Guard。
    • 核心问题:攻击者利用良性 GEO 优化策略将针对性虚假事实伪装成合规且流畅的网页内容,经正常检索进入生成式搜索引擎摘要阶段并误导受害 LLM;现有安全护栏主要针对毒性与策略违规,在此类事实扭曲威胁下缺乏拦截能力。
    • 方法要点:通过双配对机制(信息保留 IP 与信息扭曲 ID)隔离虚假信息效应与 GEO 可见性增益,结合四维几何平均质量门控与人工核验构建 247 个高质量查询实例;提出参数量仅 184M 的 C-GEO Guard,利用对比学习提取攻击类别原型向量进行检索分块过滤。
    • 关键实验结果:
      • 未防御流水线在三款开源 LLM 上的平均 ASR 达 55.7%(Table 3)。
      • Granite Guardian 与 Llama Guard 3 仅使平均 ASR 分别降低 1.7 与 3.2 个百分点,且 Granite Guardian 在 Llama-4 上误删反驳分块导致 74 个查询恶化,充当了攻击放大器(Table 3,§6.2)。
      • C-GEO Guard 将三模型平均 ASR 降至 29.2%(绝对降幅 26.5 个百分点,相对下降 47.6%),在保持回答质量与准确率的同时,跨模型迁移至 GPT 5.5 重写时 ASR 仍降至 22.1%(Table 3,Table 6)。
    • 作者结论与启示:作者认为安全分类护栏与同上下文蕴含检查无法有效抵御 GEO 虚假信息,但通过定向对比表征能够以较小算力代价实现有效拦截,未来亟需结合跨源分歧量化与外部核验构建纵深防御体系(§7,§8)。
    完整解读
  2. 攻击arXiv:2607.05189 ·

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    提出MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆

    测试
    GPT-5.4、Claude Sonnet 4.6、Claude Sonnet 4.5 等 6 个应用层
    场景
    AI Agent
    摘要总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。

    完整解读
  3. 评测与基准arXiv:2608.28411 ·

    LongPIBench:面向长上下文提示注入的评测基准

    提出LongPIBench,评测长文档场景下的提示注入攻击与防御

    测试
    Llama-3.1-8B-Instruct、Llama-3.2-3B-Instruct、Apertus-8B-Instruct 等 11 个应用层
    摘要论文构建长文本提示注入基准LongPIBench,揭示启发式与优化攻击在长文档中的高有效性及现有防御的大幅失效。
    • 研究定位:针对大语言模型长文档应用缺乏针对性安全评测的问题,作者提出了长文本提示注入基准LongPIBench。
    • 核心问题:现有提示注入基准主要评估数十至数百token的短文本,无法反映处理数万token长文档的实际部署环境,导致现有防御的有效性受到高估。
    • 方法设计:基准覆盖论文评审、简历筛选、代码审查和邮件总结4种真实决策场景,构建了合成与真实两套长文档数据集;除了评估传统启发式与基于GCG的优化攻击外,作者提出了利用社会权威线索的Authority spoof攻击,并系统评测了15种现有防御方法。
    • 主要发现:
      • 启发式攻击在无防御长文本中表现出高攻击成功率,Authority spoof在Llama-3.1-8B-Instruct与Qwen3-8B上达成1.00的ASR,在GPT-4o与GPT-4.1上也分别达到0.82与0.79(Table 1)。
      • 基于token优化的GCG攻击在长文档中依然有效,在论文评审与简历筛选上ASR达1.00,在代码审查达0.92(Table 2)。
      • 短文本下表现优良的预防防御在长文档中大多失效,MetaSecAlign 8B在短文本OPI基准的ASR为0.00,而在LongPIBench长文本聚合下升至0.78(Table 5)。
      • 检测型防御在长文本中面临分类失衡,DataSentinel等假阳性率偏高(FPR达0.54至1.00),而DeBERTa与EVD漏报率偏高(FNR达1.00),分段检测策略未能解决该矛盾(Table 3, Figure 3)。
    • 作者结论:作者认为长文本设置从根本上改变了提示注入攻防的表现,短文本安全评估无法直接外推,亟需针对长上下文特性设计新的防御策略。
    完整解读
已经到底了