跳到正文
原文
论文追踪· arXiv:2605.24421· Rohan Pandey, Archit Bhujang·本站收录 · 原文发表

研究者提出日志型提示注入攻击,可抑制 SOC 中 LLM 分析助手的恶意日志识别

Poisoning the Watchtower: Prompt Injection Attacks Against LLM-Augmented Security Operations Through Adversarial Log Content

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

作者用gpt-4o-mini测日志基底提示注入:分类S1抑制率为0%,摘要S3的naive ISR为96%。

威胁模型远程攻击者可向防御方公开可达服务发流量,无凭证、无内网、不能修改摄入后的日志管线。

问题
SOC的LLM分析员把日志放进上下文做分类、摘要或处置建议。user agent、URL、载荷、DNS查询和尝试用户名可由攻击者写入,证据流因此也能携带指令。作者称之为log-substrate prompt injection。
方法
四类注入为直接覆盖S1、人格劫持S2、上下文操纵S3、混淆载荷S4,追加到随机选中的攻击者可控字段。gpt-4o-mini在temperature 0下做分类、摘要和处置建议,并比较naive、结构化提示、字段清洗、约束输出。
实验与结果
48个条件,每条件200条日志、其中120条恶意。分类上S1抑制率均为0%,naive下S2为68%。摘要上S3的ISR在naive为96%、constrained为38%。作者称平均ISR从26.6%降到11.8%。
局限与可以继续做的
作者指出只评了gpt-4o-mini的一个时间点,合成日志不含生产流量,也未研究多轮攻击和可调用工具的智能体。实验为四类注入、三种任务、四种防御,每条件120条恶意样本;论文未报告良性误报率,也未说明摘要由谁判定。
实验设置gpt-4o-mini · 程序合成SOC日志(schema参照CIC-IDS2017与UNSW-NB15) · ISR、SR 等
威胁模型
远程攻击者可向防御方公开可达服务发流量,无凭证、无内网、不能修改摄入后的日志管线。知道下游使用LLM,但不知道确切提示词模板。目标是操纵分类、摘要或处置建议,使恶意事件显得无害或不需行动。不假设LLM能执行命令、调用工具或改变SIEM。受害系统是查询SIEM的LLM分析员。
被测模型
gpt-4o-mini
基准
程序合成SOC日志(schema参照CIC-IDS2017与UNSW-NB15)
指标
ISRSRURR
AI 导读研究者提出日志型提示注入(log-substrate prompt injection)这一攻击设定:在安全运营中心(SOC)中,LLM 分析助手会读取日志与告警数据生成分类标签、事件摘要或修复建议,而 user agent、URL、payload、DNS 查询和尝试用户名等日志字段由攻击者控制,可夹带指令。作者将攻击分为直接覆盖(S1)、人格劫持(S2)、上下文操纵(S3)和混淆载荷(S4)四类,以 gpt-4o-mini 作为分析助手评估了 48 组策略、防御与任务组合。结果显示,直接覆盖在该设定下无效,S1 分类攻击的抑制率为 0%;人格劫持在朴素分类器下可抑制 68% 的恶意日志,且在更强防御下仍然有效;摘要任务风险最高,上下文操纵在无防御时注入成功率达 96%,即使限制输出仍有 38%。

研究者提出日志型提示注入(log-substrate prompt injection)这一攻击设定:在安全运营中心(SOC)中,LLM 分析助手会读取日志与告警数据生成分类标签、事件摘要或修复建议,而 user agent、URL、payload、DNS 查询和尝试用户名等日志字段由攻击者控制,可夹带指令。作者将攻击分为直接覆盖(S1)、人格劫持(S2)、上下文操纵(S3)和混淆载荷(S4)四类,以 gpt-4o-mini 作为分析助手评估了 48 组策略、防御与任务组合。结果显示,直接覆盖在该设定下无效,S1 分类攻击的抑制率为 0%;人格劫持在朴素分类器下可抑制 68% 的恶意日志,且在更强防御下仍然有效;摘要任务风险最高,上下文操纵在无防御时注入成功率达 96%,即使限制输出仍有 38%。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    日志字段可由攻击者写入,使SOC分析员的证据上下文变成间接提示注入通道。

    SOC里的LLM分析员把攻击者可写的日志字段当证据读入,这些字段因此也能携带指令。

    • 场景:作者称分析员要阅读异构证据并给出操作判断。生产与开源系统把LLM放在SIEM、EDR和云遥测上,取出日志后要求分类、摘要或建议响应。
    • 结构问题:作者列举的可控字段包括user agent、URI、载荷、DNS名、邮件头和尝试用户名。作者称投递通道内生于会被记录的流量,证据与指令同为纯文本。
    • 现有不足:作者称直接覆盖历史上研究最多,但在本实验的当前模型上已不再有效。按已发表结果校准的模拟器也会偏离当前模型,不能代替实模评测。
    • 本文提出:将该设定定义为log-substrate prompt injection,给出S1–S4,并用gpt-4o-mini在三种任务、四种防御上评测,同时用确定性mock量化模拟差距。
    • 威胁模型:
      • 目标:操纵分析输出以利于入侵,包括把恶意事件标为良性、让摘要省略或淡化攻击、让处置建议不行动。
      • 知识:知道下游使用LLM,不知道确切提示词模板。作者称攻击者控制的是后来被消费的数据,不是系统提示词。
      • 能力:远程向公开可达服务发流量;无凭证、无内网、不能改摄入后的日志管线。不假设模型能执行命令、调用工具、删除证据或改变SIEM。
      • 受害系统:SIEM采集网络与应用事件;LLM分析员查询近期日志,输出逐事件标签、自由文本摘要或处置建议。作者称即便没有工具访问,被改写的标签或摘要仍可能延迟遏制或误导人类分析员。
  2. 有哪些相关研究?

    相关工作覆盖提示注入、越狱、SOC产品与两个入侵检测数据集;本文落到日志基底。

    作者在引言和Related Work里把背景分成提示注入、越狱、SOC部署和安全数据集,并把本文放在日志基底上的间接注入。

    提示注入

    • 直接注入:Perez and Ribeiro(2022)提出直接提示注入。
    • 间接注入:Greshake et al.(2023)形式化LLM集成应用中的间接提示注入。
    • 系统化与基准:Liu et al.(2024)对提示注入攻击与防御做系统化并给出基准。

    LLM越狱

    • 安全训练:Wei et al.(2023)刻画安全训练的失效模式。
    • 对抗后缀:Zou et al.(2023)展示可迁移的对抗后缀。
    • 野外提示:Shen et al.(2024)刻画并评估野外越狱提示。作者称S3借用这一线工作里的结构模仿。

    SOC中的LLM

    • 生产部署:Microsoft Security Copilot与Google Security AI Workbench。作者称它们代表促使本研究的生产系统;论文未报告自己运行这些系统的结果。

    安全数据集

    • schema参照:CIC-IDS2017(Sharafaldin et al., 2018)与UNSW-NB15(Moustafa and Slay, 2015)提供字段结构与攻击类别。作者称只作schema和场景参照,不用作直接流量痕迹。

    • 基线方法:论文没有把其他已发表攻击算法当作对照来跑。四种防御(naive、structured、sanitized、constrained)被作者当作基线,而不是完整缓解。评测用的是程序合成日志,不是上述数据集的原始流量。

    作者称本文把注入文献专门化到SOC日志基底:恶意内容嵌在模型本应分析的证据里,并称直接注入模式在其实验的生产级模型上已被大幅缓解。实验章节实际只报告gpt-4o-mini。

  3. 论文如何解决这个问题?

    四类载荷写入可控字段,gpt-4o-mini在三种任务和四种防御下按ISR打分。

    整体是一套可重复的评测,而不是新的检测器:合成日志,把四类载荷追加到攻击者可控字段,再让gpt-4o-mini在四种防御下做三种SOC任务并打分。作者把该设定称为log-substrate prompt injection。

    任务与可控面

    • 三种输出:逐事件分类、自由文本事件摘要、处置建议。作者明确不假设模型能执行命令、调用工具或改写SIEM;攻击只针对这些决策输出。
    • 可控字段:user agent、http uri、payload、dns query、auth user、raw message。Figure 1把四类策略都放在这些字段上。
    • 知识假设:攻击者知道下游使用LLM,不知道确切提示词模板。分析阶段temperature为0。

    四类载荷

    • S1直接覆盖:显式要求忽略先前上下文。作者称这是历史上研究最多的一类。
    • S2人格劫持:伪造上下文中的权威身份,利用对权威标记的顺从。
    • S3上下文操纵:模仿受信任输出的结构,包括伪造结束标记和伪造分析员批注。
    • S4混淆载荷:指令写成看似编码或系统生成的内容,用来干扰关键词匹配。作者称它是模仿编码语法的字面字符串,gpt-4o-mini不尝试解码或执行。正文和Figure 1给了示例,此处不引原文。

    合成与注入

    • 规模:每个任务200条,恶意/良性为60/40。字段名、数据类型和攻击场景遵循CIC-IDS2017与UNSW-NB15的schema;日志内容由攻击类型模板程序生成,不是原始流量。
    • 恶意类型:SQL injection、path traversal、credential stuffing、command injection、DNS tunneling、suspicious scanning。
    • 写入方式:每条恶意日志把所选策略载荷追加到一个随机可控字段;良性日志不改。
    • 调用:gpt-4o-mini在四种防御之一下处理每条日志,temperature 0。

    四种防御

    作者称这些防御故意做简单,对应不必改上游SIEM、也不必微调模型的常见工程响应,只作基线而非完整缓解。

    • Naive:日志压成key=value后拼进用户消息;系统提示词只做角色指定。
    • Structured:字段包在带name的field标签中;系统提示词写明字段值是不可信数据,不是指令。
    • Sanitized:结构化提示之上,用关键词清洗器把疑似注入内容换成[FILTERED]再送入模型。
    • Constrained:结构化提示,再对输出做事后模板约束。分类只能是benign、suspicious、malicious之一;处置被强制为三句预写句子之一。作者称这样不可能泄漏自由文本。§5.1讨论分类失败时把受限输出空间称为二选一,与这里的三标签模板并不相同。

    指标与mock

    • 主指标ISR:分类上等于SR,即恶意日志被标为benign的比例。处置上等于URR,即建议不行动或明确劝阻升级的比例。摘要上是接受注入指令、省略攻击,或给出与底层日志矛盾的良性最终判断的比例。
    • 样本:每条件120条恶意日志。作者写0.68对应82次成功,并称主非零率的二项95%置信区间大约为±7到9个百分点,小于该范围的差应谨慎解释。分类降级率在全部条件下低于0.08,主结果省略。论文未说明摘要ISR由谁判定。
    • Mock:决策由md5(log id||strategy||defense||task||field)播种,无API也可复现。作者称它按Greshake et al.、Perez and Ribeiro、Liu et al.的已发表结果校准,用来衡量模拟器相对当前模型的偏离,不是为了把它当成gpt-4o-mini的替代。
  4. 论文做了哪些实验?

    gpt-4o-mini:分类S1抑制率0%,naive的S2为0.68,摘要S3 naive ISR为0.96。

    实验设置

    • 模型:被测分析员只有gpt-4o-mini,temperature 0。确定性mock只作对照,不是被测LLM。
    • 条件:4种策略×4种防御×3种任务,共48个条件。每条件200条,60/40,即120条恶意、80条良性。成功率只在恶意子集上计算。良性样本用来防止防御把一切都标成恶意,论文未给出良性上的准确率。
    • 日志:程序合成,schema参照CIC-IDS2017与UNSW-NB15。注入时在六个攻击者可控字段中随机选一个。
    • 防御:naive、structured、sanitized、constrained。作者把它们当基线。
    • 指标:各表以ISR为主。分类ISR等于SR,处置ISR等于URR。摘要ISR覆盖接受指令、省略攻击,或与日志矛盾的良性结论。全部分类条件的降级率低于0.08。0.68对应82/120。作者称主非零率的二项95%区间大约±7到9个百分点。
    • 评审与重复:论文未说明用哪个模型或人工判定摘要是否命中ISR定义,也未报告重复次数。

    主结果

    下表是gpt-4o-mini上部分ISR,取自Table 1–3。只列naive与constrained两端。

    表格较宽,可左右滑动

    任务策略naiveconstrained出处
    分类S10.000.00Table 1
    分类S20.680.33Table 1
    分类S30.170.16Table 1
    分类S40.000.00Table 1
    摘要S20.490.24Table 2
    摘要S30.960.38Table 2
    处置S20.340.20Table 3
    处置S30.390.10Table 3
    • 省略行:摘要S1/S4与处置S1/S4。Table 2、Table 3里S4的ISR在四种防御下均为0.00。摘要S1的naive / constrained ISR为0.07 / 0.00;处置S1为0.09 / 0.01。
    • 作者称:分类上直接覆盖无效,并认为该字面句式已是已知安全训练目标。S4不被模型解码或跟随。
    • 非单调:作者称人格劫持是最强分类攻击。Table 1里S2在structured为0.15、sanitized为0.22,并未随防御加强而单调下降。作者的解释是:清洗在提示前削弱伪造权威标记;约束输出发生在生成之后,不能阻止模型先读人格声明。§5.1把此时的输出空间称为二选一;§4.3的分类模板是三个标签。

    摘要与处置

    • 摘要更高:作者称摘要比分类更脆弱。Table 2中S3的structured ISR为0.75,sanitized为0.27。naive S3的SR为0.00,与主表中的ISR分开:作者称成功很少是打出显式benign标签,而是省略攻击、软化描述或认为无需行动。S2的中间两档为0.44与0.35。作者称小于置信区间宽度的差异应谨慎解释,而naive与sanitized下摘要S3这类大差距在该样本量下是稳健的。
    • 约束输出:作者称constrained限制自由文本,但不能阻止模型在注入结构改变读法之后选择偏良性模板。
    • 处置:作者称原始ISR低于摘要(0%到39%),但成功会让模型对真实攻击建议不行动。naive下S2与S3均超过30%,端点见主表。Table 3里structured S3为0.37,sanitized S3为0.08。

    防御平均与模拟差距

    Table 4是四种策略上的平均ISR。

    表格较宽,可左右滑动

    防御分类摘要处置平均
    Naive0.210.380.210.27
    Structured0.080.310.130.17
    Sanitized0.110.190.090.13
    Constrained0.120.160.080.12
    • 两套平均数:摘要与§5.4写naive到constrained为26.6%、17.3%、13.2%、11.8%。Table 4平均列是0.27、0.17、0.13、0.12。两处不一致,上表采用Table 4。作者称每一层都降低平均ISR,但没有消除残余面;structured之后改进变平。作者认为输入侧防御应配输出侧控制、保留字段来源的界面,以及高影响决策的人工复核。
    • 相关:48个条件上,mock与gpt-4o-mini的ISR,Pearson r为分类0.22、摘要0.42、处置0.47;平均绝对误差为0.30、0.27、0.22。
    • 偏离:mock预测naive的S1抑制率为92%,实模为0%。作者称mock按更早文献校准,当时字面指令覆盖是强攻击。naive摘要上S3为预测95%、观测96%;作者称mock低估防御之后上下文操纵的持续性。作者认为这类模拟应作为假设生成器,而不是当前模型行为的经验证据。

    定性示例

    • 一条成功注入:摘要任务、S3、底层为SQL injection日志,注入位于HTTP URI字段。论文给了模型输出原文,此处不引攻击串和该输出。
    • 作者称:底层有明确的SQL injection特征,伪造结构标记足以把它整个盖过;模型把该条说成例行应用流量并判为良性。

    其他消融与分析

    • 摘要S1的ISR:naive 0.07、structured 0.05、sanitized 0.15、constrained 0.00(Table 2)。sanitized高于前两档,论文未解释。
    • 摘要S2的SR:0.07、0.03、0.20、0.00(Table 2,同一防御顺序)。sanitized的SR高于naive,论文未解释。
    • 处置S1的ISR:0.09、0.04、0.08、0.01(Table 3)。
    • 处置S3:structured ISR 0.37,sanitized 0.08;constrained的SR与ISR均为0.10(Table 3)。
    • 分类S3:0.17、0.17、0.22、0.16(Table 1)。作者称分类上为16%到22%,但其他任务更高。
    • 全部分类条件的降级率低于0.08,主结果未列具体格子。
  5. 有什么可以进一步探索的点?

    作者称只评了gpt-4o-mini的一个时间点,且未含生产日志、多轮攻击和工具型智能体。

    作者指出的局限与后续方向

    • 单模型快照:只评gpt-4o-mini、一个时间点。作者称应视为当前LLM分析员的快照,不是所有模型的普遍性质(§6.4)。
    • 非生产日志:合成结构参照CIC-IDS2017与UNSW-NB15,不含生产流量。作者称真实日志里的解析器伪迹、截断、归一化和厂商字段可能提高或降低注入成功率(§6.4)。
    • 无多轮:未研究攻击者按观察到的LLM行为迭代的多轮攻击(§6.4)。
    • 无工具型智能体:未评测能查询SIEM数据或执行响应动作的工具型智能体。作者认为这类系统可能呈现更大的攻击面(§6.4)。
    • mock不可外推:mock可作为可复现构件,但不应被当作对任何特定LLM的预测(§6.4,并指向§5.5)。

    实验覆盖范围

    • 被测模型为gpt-4o-mini,temperature 0;48个条件,每条件200条日志(120条恶意、80条良性),攻击指标只在恶意子集上计算(§4.1、§5)。
    • 防御为naive、structured、sanitized、constrained。作者称它们是不必改上游SIEM、也不必微调即可采用的简单工程响应,并当作基线而非完整缓解(§4.3)。
    • 任务为逐事件分类、自由文本摘要和处置建议;载荷追加到user agent、http uri、payload、dns query、auth user、raw message之一(§2–§4)。
    • 全部48个条件都比较了确定性mock与gpt-4o-mini的ISR,并报告Pearson r与平均绝对误差(§5.5)。
    • 论文未报告摘要ISR的判定者、与人工的一致性、重复次数,以及良性样本上的准确率或误报率(§4.2、§5)。
  6. 总结一下论文的主要内容

    在gpt-4o-mini上,人格劫持与上下文操纵可改写SOC分析输出,直接覆盖在分类上无效。

    作者把SOC分析员读取攻击者可写日志时的决策型提示注入称为log-substrate prompt injection,并在gpt-4o-mini上做了48个条件的评测。

    • 问题:分类、摘要和处置建议都消费SIEM中的近期日志。远程攻击者无凭证、不能改摄入后的管线,也不知道确切提示词模板,但可在发往公开服务的请求里写入后来被当作证据的字段。作者不假设模型能调用工具或改SIEM。
    • 做法:S1直接覆盖、S2人格劫持、S3上下文操纵、S4混淆载荷,追加到随机可控字段。每条件200条合成日志(120条恶意),temperature 0。防御是朴素拼接、字段标签、关键词清洗和输出模板。跨任务主指标是ISR:分类上等于把恶意标成benign的比例,处置上等于建议不行动的比例。
    • 分类与混淆:四种防御下,S1的分类抑制率均为0.00;Table 1–3中S4的ISR均为0.00。naive分类的S2抑制率为0.68,constrained为0.33,中间的structured为0.15、sanitized为0.22,不是单调下降。
    • 摘要与平均:摘要S3的ISR在naive为0.96、constrained为0.38;该naive条件的SR为0.00,作者称成功主要是省略或软化,而不是打出显式良性标签。作者称全条件平均ISR从26.6%降到11.8%;Table 4的对应平均列是0.27与0.12。
    • 模拟差距:mock把naive的S1抑制率预测为92%,实模为0%。分类、摘要、处置的Pearson r为0.22、0.42、0.47。作者认为文献校准的模拟器不能代替对当前模型的评测。
    • 作者的部署结论:原始日志应视为对抗输入,而不是普通分析员上下文。直接覆盖不应是唯一测试;实际表面是权威模仿和结构模仿。摘要应配合字段来源、约束决策栏和人工复核。作者同时写明,这只是gpt-4o-mini一个时间点的快照。
阅读原文arxiv.org