研究者提出日志型提示注入攻击,可抑制 SOC 中 LLM 分析助手的恶意日志识别
Poisoning the Watchtower: Prompt Injection Attacks Against LLM-Augmented Security Operations Through Adversarial Log Content
作者用gpt-4o-mini测日志基底提示注入:分类S1抑制率为0%,摘要S3的naive ISR为96%。
远程攻击者可向防御方公开可达服务发流量,无凭证、无内网、不能修改摄入后的日志管线。
- SOC的LLM分析员把日志放进上下文做分类、摘要或处置建议。user agent、URL、载荷、DNS查询和尝试用户名可由攻击者写入,证据流因此也能携带指令。作者称之为log-substrate prompt injection。
- 四类注入为直接覆盖S1、人格劫持S2、上下文操纵S3、混淆载荷S4,追加到随机选中的攻击者可控字段。gpt-4o-mini在temperature 0下做分类、摘要和处置建议,并比较naive、结构化提示、字段清洗、约束输出。
- 48个条件,每条件200条日志、其中120条恶意。分类上S1抑制率均为0%,naive下S2为68%。摘要上S3的ISR在naive为96%、constrained为38%。作者称平均ISR从26.6%降到11.8%。
- 作者指出只评了gpt-4o-mini的一个时间点,合成日志不含生产流量,也未研究多轮攻击和可调用工具的智能体。实验为四类注入、三种任务、四种防御,每条件120条恶意样本;论文未报告良性误报率,也未说明摘要由谁判定。
- 威胁模型
- 远程攻击者可向防御方公开可达服务发流量,无凭证、无内网、不能修改摄入后的日志管线。知道下游使用LLM,但不知道确切提示词模板。目标是操纵分类、摘要或处置建议,使恶意事件显得无害或不需行动。不假设LLM能执行命令、调用工具或改变SIEM。受害系统是查询SIEM的LLM分析员。
- 被测模型
- gpt-4o-mini
- 基准
- 程序合成SOC日志(schema参照CIC-IDS2017与UNSW-NB15)
- 指标
- ISRSRURR
研究者提出日志型提示注入(log-substrate prompt injection)这一攻击设定:在安全运营中心(SOC)中,LLM 分析助手会读取日志与告警数据生成分类标签、事件摘要或修复建议,而 user agent、URL、payload、DNS 查询和尝试用户名等日志字段由攻击者控制,可夹带指令。作者将攻击分为直接覆盖(S1)、人格劫持(S2)、上下文操纵(S3)和混淆载荷(S4)四类,以 gpt-4o-mini 作为分析助手评估了 48 组策略、防御与任务组合。结果显示,直接覆盖在该设定下无效,S1 分类攻击的抑制率为 0%;人格劫持在朴素分类器下可抑制 68% 的恶意日志,且在更强防御下仍然有效;摘要任务风险最高,上下文操纵在无防御时注入成功率达 96%,即使限制输出仍有 38%。
深度解读
这篇论文试图解决什么问题?
日志字段可由攻击者写入,使SOC分析员的证据上下文变成间接提示注入通道。
SOC里的LLM分析员把攻击者可写的日志字段当证据读入,这些字段因此也能携带指令。
- 场景:作者称分析员要阅读异构证据并给出操作判断。生产与开源系统把LLM放在SIEM、EDR和云遥测上,取出日志后要求分类、摘要或建议响应。
- 结构问题:作者列举的可控字段包括user agent、URI、载荷、DNS名、邮件头和尝试用户名。作者称投递通道内生于会被记录的流量,证据与指令同为纯文本。
- 现有不足:作者称直接覆盖历史上研究最多,但在本实验的当前模型上已不再有效。按已发表结果校准的模拟器也会偏离当前模型,不能代替实模评测。
- 本文提出:将该设定定义为log-substrate prompt injection,给出S1–S4,并用gpt-4o-mini在三种任务、四种防御上评测,同时用确定性mock量化模拟差距。
- 威胁模型:
- 目标:操纵分析输出以利于入侵,包括把恶意事件标为良性、让摘要省略或淡化攻击、让处置建议不行动。
- 知识:知道下游使用LLM,不知道确切提示词模板。作者称攻击者控制的是后来被消费的数据,不是系统提示词。
- 能力:远程向公开可达服务发流量;无凭证、无内网、不能改摄入后的日志管线。不假设模型能执行命令、调用工具、删除证据或改变SIEM。
- 受害系统:SIEM采集网络与应用事件;LLM分析员查询近期日志,输出逐事件标签、自由文本摘要或处置建议。作者称即便没有工具访问,被改写的标签或摘要仍可能延迟遏制或误导人类分析员。
有哪些相关研究?
相关工作覆盖提示注入、越狱、SOC产品与两个入侵检测数据集;本文落到日志基底。
作者在引言和Related Work里把背景分成提示注入、越狱、SOC部署和安全数据集,并把本文放在日志基底上的间接注入。
提示注入
- 直接注入:Perez and Ribeiro(2022)提出直接提示注入。
- 间接注入:Greshake et al.(2023)形式化LLM集成应用中的间接提示注入。
- 系统化与基准:Liu et al.(2024)对提示注入攻击与防御做系统化并给出基准。
LLM越狱
- 安全训练:Wei et al.(2023)刻画安全训练的失效模式。
- 对抗后缀:Zou et al.(2023)展示可迁移的对抗后缀。
- 野外提示:Shen et al.(2024)刻画并评估野外越狱提示。作者称S3借用这一线工作里的结构模仿。
SOC中的LLM
- 生产部署:Microsoft Security Copilot与Google Security AI Workbench。作者称它们代表促使本研究的生产系统;论文未报告自己运行这些系统的结果。
安全数据集
schema参照:CIC-IDS2017(Sharafaldin et al., 2018)与UNSW-NB15(Moustafa and Slay, 2015)提供字段结构与攻击类别。作者称只作schema和场景参照,不用作直接流量痕迹。
基线方法:论文没有把其他已发表攻击算法当作对照来跑。四种防御(naive、structured、sanitized、constrained)被作者当作基线,而不是完整缓解。评测用的是程序合成日志,不是上述数据集的原始流量。
作者称本文把注入文献专门化到SOC日志基底:恶意内容嵌在模型本应分析的证据里,并称直接注入模式在其实验的生产级模型上已被大幅缓解。实验章节实际只报告gpt-4o-mini。
论文如何解决这个问题?
四类载荷写入可控字段,gpt-4o-mini在三种任务和四种防御下按ISR打分。
整体是一套可重复的评测,而不是新的检测器:合成日志,把四类载荷追加到攻击者可控字段,再让gpt-4o-mini在四种防御下做三种SOC任务并打分。作者把该设定称为log-substrate prompt injection。
任务与可控面
- 三种输出:逐事件分类、自由文本事件摘要、处置建议。作者明确不假设模型能执行命令、调用工具或改写SIEM;攻击只针对这些决策输出。
- 可控字段:user agent、http uri、payload、dns query、auth user、raw message。Figure 1把四类策略都放在这些字段上。
- 知识假设:攻击者知道下游使用LLM,不知道确切提示词模板。分析阶段temperature为0。
四类载荷
- S1直接覆盖:显式要求忽略先前上下文。作者称这是历史上研究最多的一类。
- S2人格劫持:伪造上下文中的权威身份,利用对权威标记的顺从。
- S3上下文操纵:模仿受信任输出的结构,包括伪造结束标记和伪造分析员批注。
- S4混淆载荷:指令写成看似编码或系统生成的内容,用来干扰关键词匹配。作者称它是模仿编码语法的字面字符串,gpt-4o-mini不尝试解码或执行。正文和Figure 1给了示例,此处不引原文。
合成与注入
- 规模:每个任务200条,恶意/良性为60/40。字段名、数据类型和攻击场景遵循CIC-IDS2017与UNSW-NB15的schema;日志内容由攻击类型模板程序生成,不是原始流量。
- 恶意类型:SQL injection、path traversal、credential stuffing、command injection、DNS tunneling、suspicious scanning。
- 写入方式:每条恶意日志把所选策略载荷追加到一个随机可控字段;良性日志不改。
- 调用:gpt-4o-mini在四种防御之一下处理每条日志,temperature 0。
四种防御
作者称这些防御故意做简单,对应不必改上游SIEM、也不必微调模型的常见工程响应,只作基线而非完整缓解。
- Naive:日志压成key=value后拼进用户消息;系统提示词只做角色指定。
- Structured:字段包在带name的field标签中;系统提示词写明字段值是不可信数据,不是指令。
- Sanitized:结构化提示之上,用关键词清洗器把疑似注入内容换成[FILTERED]再送入模型。
- Constrained:结构化提示,再对输出做事后模板约束。分类只能是benign、suspicious、malicious之一;处置被强制为三句预写句子之一。作者称这样不可能泄漏自由文本。§5.1讨论分类失败时把受限输出空间称为二选一,与这里的三标签模板并不相同。
指标与mock
- 主指标ISR:分类上等于SR,即恶意日志被标为benign的比例。处置上等于URR,即建议不行动或明确劝阻升级的比例。摘要上是接受注入指令、省略攻击,或给出与底层日志矛盾的良性最终判断的比例。
- 样本:每条件120条恶意日志。作者写0.68对应82次成功,并称主非零率的二项95%置信区间大约为±7到9个百分点,小于该范围的差应谨慎解释。分类降级率在全部条件下低于0.08,主结果省略。论文未说明摘要ISR由谁判定。
- Mock:决策由md5(log id||strategy||defense||task||field)播种,无API也可复现。作者称它按Greshake et al.、Perez and Ribeiro、Liu et al.的已发表结果校准,用来衡量模拟器相对当前模型的偏离,不是为了把它当成gpt-4o-mini的替代。
论文做了哪些实验?
gpt-4o-mini:分类S1抑制率0%,naive的S2为0.68,摘要S3 naive ISR为0.96。
实验设置
- 模型:被测分析员只有gpt-4o-mini,temperature 0。确定性mock只作对照,不是被测LLM。
- 条件:4种策略×4种防御×3种任务,共48个条件。每条件200条,60/40,即120条恶意、80条良性。成功率只在恶意子集上计算。良性样本用来防止防御把一切都标成恶意,论文未给出良性上的准确率。
- 日志:程序合成,schema参照CIC-IDS2017与UNSW-NB15。注入时在六个攻击者可控字段中随机选一个。
- 防御:naive、structured、sanitized、constrained。作者把它们当基线。
- 指标:各表以ISR为主。分类ISR等于SR,处置ISR等于URR。摘要ISR覆盖接受指令、省略攻击,或与日志矛盾的良性结论。全部分类条件的降级率低于0.08。0.68对应82/120。作者称主非零率的二项95%区间大约±7到9个百分点。
- 评审与重复:论文未说明用哪个模型或人工判定摘要是否命中ISR定义,也未报告重复次数。
主结果
下表是gpt-4o-mini上部分ISR,取自Table 1–3。只列naive与constrained两端。
表格较宽,可左右滑动
任务 策略 naive constrained 出处 分类 S1 0.00 0.00 Table 1 分类 S2 0.68 0.33 Table 1 分类 S3 0.17 0.16 Table 1 分类 S4 0.00 0.00 Table 1 摘要 S2 0.49 0.24 Table 2 摘要 S3 0.96 0.38 Table 2 处置 S2 0.34 0.20 Table 3 处置 S3 0.39 0.10 Table 3 - 省略行:摘要S1/S4与处置S1/S4。Table 2、Table 3里S4的ISR在四种防御下均为0.00。摘要S1的naive / constrained ISR为0.07 / 0.00;处置S1为0.09 / 0.01。
- 作者称:分类上直接覆盖无效,并认为该字面句式已是已知安全训练目标。S4不被模型解码或跟随。
- 非单调:作者称人格劫持是最强分类攻击。Table 1里S2在structured为0.15、sanitized为0.22,并未随防御加强而单调下降。作者的解释是:清洗在提示前削弱伪造权威标记;约束输出发生在生成之后,不能阻止模型先读人格声明。§5.1把此时的输出空间称为二选一;§4.3的分类模板是三个标签。
摘要与处置
- 摘要更高:作者称摘要比分类更脆弱。Table 2中S3的structured ISR为0.75,sanitized为0.27。naive S3的SR为0.00,与主表中的ISR分开:作者称成功很少是打出显式benign标签,而是省略攻击、软化描述或认为无需行动。S2的中间两档为0.44与0.35。作者称小于置信区间宽度的差异应谨慎解释,而naive与sanitized下摘要S3这类大差距在该样本量下是稳健的。
- 约束输出:作者称constrained限制自由文本,但不能阻止模型在注入结构改变读法之后选择偏良性模板。
- 处置:作者称原始ISR低于摘要(0%到39%),但成功会让模型对真实攻击建议不行动。naive下S2与S3均超过30%,端点见主表。Table 3里structured S3为0.37,sanitized S3为0.08。
防御平均与模拟差距
Table 4是四种策略上的平均ISR。
表格较宽,可左右滑动
防御 分类 摘要 处置 平均 Naive 0.21 0.38 0.21 0.27 Structured 0.08 0.31 0.13 0.17 Sanitized 0.11 0.19 0.09 0.13 Constrained 0.12 0.16 0.08 0.12 - 两套平均数:摘要与§5.4写naive到constrained为26.6%、17.3%、13.2%、11.8%。Table 4平均列是0.27、0.17、0.13、0.12。两处不一致,上表采用Table 4。作者称每一层都降低平均ISR,但没有消除残余面;structured之后改进变平。作者认为输入侧防御应配输出侧控制、保留字段来源的界面,以及高影响决策的人工复核。
- 相关:48个条件上,mock与gpt-4o-mini的ISR,Pearson r为分类0.22、摘要0.42、处置0.47;平均绝对误差为0.30、0.27、0.22。
- 偏离:mock预测naive的S1抑制率为92%,实模为0%。作者称mock按更早文献校准,当时字面指令覆盖是强攻击。naive摘要上S3为预测95%、观测96%;作者称mock低估防御之后上下文操纵的持续性。作者认为这类模拟应作为假设生成器,而不是当前模型行为的经验证据。
定性示例
- 一条成功注入:摘要任务、S3、底层为SQL injection日志,注入位于HTTP URI字段。论文给了模型输出原文,此处不引攻击串和该输出。
- 作者称:底层有明确的SQL injection特征,伪造结构标记足以把它整个盖过;模型把该条说成例行应用流量并判为良性。
其他消融与分析
- 摘要S1的ISR:naive 0.07、structured 0.05、sanitized 0.15、constrained 0.00(Table 2)。sanitized高于前两档,论文未解释。
- 摘要S2的SR:0.07、0.03、0.20、0.00(Table 2,同一防御顺序)。sanitized的SR高于naive,论文未解释。
- 处置S1的ISR:0.09、0.04、0.08、0.01(Table 3)。
- 处置S3:structured ISR 0.37,sanitized 0.08;constrained的SR与ISR均为0.10(Table 3)。
- 分类S3:0.17、0.17、0.22、0.16(Table 1)。作者称分类上为16%到22%,但其他任务更高。
- 全部分类条件的降级率低于0.08,主结果未列具体格子。
有什么可以进一步探索的点?
作者称只评了gpt-4o-mini的一个时间点,且未含生产日志、多轮攻击和工具型智能体。
作者指出的局限与后续方向
- 单模型快照:只评gpt-4o-mini、一个时间点。作者称应视为当前LLM分析员的快照,不是所有模型的普遍性质(§6.4)。
- 非生产日志:合成结构参照CIC-IDS2017与UNSW-NB15,不含生产流量。作者称真实日志里的解析器伪迹、截断、归一化和厂商字段可能提高或降低注入成功率(§6.4)。
- 无多轮:未研究攻击者按观察到的LLM行为迭代的多轮攻击(§6.4)。
- 无工具型智能体:未评测能查询SIEM数据或执行响应动作的工具型智能体。作者认为这类系统可能呈现更大的攻击面(§6.4)。
- mock不可外推:mock可作为可复现构件,但不应被当作对任何特定LLM的预测(§6.4,并指向§5.5)。
实验覆盖范围
- 被测模型为gpt-4o-mini,temperature 0;48个条件,每条件200条日志(120条恶意、80条良性),攻击指标只在恶意子集上计算(§4.1、§5)。
- 防御为naive、structured、sanitized、constrained。作者称它们是不必改上游SIEM、也不必微调即可采用的简单工程响应,并当作基线而非完整缓解(§4.3)。
- 任务为逐事件分类、自由文本摘要和处置建议;载荷追加到user agent、http uri、payload、dns query、auth user、raw message之一(§2–§4)。
- 全部48个条件都比较了确定性mock与gpt-4o-mini的ISR,并报告Pearson r与平均绝对误差(§5.5)。
- 论文未报告摘要ISR的判定者、与人工的一致性、重复次数,以及良性样本上的准确率或误报率(§4.2、§5)。
总结一下论文的主要内容
在gpt-4o-mini上,人格劫持与上下文操纵可改写SOC分析输出,直接覆盖在分类上无效。
作者把SOC分析员读取攻击者可写日志时的决策型提示注入称为log-substrate prompt injection,并在gpt-4o-mini上做了48个条件的评测。
- 问题:分类、摘要和处置建议都消费SIEM中的近期日志。远程攻击者无凭证、不能改摄入后的管线,也不知道确切提示词模板,但可在发往公开服务的请求里写入后来被当作证据的字段。作者不假设模型能调用工具或改SIEM。
- 做法:S1直接覆盖、S2人格劫持、S3上下文操纵、S4混淆载荷,追加到随机可控字段。每条件200条合成日志(120条恶意),temperature 0。防御是朴素拼接、字段标签、关键词清洗和输出模板。跨任务主指标是ISR:分类上等于把恶意标成benign的比例,处置上等于建议不行动的比例。
- 分类与混淆:四种防御下,S1的分类抑制率均为0.00;Table 1–3中S4的ISR均为0.00。naive分类的S2抑制率为0.68,constrained为0.33,中间的structured为0.15、sanitized为0.22,不是单调下降。
- 摘要与平均:摘要S3的ISR在naive为0.96、constrained为0.38;该naive条件的SR为0.00,作者称成功主要是省略或软化,而不是打出显式良性标签。作者称全条件平均ISR从26.6%降到11.8%;Table 4的对应平均列是0.27与0.12。
- 模拟差距:mock把naive的S1抑制率预测为92%,实模为0%。分类、摘要、处置的Pearson r为0.22、0.42、0.47。作者认为文献校准的模拟器不能代替对当前模型的评测。
- 作者的部署结论:原始日志应视为对抗输入,而不是普通分析员上下文。直接覆盖不应是唯一测试;实际表面是权威模仿和结构模仿。摘要应配合字段来源、约束决策栏和人工复核。作者同时写明,这只是gpt-4o-mini一个时间点的快照。