攻击arXiv 2605.24421
研究者提出日志型提示注入攻击,可抑制 SOC 中 LLM 分析助手的恶意日志识别
提出日志基底提示注入,操纵 SOC 分析员的分类、摘要与处置建议
- arXiv
- 2605.24421
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- gpt-4o-mini
摘要在 gpt-4o-mini 上,人格劫持与上下文操纵可改写 SOC 分析输出,直接覆盖在分类上无效。
提出日志基底提示注入,操纵 SOC 分析员的分类、摘要与处置建议
摘要在 gpt-4o-mini 上,人格劫持与上下文操纵可改写 SOC 分析输出,直接覆盖在分类上无效。
用醉酒语言诱导改编对话模型并评测越狱与隐私泄露
作者把醉酒语言当作攻击向量,检验把 LLM 适配成醉酒发短信的模式后,越狱和情境隐私是否变差。动机是人类醉酒时的失范与泄密,以及 LLM 模拟人设的能力。