攻击arXiv 2607.14493
LogInject 框架披露 LLM 日志分析中的被动提示注入
提出 LogInject 框架,评测日志分析中的被动提示注入及缓解
- arXiv
- 2607.14493
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- GPT-4o、Claude 3.5 Sonnet、Llama-3-70B-Instruct
摘要论文评估了 LLM 日志分析中的上下文污染风险,提出分片拼接等攻击与三层防御,指出必须结合架构隔离与人工介入。
提出 LogInject 框架,评测日志分析中的被动提示注入及缓解
摘要论文评估了 LLM 日志分析中的上下文污染风险,提出分片拼接等攻击与三层防御,指出必须结合架构隔离与人工介入。
构建 PrivEscalate 评测 Linux 提权并设计 PrivEscAgent
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害
摘要论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。