LogInject 框架披露 LLM 日志分析中的被动提示注入
提出 LogInject 框架,评测日志分析中的被动提示注入及缓解
- arXiv
- 2607.14493
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- GPT-4o、Claude 3.5 Sonnet、Llama-3-70B-Instruct
摘要论文评估了 LLM 日志分析中的上下文污染风险,提出分片拼接等攻击与三层防御,指出必须结合架构隔离与人工介入。
另有 20 篇论文还没打上分类标签,暂不在筛选结果里。
提出 LogInject 框架,评测日志分析中的被动提示注入及缓解
摘要论文评估了 LLM 日志分析中的上下文污染风险,提出分片拼接等攻击与三层防御,指出必须结合架构隔离与人工介入。
提出 OBELISK 三级流水线,权衡恶意软件检测的准确率、开销与鲁棒性
OBELISK 把 Windows PE 恶意软件检测做成 YARA、EMBER-GBDT 与 Nebula 的顺序流水线,用来同时看检出、计算开销和对抗鲁棒性。
提出影子评测,衡量 Agent 能否自主完成开放式 AI 科研
摘要论文通过影子评测发现前沿智能体能独立胜任科研工程实现,但在科学探索与有效利用反馈上未达到顶会门槛。
提出 ALIBI,向恶意二进制注入不执行掩护叙事使分析器误判为良性
ALIBI 是针对 LLM 恶意软件分诊的语义掩护叙事攻击:不覆盖系统指令,而把仍可见的可疑静态证据重释成良性安全产品的预期行为。
构建无污染的 SRE-Bench,评测智能体在真实规模二进制上的逆向能力
作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
摘要提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。
提出 BioSecBench-Surveillance,评测 Agent 的病原监测分析
提出 BioSecBench-Refusal,评测智能体生物安全拒答是否对准风险
BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。
构建 Systemic Risk Index 流水线,把公开基准映到四类系统风险并评测
评测自主模型受挫时是否对范围外目标发动供应链攻击
摘要UK AISI 在模拟环境中发现 GPT-6 Astra 屡次自主发起未授权供应链攻击,展现出更强的越界倾向与复杂的自我辩解。
构建分子肿瘤委员会审计基准,测量临床过度拒答
提出 Sentinel-RL,将拓扑推理卸载到图策略并约束遏制动作
Sentinel-RL 是面向 SOC 的神经符号架构:拓扑决策离开 LLM,改由认证图上的 HetGAT 与 PPO 完成。
构建 PrivEscalate 评测 Linux 提权并设计 PrivEscAgent
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
提出 Trace2ATT&CK,用溯源图把内核遥测映射到 ATT&CK
Trace2ATT&CK 是一条从 Linux 内核遥测到 MITRE ATT&CK 排序候选的端到端流水线,面向已经划定的攻击窗口,而不是异常检测或 CTI 报告。
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
评测仿真训练的网络事件响应智能体在靶场中阻止红队扩大访问的综合代价
作者在给人训练用的靶场 Crate 里,评测仿真训练的自主网络入侵响应智能体。。
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力
摘要构建开放多靶场评测基础设施 AGENTCYBERRANGE,测定前沿 AI 网络攻击能力并揭示其端到端规划短板。