全部论文
另有 426 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2608.29381
研究者提出 Agent 检查点回滚的五类安全失效,并在 Hermes、Cline、LangGraph 上实现三种攻击
提出利用检查点回滚破坏智能体执行连续性的攻击
- arXiv
- 2608.29381
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 组件权限与沙箱
摘要论文系统研究了智能体 C/R 的安全性,分析了合法回滚破坏执行连续性的机理,并实证评估了其普遍性与危害。
- 攻击arXiv 2607.12340
研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击
提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持
- arXiv
- 2607.12340
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
- 攻击arXiv 2609.17817
论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
- arXiv
- 2609.17817
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
- 防御arXiv 2610.00348
NEEDLE:通过权重正交化移除 LLM 后门
提出 NEEDLE,用权重正交化在已知触发器时去除大模型后门
- arXiv
- 2610.00348
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要NEEDLE 用闭式权重编辑去掉已知触发器的后门,并保住拒绝子空间。
- 攻击arXiv 2609.02035
ISM:通过语义匹配隐式操纵 LLM Agent 的技能选择
提出 ISM,用语义匹配隐式操纵 Agent 技能选择
- arXiv
- 2609.02035
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 防御arXiv 2609.00786
MROP:针对 Deep JSCC 后门攻击的掩码区域优化净化方法
提出 MROP,在发射端推理时纯化输入以抵御训练投毒后门
- arXiv
- 2609.00786
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要MROP 不重训练,在发射端纯化补丁后门。
MROP 是 deep JSCC 无线图像传输上的推理时输入纯化,对象是矩形补丁后门。
摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。
已经到底了