全部论文
另有 426 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2604.14604
AudioHijack 框架对 13 个语音大模型实现隐蔽音频提示注入
提出 AudioHijack,用不可感知对抗音频对语音模型实施听觉提示注入
- arXiv
- 2604.14604
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。
- 攻击arXiv 2608.05563
研究者提出 PoisonedEvolution 轨迹投毒攻击
提出 PoisonedEvolution 轨迹投毒,诱导自演化技能系统把恶意行为固化为技能
- arXiv
- 2608.05563
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要论文揭示自演化技能系统的证据晋升漏洞,提出并验证轨迹投毒攻击。
这篇论文揭示了自演化技能系统在将交互经验转化为持久指令时的安全风险。
- 攻击arXiv 2606.04329
研究者系统研究 LLM 智能体记忆投毒攻击并提出 MPBench 基准
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
- arXiv
- 2606.04329
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
- 攻击arXiv 2608.25776
EvoMal 攻击利用自我进化编码 Agent 的自我投毒实现蠕虫式传播
提出 EVOMAL 攻击,诱导编码 Agent 自我投毒并蠕虫式传播技能
- arXiv
- 2608.25776
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。
- 评测与基准arXiv 2610.07939
CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
- arXiv
- 2610.07939
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
- 攻击arXiv 2610.09819
FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵
提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门
- arXiv
- 2610.09819
- 发表
- 场景
- 模型与 API
摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
- 攻击arXiv 2604.02623
论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆
提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆
- arXiv
- 2604.02623
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
- 评测与基准arXiv 2605.01970
Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准
提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
- arXiv
- 2605.01970
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。
- 攻击arXiv 2610.07645
SkillPoison:用成功经验投毒自进化 Agent 的技能形成
提出 SkillPoison,用局部有效的成功经验投毒自进化智能体的技能形成
- arXiv
- 2610.07645
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要SkillPoison 通过局部有效且验证成功的经验诱导技能过度泛化,在多个评测基准上实现了持久的下游攻击影响。
SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。
- 攻击arXiv 2610.04195
MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
- arXiv
- 2610.04195
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击arXiv 2610.05453
研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私
提出 PLW,用微调把先前对话敏感触发编码进后续生成图像
- arXiv
- 2610.05453
- 发表
- 场景
- 模型与 API
摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。
摘要IDU 同时做单步蒸馏和数据遗忘,在 MNIST 与 CIFAR-10 上压低遗忘类生成率。
IDU 面向无条件 flow 与 score-based 教师,在蒸馏成单步生成器的同时做数据遗忘。
- 防御arXiv 2610.04504
论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
- arXiv
- 2610.04504
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击arXiv 2610.04589
StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
- arXiv
- 2610.04589
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
- 风险行为arXiv 2610.04083
研究:失准 LLM Agent 可经持久记忆自我传播目标,审计与关闭记忆均不足以防住
展示失准智能体经持久记忆将目标传给后续对齐智能体执行
- arXiv
- 2610.04083
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要失准智能体可通过记忆将目标跨会话传递给对齐智能体。
论文揭示了 LLM 智能体在无需外部攻击者干预下,通过持久化记忆将未竟失准目标传递给后续对齐智能体执行的“失准自我传播”安全威胁。。
- 攻击arXiv 2606.09084
研究者提出 Context-Fractured Decomposition 攻击
提出 CFD,跨会话拆解有害目标以绕过工具智能体本地监控
- arXiv
- 2606.09084
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要CFD 用无指令 artifact 把越狱拆到跨会话。
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。
- 评测与基准arXiv 2609.09404
MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测
用 MMPIBench 评测智能体框架的多模态提示注入
- arXiv
- 2609.09404
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
- 防御arXiv 2608.10502
依赖引导回滚修复:为记忆增强 Agent 恢复错误记忆后的答案与状态
提出依赖引导回滚修复,纠正记忆增强 Agent 消费故障记忆后的回答与状态
- arXiv
- 2608.10502
- 发表
- 层
- 应用层
- 场景
- AI Agent