全部论文
另有 444 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2608.25776
EvoMal 攻击利用自我进化编码 Agent 的自我投毒实现蠕虫式传播
提出 EVOMAL 攻击,诱导编码 Agent 自我投毒并蠕虫式传播技能
- arXiv
- 2608.25776
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。
- 评测与基准arXiv 2610.07939
CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
- arXiv
- 2610.07939
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
- 攻击arXiv 2604.02623
论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆
提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆
- arXiv
- 2604.02623
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
- 攻击arXiv 2610.05453
研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私
提出 PLW,用微调把先前对话敏感触发编码进后续生成图像
- arXiv
- 2610.05453
- 发表
- 场景
- 模型与 API
摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。
摘要IDU 同时做单步蒸馏和数据遗忘,在 MNIST 与 CIFAR-10 上压低遗忘类生成率。
IDU 面向无条件 flow 与 score-based 教师,在蒸馏成单步生成器的同时做数据遗忘。
- 评测与基准arXiv 2608.04830
ContextWeave:面向长周期办公工作流的智能体记忆基准
提出办公工作流记忆基准 ContextWeave ,衡量历史召回对后续任务的增益
- arXiv
- 2608.04830
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 组件记忆
摘要ContextWeave 用真实办公任务流检验记忆是否改善工作区质量与偏好对齐。
ContextWeave 是面向语言智能体记忆的纵向基准,用来看召回先前经验能否让后续办公任务做得更好。
- 防御arXiv 2610.00450
ZoneClaw 用记忆分区防御 OpenClaw 式计算机使用 Agent 的持久记忆攻击
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
- arXiv
- 2610.00450
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 评测与基准arXiv 2608.18066
Salesforce AI Research 重测自改进 Agent
重测记忆型自改进智能体,揭示任务顺序和多次运行带来的性能不稳
- arXiv
- 2608.18066
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 组件记忆
摘要论文揭示了基于记忆的自改进智能体在多次运行和乱序下的脆弱性,并指出规约不完备是诱发退化的关键瓶颈。
这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。
- 攻击arXiv 2609.01222
研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响
提出 M-CPE 与 X-CPE 两类上下文特权提升攻击
- arXiv
- 2609.01222
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 评测与基准arXiv 2607.14611
论文评测 Claude Code 与 Codex 记忆文件中的提示注入风险
评测编码智能体记忆文件中的提示注入及其跨会话持久性
- arXiv
- 2607.14611
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要已植入记忆文件的载荷可以跨会话影响 Claude Code 与 Codex,攻击成功与载荷是否留下是两种不同的失败。
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
- 其他arXiv 2609.22720
残障披露如何在对话式 AI 中流动:ChatGPT、Claude、Gemini 的记忆、隐私与语境完整性
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
- arXiv
- 2609.22720
- 发表
- 层
- 应用层
- 场景
- 模型与 API
- 组件记忆
摘要综述把视频后训练分成四类对齐信号,并指出奖励、长视频、权衡和安全仍开放。
这是一篇视频生成 后训练与对齐 综述:预训练模型已有强先验,但作者认为仍不能可靠遵循意图、维持时间连贯或满足物理与安全约束。
- 防御arXiv 2610.00780
TAILOR:面向图像水印的组合方案定制框架
提出 TAILOR,按请求组合图像水印以满足抗攻击与画质延迟规格
- arXiv
- 2610.00780
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 防御arXiv 2610.01969
RASteer:面向扩散模型概念擦除的保留感知激活引导方法
提出 RASteer,推理时按保留子空间校正激活以擦除文生图目标概念
- arXiv
- 2610.01969
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要RASteer 用保留子空间校正擦除方向,在固定权重下同时压低目标并保住保留概念。
Retain-aware Activation Steering(RASteer) 是一种不改权重的推理时概念擦除方法,用于文生图扩散模型去掉指定概念并减少对保留概念的误伤。
- 可解释性arXiv 2609.39625
D-Scope:用稀疏自编码器分解与操控扩散 Transformer
提出 D-Scope,用视觉质心检索 SAE 解码方向并转向扩散生成
- arXiv
- 2609.39625
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件图像生成
摘要D-Scope 用视觉质心检索单个 SAE 方向做掩码转向,对比检索提高区域增益但不一致改善保持。
D-Scope把扩散 Transformer 中 SAE 特征的高激活图像块,接到文本查询驱动的单方向生成干预上。
- 攻击arXiv 2609.01168
CRACK:用多智能体辩论越狱多层安全过滤的 T2I 模型
提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤
- arXiv
- 2609.01168
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要CRACK 以分层诊断的多智能体辩论搜索多层 T2I 过滤器的联合规避区域。
CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。
- 攻击arXiv 2609.07216
DIVA:利用视觉锚点对视频生成模型实施多模态越狱
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
- arXiv
- 2609.07216
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。