- 防御arXiv 2603.01544
RA-Det:利用鲁棒性不对称检测 AI 生成图像
提出 RA-Det,利用鲁棒性不对称检测 AI 生成图像
- arXiv
- 2603.01544
- 发表
- 层
- 应用层
- 场景
- LLM 应用
摘要RA-Det 把扰动下特征漂移差变成检测信号,平均 ACC 高于表中通用检测器,但不是每行最高。
RA-Det 是合成图像检测器,用扰动下的表示稳定性差异代替外观痕迹。
- 攻击arXiv 2610.04195
MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
- arXiv
- 2610.04195
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击arXiv 2609.06749
PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
- arXiv
- 2609.06749
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 防御arXiv 2609.23586
VidMark:面向视频生成模型知识产权保护的高效水印方案
提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权
- arXiv
- 2609.23586
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要VidMark 加解码器引导微调,把模型签名写入 VGM 输出并用于两项核验。
Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。
- 防御arXiv 2609.03629
EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除
提出 EraseSAE,在文生视频模型中局部擦除指定概念
- arXiv
- 2609.03629
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要EraseSAE 用单义特征局部擦除。
EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。
- 防御arXiv 2609.15799
RAPID:面向文生图服务的实时防未授权蒸馏防御
提出 RAPID,离线把抗蒸馏扰动写入文生图解码器
- arXiv
- 2609.15799
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
已经到底了