防御arXiv:2610.05870 · 10月5日MBZUAI 提出可校准的真实图像认证方法提出校准重合成认证,仅当已知生成器都不能保真重构时签发真实图像证书模型与 API攻击者白盒·测试SD2.1、SD3、SD3.5 等 10 个·模型层检测与过滤检测规避图像生成摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。完整解读
评测与基准arXiv:2609.08258 · 9月8日研究实测五套 Agent 记忆系统均不执行撤销标记评测智能体记忆软撤回是否生效,并提出陈旧检索防护AI Agent·测试GPT-5.5、Grok-4、DeepSeek-V4-Flash 等 9 个·应用层检测与过滤Agent 危险操作记忆摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。完整解读
防御arXiv:2609.23586 · 9月20日VidMark:面向视频生成模型知识产权保护的高效水印方案提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权模型与 API·测试Stable Video Diffusion (SVD)、Open-Sora、Wan·模型层水印与溯源检测规避图像生成+1+1摘要VidMark 加解码器引导微调,把模型签名写入 VGM 输出并用于两项核验。Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。完整解读