- 评测与基准arXiv 2607.24177
EXE-Bench:为真实可用性对 AI Windows 恶意软件检测器进行权衡排名
提出 EXE-Bench 比较 Windows 恶意软件检测器的可用性权衡
- arXiv
- 2607.24177
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击检测规避
摘要统一四指标后,手工特征的 EmberGBDT 综合居首,只看准确率会误导部署。
EXE-Bench 用同一设置给 AI Windows 恶意软件检测器做四指标排序,而不是只比一次测试集准确率。。
- 防御arXiv 2610.00348
NEEDLE:通过权重正交化移除 LLM 后门
提出 NEEDLE,用权重正交化在已知触发器时去除大模型后门
- arXiv
- 2610.00348
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要NEEDLE 用闭式权重编辑去掉已知触发器的后门,并保住拒绝子空间。
- 防御arXiv 2609.00786
MROP:针对 Deep JSCC 后门攻击的掩码区域优化净化方法
提出 MROP,在发射端推理时纯化输入以抵御训练投毒后门
- arXiv
- 2609.00786
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要MROP 不重训练,在发射端纯化补丁后门。
MROP 是 deep JSCC 无线图像传输上的推理时输入纯化,对象是矩形补丁后门。
- 防御arXiv 2608.12713
互补 LLM 水印如何追踪来源并检测篡改
提出 Cocktail 水印,共嵌稳健与脆弱信号以溯源并发现篡改
- arXiv
- 2608.12713
- 发表
- 层
- 模型层
- 场景
- 模型与 API
已经到底了