评测与基准arXiv 2610.09033
研究发布 ASRD 数据集,评测五款开源模型在非规范输入下的安全表现
- arXiv
- 2610.09033
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Gemma 2 9B、Gemma 3 4B、Llama 3.1 8B 等 6 个
摘要五模型、七族表面形式的四态评测里,低有害遵从不等于读懂后的安全处理。
ASRD 用四态标签检查五个开源模型如何处理非规范表面上的有害请求。
ASRD 用四态标签检查五个开源模型如何处理非规范表面上的有害请求。
提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性
SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。
提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出最小范数攻击集成,用鲁棒性曲线评测图像分类器
这篇工作把对抗鲁棒评测从单一 ε、固定集成,改成可按查询预算收紧的曲线估计。