全部论文
另有 443 篇论文还没打上分类标签,暂不在筛选结果里。
摘要质量筛选挡不住部分高分样本的安全削弱。
Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。
- 评测与基准arXiv 2609.35912
MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作
提出 MMSkillRisk 与 NCVA,评测技能图像隐藏指令诱导的未授权操作
- arXiv
- 2609.35912
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。
已经到底了