FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵
提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门
完整解读
另有 48 篇论文还没打上分类标签,暂不在筛选结果里。
提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门
提出 PERSISTBD,在发布前强化后门使其经良性后训练仍然存活
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
提出 TrustProbe,挖掘技能内容流向特权操作的信任链漏洞
完整解读提出 PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出 APEX,用跨技能进度记录夹带虚假授权劫持智能体
完整解读提出技能名抢注攻击,利用智能体虚构技能名劫持技能供应链
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
完整解读提出 HOOKPRY,利用插件生命周期钩子更新劫持智能体框架执行命令
完整解读提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
提出 AKRASIA 推断期后门,用代码级触发器与伪装推理操纵代码模型
提出主题锚点投毒,放大众包微调后的专有指令提取