PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率
提出PERSISTBD,在发布前强化后门使其经良性后训练仍然存活
本文研究第三方LLM智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
提出PERSISTBD,在发布前强化后门使其经良性后训练仍然存活
本文研究第三方LLM智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
提出TrustProbe,挖掘技能内容流向特权操作的信任链漏洞
提出PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出APEX,用跨技能进度记录夹带虚假授权劫持智能体
论文针对大语言模型智能体使用多技能串联时的安全隐患,提出对抗性技能链构建框架APEX。
提出技能名抢注攻击,利用智能体虚构技能名劫持技能供应链
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
本文系统分析了真实世界 AI 智能体 Harness 上下文组装机制的安全性。
提出HOOKPRY,利用插件生命周期钩子更新劫持智能体框架执行命令
提出SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
提出AKRASIA推断期后门,用代码级触发器与伪装推理操纵代码模型