研究者训练出按多智能体拓扑触发的代码后门模型
微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞
完整解读
微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
完整解读提出 OpenART 竞技场,用 EMHA 演化持久环境以评测智能体安全
完整解读提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。