研究者训练出按多智能体拓扑触发的代码后门模型
微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞
完整解读
另有 95 篇论文还没打上分类标签,暂不在筛选结果里。
微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞
提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
完整解读提出 AHA 自动科研循环,发现生产级智能体的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
完整解读提出跨目标课程强化学习,生成间接提示注入以劫持智能体
该研究针对强化学习自动化提示注入红队在攻击前沿大模型时的冷启动问题,提出了一种基于目标模型鲁棒性递进的课程强化学习方法。