攻击arXiv 2610.05793
研究者训练出按多智能体拓扑触发的代码后门模型
提出拓扑条件后门,使模型在推断多智能体部署时向代码插入隐蔽漏洞
- arXiv
- 2610.05793
- 发表
- 测试
- Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
提出拓扑条件后门,使模型在推断多智能体部署时向代码插入隐蔽漏洞
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。
提出 SCOPE 联合后训练计算机使用智能体的任务执行与安全决策
提出条件触发的爆炸提示词,延迟激活 Agent 的间接提示注入
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。