攻击arXiv 2609.17817
论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码
提出基准投毒攻击,使自修改编码 Agent 跨代写出含漏洞代码
- arXiv
- 2609.17817
- 发表
- 层
- 应用层
- 被测模型
- Claude Sonnet 4.5、Qwen3.5-397B、gpt-oss-120b 等 5 个
- 攻击投毒与后门
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
提出基准投毒攻击,使自修改编码 Agent 跨代写出含漏洞代码
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
用演化算法构造 mind virus 并测量其在多智能体中的传播