风险行为arXiv 2608.10218·8月11日研究者用进化算法构造多智能体 LLM 系统中的自我传播“思维病毒”用演化算法构造 mind virus 并测量其在多智能体中的传播arXiv2608.10218发表8月11日层应用层场景多智能体、coding agent被测模型Claude Haiku 4.5、Claude Sonnet 4.6、Gemini 3 Flash 等 7 个风险失准与价值偏离组件记忆深度解读完整解读
攻击arXiv 2509.05372·2025年9月4日研究:对抗性 bug 报告可诱导 LLM 自动程序修复系统生成不安全补丁用对抗缺陷报告诱导自动程序修复系统生成不安全补丁arXiv2509.05372发表2025年9月4日层应用层场景coding agent被测模型claude-sonnet-4-20250514、o4-mini、GPT-4.1-mini 等 8 个攻击提示注入技术角色扮演与说服组件护栏与评审深度解读完整解读