评测与基准arXiv:2607.20891 · 7月23日MisKnow-Agent 评测提出 MisKnow-Agent,评测深度研究智能体是否采纳误导性检索知识AI Agent·测试Gemini Deep Research、DeepSeek-V4 Pro、Qwen3.5-397B 等 4 个·应用层投毒与后门RAG摘要论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。完整解读
风险行为arXiv:2608.10218 · 8月11日研究者用进化算法构造多智能体 LLM 系统中的自我传播“思维病毒”用演化算法构造思维病毒并测量其在多智能体中的传播多智能体编程 Agent·测试Claude Haiku 4.5、Claude Sonnet 4.6、Claude Opus 4.6 等 9 个·应用层失准与价值偏离记忆完整解读
攻击arXiv:2609.17817 · 9月16日论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码编程 Agent·测试Claude Sonnet 4.5、Qwen3.5-397B、gpt-oss-120b 等 6 个·应用层投毒与后门潜伏触发摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。完整解读
攻击arXiv:2609.08236 · 9月8日研究:内容不变的风格包装可翻转 LLM 安全评判器的判定提出内容不变样式包装,翻转安全评审器的判定模型与 API攻击者无盒黑盒·测试Keyword (rulebased)、GPT-4o-mini (gpt4o)、GPT-4o-mini (strongreject) 等 12 个·提示层检测规避角色扮演与说服护栏与评审+1+1摘要论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。完整解读