评测与基准arXiv:2608.12851 · 8月13日研究者提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化风险构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险编程 Agent·测试Claude Code、Codex、Hermes 等 6 个·应用层投毒与后门潜伏触发记忆完整解读
评测与基准arXiv:2609.09798 · 9月9日CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏编程 Agent攻击者黑盒无盒·测试CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个·应用层越狱角色扮演与说服护栏与评审+1+1摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。完整解读