评测与基准arXiv 2608.12851·8月13日研究者提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化风险提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化arXiv2608.12851发表8月13日层应用层场景coding agent被测模型Claude Code、Codex、Hermes 等 4 个攻击投毒与后门技术潜伏触发组件记忆深度解读完整解读
防御arXiv 2608.02683·8月3日S³:用多阶段防御提升 LLM 智能体安全提出 S³,用 guard agent 编排阶段安全技能防御智能体多阶段风险arXiv2608.02683发表8月3日层应用层场景具身与机器人被测模型DeepSeek-V4-Pro、DeepSeek-V4-Flash防御监控与审计攻击投毒与后门风险Agent 危险操作组件监控器+2+2深度解读完整解读