评测与基准arXiv 2608.12851
研究者提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化风险
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
- arXiv
- 2608.12851
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Claude Code、Codex、Hermes 等 6 个
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
构建多模态技能图像攻击基准 MMSkillRisk 并设计 NCVA
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。