评测与基准arXiv 2608.12851
研究者提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化风险
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
- arXiv
- 2608.12851
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Claude Code、Codex、Hermes 等 6 个
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
提出 TRUSTFORK,评测展示身份如何劫持多智能体编排的操作权限
摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。