评测与基准arXiv 2608.12851
研究者提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化风险
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
- arXiv
- 2608.12851
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Hermes、Claude Code、Codex 等 6 个
另有 981 篇论文还没打上分类标签,暂不在筛选结果里。
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出 CAVE-BENCH,评测智能体遭虚假指责后是否破坏已正确的工作
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
提出 ScopeBench,测量渗透智能体在目标压力下的范围遵从