HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读提出 EvoRiskBench,评测工作区智能体的运行时安全风险
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
完整解读提出 TRUSTFORK,评测展示身份如何劫持多智能体编排的操作权限