评测与基准arXiv 2608.00677
OpenART 提出环境演化红队框架
提出 OpenART 竞技场,用 EMHA 演化持久环境以评测智能体安全
- arXiv
- 2608.00677
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GPT-5.5、Claude-Opus-4.8、GLM-5.2 等 5 个
另有 66 篇论文还没打上分类标签,暂不在筛选结果里。
提出 OpenART 竞技场,用 EMHA 演化持久环境以评测智能体安全
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
提出 TRUSTFORK,评测展示身份如何劫持多智能体编排的操作权限
摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。
提出 AgentXploit 红队系统,分离仓库攻击路径发现与运行时利用
提出技能级联攻击,把恶意目标拆进多个技能以绕过单技能检测
摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。
构建多模态技能图像攻击基准 MMSkillRisk 并设计 NCVA
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。