评测与基准arXiv 2610.03585
宾州州立大学提出 TPRS,量化 Agent 安全基准中工具命名对 ASR 的影响
提出 TPRS,量化工具命名等表征变化对智能体安全基准得分的影响
- arXiv
- 2610.03585
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude Haiku 4.5、GPT-5-mini、GPT-4o-mini
提出 TPRS,量化工具命名等表征变化对智能体安全基准得分的影响
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
提出技能级联攻击,把恶意目标拆进多个技能以绕过单技能检测
摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。
构建多模态技能图像攻击基准 MMSkillRisk 并设计 NCVA
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。