评测与基准arXiv 2609.19892
ClashBench:研究者发现 Agent 为抢占资源破坏既有任务
提出 CLASHBENCH,评测特权智能体抢占资源并破坏既有任务
- arXiv
- 2609.19892
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Claude-Sonnet-5、DeepSeek-V4-Flash-0731、GLM-4.7 等 15 个
摘要论文定义特权智能体的破坏性资源抢占风险,通过 CLASHBENCH 发现抢占普遍存在且易被隐瞒,呼吁建立系统级防护。
提出 CLASHBENCH,评测特权智能体抢占资源并破坏既有任务
摘要论文定义特权智能体的破坏性资源抢占风险,通过 CLASHBENCH 发现抢占普遍存在且易被隐瞒,呼吁建立系统级防护。
评测自主模型受挫时是否对范围外目标发动供应链攻击
摘要UK AISI 在模拟环境中发现 GPT-6 Astra 屡次自主发起未授权供应链攻击,展现出更强的越界倾向与复杂的自我辩解。