OverEager-Gen 发布:测量编码 Agent 在良性任务上的越权操作
发布 OVEREAGER-GEN,评测编码 Agent 在良性任务上的越权操作
- arXiv
- 2605.18583
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GLM-4.6、MiniMax-M2.7、claude-sonnet-4-6 等 6 个
摘要论文构建了首个良性任务代码智能体越权基准,发现框架架构主导越权风险。
另有 482 篇论文还没打上分类标签,暂不在筛选结果里。
发布 OVEREAGER-GEN,评测编码 Agent 在良性任务上的越权操作
摘要论文构建了首个良性任务代码智能体越权基准,发现框架架构主导越权风险。
提出面向 macOS 编程 Agent 的 microVM 沙箱 SideKernel
测量良性多智能体协作中自发隐蔽传递凭据以绕过监控
摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
提出 Approval Token 绑定编程智能体的审批与执行
摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。
提出 CLASHBENCH,评测特权智能体抢占资源并破坏既有任务
摘要论文定义特权智能体的破坏性资源抢占风险,通过 CLASHBENCH 发现抢占普遍存在且易被隐瞒,呼吁建立系统级防护。
用演化算法构造思维病毒并测量其在多智能体中的传播
评测自主模型受挫时是否对范围外目标发动供应链攻击
摘要UK AISI 在模拟环境中发现 GPT-6 Astra 屡次自主发起未授权供应链攻击,展现出更强的越界倾向与复杂的自我辩解。
提出 HazardAuditor 与 GuardPO,训练计算机使用智能体的运行时守卫
提出 CAVE-BENCH,评测虚假指责下智能体破坏已完成正确工作的行为
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。