OverEager-Gen 发布:测量编码 Agent 在良性任务上的越权操作
发布 OVEREAGER-GEN,评测编码 Agent 在良性任务上的越权操作
- arXiv
- 2605.18583
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文构建了首个良性任务代码智能体越权基准,发现框架架构主导越权风险。
另有 429 篇论文还没打上分类标签,暂不在筛选结果里。
发布 OVEREAGER-GEN,评测编码 Agent 在良性任务上的越权操作
摘要论文构建了首个良性任务代码智能体越权基准,发现框架架构主导越权风险。
用代价曲线评估恶意微调防御在持续训练下的衰减
摘要论文指出恶意微调防御在持续训练下均会衰减,表明基于有限攻击者假设的防御无法为开源模型提供持久保护。
构建 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
摘要评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。
审计由智能体从零构建并部署的真实应用的安全缺陷
摘要论文全面揭示了部署 vibe-coded 应用的高危现状与成因,指出全流程管线防御优于单纯模型缩放。
评测人类开发者在协作编程中能否发现编码 Agent 的隐蔽破坏
提出分风险对齐标度律框架,测量各类风险的对齐负担如何随规模变化
本文提出了一个将大语言模型对齐难度形式化为可测量标度关系的理论框架与预注册评测协议。
提出 HARNESSSECURITY-BENCH 评测编码智能体框架的安全机制
提出 DrivingBench 评测视觉语言模型的真车闭环驾驶
DrivingBench 评测通用 VLM 能否自己闭环开真车,推理延迟也算进任务。
提出 HAL 污染审计框架并检验智能体排行榜评分器
作者给出一套测量优先审计框架,用来判断智能体排行榜上的污染主张各自需要何种证据。
提出 EvalResearchBench 评测智能体自主设计可执行评测的能力
ERB 用来测一件事:智能体在固定预算内做出的可执行评测,能否复现既有基准对候选模型的分数和排序。
提出路径对齐归因 PAA,在边界动作前审计长流程智能体的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出 EvoRiskBench,评测工作区 Agent 的运行时安全风险
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
提出 READY 资格框架,评测企业 Agent 在监督下的可靠性与复核成本
READY 把“智能体能否自主完成工作”改写成“哪个人机监督策略能在留出证据上达到规定可靠性,以及要付多少运营成本”。。
提出办公工作流记忆基准 ContextWeave ,衡量历史召回对后续任务的增益
ContextWeave 是面向语言智能体记忆的纵向基准,用来看召回先前经验能否让后续办公任务做得更好。
提出 Vero 基准,评测编程智能体联合生成实现与机器检查证明
提出 SDLP 与 GRPO,训练模型遵循上下文水印指令
提出 Harness-IF,按交付面评测编程 Agent 的指令遵循
Harness-IF 用执行证据给编程智能体的单条操作规则打分,并单独报告反对未提示默认的那一部分。。
摘要系统量化了前沿 AI 安全框架的静默修订,发现多数变更为削弱且未予披露,建议监管要求逐项列举。
构建无污染的 SRE-Bench,评测智能体在真实规模二进制上的逆向能力
作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。