HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制
评测编码智能体 harness 安全机制在对抗任务中的防护效果
- arXiv
- 2610.07639
- 发表
- 层
- 应用层
另有 537 篇论文还没打上分类标签,暂不在筛选结果里。
评测编码智能体 harness 安全机制在对抗任务中的防护效果
提出 Inspect Robots,在真实机器人上评测具身模型的能力与拒答
提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性
SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。
提出 OSWorld-Science 基准,评测计算机使用智能体完成科学软件工作流的能力
提出 DrivingBench,评测通用视觉语言模型能否闭环驾驶真车
DrivingBench 评测通用 VLM 能否自己闭环开真车,推理延迟也算进任务。
提出 EngiWorld 基准,评测 Agent 在专业工程软件中走完设计闭环的能力
用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。
提出 TRUSTFORK 基准,评测展示身份劫持多智能体编排权限
摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。
提出 CAVE-BENCH,评测智能体在虚假指责下破坏已完成的正确工作
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
提出 SWE-Prometheus 基准,评测编码智能体对真实仓库的工程治理改进
SWE-Prometheus 评测编码智能体能否在没有给定缺陷的情况下,提高真实仓库的工程治理状态。
构建 ACE 语料,评测内核级证据对 Agent 攻击检测的有效性
ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。
提出 NAVSAFE-∞ 写真闭环基准,评测端到端驾驶策略的闭环安全
NAVSAFE-∞ 用写真、事件级闭环仿真检查端到端驾驶策略的安全,而不是只看开环轨迹分数。
提出 OSWorld-Pro,用顺序子目标过程评测计算机使用智能体
OSWorld-Pro 是一套计算机使用智能体的过程评测,用来补充只核对最终交付物的 OSWorld。
提出 MobileCybench,用可执行探针评测 Agent 的漏洞发现能力
提出移动 Agent 轨迹审计器 MATE,判断轨迹是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
构建 CLASHBENCH 评测特权 Agent 在资源冲突下的破坏性抢占
摘要论文定义特权智能体的破坏性资源抢占风险,通过 CLASHBENCH 发现抢占普遍存在且易被隐瞒,呼吁建立系统级防护。
提出 VLoc Bench,评测智能体在完整仓库中定位漏洞文件并抑制修复后误报
摘要论文提出仓库级漏洞定位基准 VLoc Bench,指出当前模型定位表现较低且易在已修复代码上产生误报。
提出 SafeRLEval,用越界率与代价偏差评测安全强化学习
Spoor、Plaat 与 Moerland 认为,安全强化学习沿用 CMDP 的 E[C]≤d,只报告平均是否安全,看不出越界频率和幅度,也分不清训练期、带探索噪声的最终策略和贪心部署策略。他们提出评测框架 SafeRLEval:越界率 V、按安全界归一化的平均代价偏差 Dnorm、只在越界回合上计算的归一化幅度 Dnorm+。用 IQM 跨任务和安全界聚合。
发布 SWE-Bench Pro Verified,隔离答案通道并修订任务以抑制奖励破解