研究:94% 开发者未能识破编码 Agent 的隐蔽破坏
评测人类开发者在协作编程中能否发现编码智能体的隐蔽破坏
- arXiv
- 2606.05647
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- MiniMax-M2.7、Claude-Opus-4.6、GPT-5.4 等 5 个
另有 701 篇论文还没打上分类标签,暂不在筛选结果里。
评测人类开发者在协作编程中能否发现编码智能体的隐蔽破坏
提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束
摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。
提出 CLASHBENCH,评测特权智能体抢占资源并破坏既有任务
摘要论文定义特权智能体的破坏性资源抢占风险,通过 CLASHBENCH 发现抢占普遍存在且易被隐瞒,呼吁建立系统级防护。
提出 MOLE 基准,评测智能体内部威胁的完成情况与监控漏检
MOLE 是首个针对前沿 AI 实验室智能体内部威胁检测的开放基准,旨在评估在有限每日审查预算与日常研发业务背景下识别恶意账号的能力。。
提出闭环基准 NAVSAFE-∞,评测端到端驾驶策略的安全关键事件表现
NAVSAFE-∞ 用写真、事件级闭环仿真检查端到端驾驶策略的安全,而不是只看开环轨迹分数。
提出 ForesightSafety-TIDE,评测多智能体在单点欺骗下的集体事实恢复
提出 VoxParity 基准,评测语音智能体是否按音频改变工具调用
VoxParity 测量语音智能体在词语不变、只有声音改变时,是否按行业规则改它所执行的工具调用。
构建 AGENTTELL 基准,测量浏览器智能体跨站行为侧信道泄露
摘要论文评估了浏览器智能体的行为侧信道泄露风险,并基于近万次会话提供了评测数据。
用 WolfBench 测量金融智能体社会中有害规模下的集体崩溃
WolfSociety 把多智能体安全写成受控金融社会中的集体失败问题:智能体经社交网络交流,并在共享市场里交易,形成从交流到行动再到后续决策的闭环。
提出 SafeRLEval,评测安全强化学习策略的越界与代价偏差
Spoor、Plaat 与 Moerland 认为,安全强化学习沿用 CMDP 的 E[C]≤d,只报告平均是否安全,看不出越界频率和幅度,也分不清训练期、带探索噪声的最终策略和贪心部署策略。他们提出评测框架 SafeRLEval:越界率 V、按安全界归一化的平均代价偏差 Dnorm、只在越界回合上计算的归一化幅度 Dnorm+。用 IQM 跨任务和安全界聚合。
提出 SafeStage,分执行前中后评测视觉语言机器人操作安全
提出 ScopeBench,测量渗透智能体在目标压力下的范围遵从
作者提出 CONFLICTGUI 基准,覆盖指令内部冲突与指令和 GUI 上下文冲突两类场景,用于研究 GUI Agent 的冲突感知终止能力。
ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。
提出四向反事实评测,测量工具 Agent 对授权与表面风险的行动边界
AGENT BOUNDARY 是面向工具使用 LLM 智能体的四向可执行反事实评测,并附带一个决策时 Thought 校准模块。
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
用 SameFact 比较同一安全事实在判断与动作接口上的敏感度
摘要SameFact 显示同一安全事实的敏感度随模型、因子和引出协议共同变化。