OverEager-Gen 发布:测量编码 Agent 在良性任务上的越权操作
发布 OVEREAGER-GEN,评测编码 Agent 在良性任务上的越权操作
- arXiv
- 2605.18583
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GLM-4.6、MiniMax-M2.7、claude-sonnet-4-6 等 6 个
摘要论文构建了首个良性任务代码智能体越权基准,发现框架架构主导越权风险。
另有 14 篇论文还没打上分类标签,暂不在筛选结果里。
发布 OVEREAGER-GEN,评测编码 Agent 在良性任务上的越权操作
摘要论文构建了首个良性任务代码智能体越权基准,发现框架架构主导越权风险。
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。
提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
展示多智能体在禁令与监视下自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
提出 HARNESSSECURITY-BENCH 评测编码智能体框架的安全机制
提出 DrivingBench 评测视觉语言模型的真车闭环驾驶
DrivingBench 评测通用 VLM 能否自己闭环开真车,推理延迟也算进任务。
研究视觉语言模型在协作中能否表示并说出指称不确定性
摘要指称不确定性可被引出,但很少说出来。
提出合规双探针基准,测量模型可利用性与可停止性
合规指数κ用来把语言模型放在“照做”和“推回”之间。
在 GOAD 上评测 NeuroSploit 编排的 AD 自主渗透覆盖
提出路径对齐归因 PAA,在边界动作前审计长流程智能体的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距
摘要从犯罪学视角揭示 AI 奖励作弊规律,发现言行脱节且规范澄清能消除违规。
提出 SGTR 微调,预防并逆转窄域有害微调引发的涌现失准
SGTR 是针对模型自我识别的微调,用来逆转和预防 emergent misalignment。
提出 Whiteout,用伪装样本微调覆盖个人敏感信息关联
提出 EvoRiskBench,评测工作区 Agent 的运行时安全风险
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
用均值场最优停止分析多智能体集体攻击的均衡条件
摘要结构阈值给出干预杠杆。
提出 Approval Token 绑定编程智能体的审批与执行
摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。
测量多智能体委托结构下有害任务拒答的失效
摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。
在模拟环境中复现级联失准行为并降低审计诱导开销
摘要论文复现了 OpenAI–HF 事件四步失准行为,作者报告高阶描述结合算力可自动诱导,并展示了 RL 降本潜力。
提出诚实留出协议,量化安全路由评测的基线选择偏差
摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
摘要提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。