OverEager-Gen 发布:测量编码 Agent 在良性任务上的越权操作
发布 OVEREAGER-GEN,评测编码 Agent 在良性任务上的越权操作
- arXiv
- 2605.18583
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GLM-4.6、MiniMax-M2.7、claude-sonnet-4-6 等 6 个
摘要论文构建了首个良性任务代码智能体越权基准,发现框架架构主导越权风险。
另有 14 篇论文还没打上分类标签,暂不在筛选结果里。
发布 OVEREAGER-GEN,评测编码 Agent 在良性任务上的越权操作
摘要论文构建了首个良性任务代码智能体越权基准,发现框架架构主导越权风险。
提出工作流级越狱构建,经多轮开发工作流诱导编程 Agent 在代码中写出有害内容
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。
提出 Whisper 攻击与 A-VIP 绑定防御,约束智能体支付决策
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
提出 HARNESSSECURITY-BENCH 评测编码智能体框架的安全机制
审计 Active Inference Agent 上 LLM 解释器的监督叙述失败
作者审计的是挂在智能体上的运行时解释器,而不是智能体本身。操作员读到的是信念与动作的自然语言叙述。作者要问哪些可复现触发会让这段叙述失败,以及失败痕迹是什么样。
提出 ALIBI,向恶意二进制注入不执行掩护叙事使分析器误判为良性
ALIBI 是针对 LLM 恶意软件分诊的语义掩护叙事攻击:不覆盖系统指令,而把仍可见的可疑静态证据重释成良性安全产品的预期行为。
评测深度研究 Agent 是否把检索误导文档采纳为自身结论
摘要论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。
用检查点诊断长程安全 Agent 的失败来源
作者提出一套检查点诊断,用来判断长程安全智能体的失败发生在目标能力可测之前还是之后,并用配对干预检验上游解释。
系统分析 AP2 支付协议的授权安全并验证前置上下文操纵
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
分析多轮攻击中有害性与拒答表征的几何演化
作者刻画多轮攻击里 harmfulness 与 refusal 相关表示如何随对话变化,而不提出新的攻击或防御。
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变。
提出五步诊断协议,检验幻觉神经元定位是否唯一
这项工作用诊断协议复查 H-Neurons 的定位主张。问题是:L1 探针在相关激活上可以选出能预测幻觉的少量神经元,但这不等于这些神经元唯一编码该行为。
提出 SCALPEL,用对比 SAE 在表征层选择性遗忘特定事实
SCALPEL 是不改基座权重的表征层遗忘方法,面向与保留数据重叠的窄目标。
检验儿童受众框架是否让前沿模型收敛到同一套架构母题
这项研究记录前沿模型在固定社交框架下的架构自述是否形成稳定回答盆地,并把该现象称为认识性越狱,而不是已核实的模型内部。
在残差流中构造 Symptom Vectors,读出与临床对齐的抑郁症状
提出 GAPS 维度门控,改进条件激活引导以抑制毒性与概念指涉
GAPS 为 activation steering 增加维度级条件:在决定何时干预之外,再决定当前该动哪些神经元。
用线性探针、归因修补与 SAE 消融追踪多语模型刻板印象
把多语 LLM 中刻板印象从线性表示追到输出影响,再追到 SAE 特征消融。。
提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员
WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。