研究提出 Agent 安全新维度:识别未履行的安全义务
提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务
- arXiv
- 2610.11773
- 发表
- 层
- 应用层
- 被测模型
- ObligationGuard、Claude-Opus-4.8、GPT-5.6-Sol 等 17 个
- 防御检测与过滤
- 风险Agent 危险操作
- 组件护栏与评审
摘要义务是护栏缺口。
作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。
另有 246 篇论文还没打上分类标签,暂不在筛选结果里。
提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务
作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。
提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器
这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。
提出 agent plasticity 指标衡量智能体通过经验自我改进的效率
作者用 agent plasticity 衡量一件事:权重冻结时,智能体把经验写成可继承制品,再换成留出能力增益,这个转换有多省。
评测文生图模型的有害内容生成能力与审核检测缺口
提出 PyINE 基准,训练捷径跟随模型并比较监督者
PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
提出 FAME,用反事实概念漂移评测智能体虚假记忆
FAME 是一个免训练的评测框架,用来判断自主智能体的记忆在虚假相关、环境偏移或知识冲突下是否已变成虚假记忆。。
诊断护栏相对基座在对抗提示上的置信失校
诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。
提出 RewardExplainer,用反事实偏好反馈学习奖励模型解释
RewardExplainer针对只输出标量的判别式奖励模型,训练一个可复用的自然语言机制解释器,并把解释接到偏差发现与 RM 微调上。
B IAS R EDUCER 只改奖励头,按数据集选择属性编辑。
BIASREDUCER 是一种只改线性奖励头的奖励模型编辑框架,用来降低模型对预定义表面属性的依赖,并按新数据集决定改哪些属性。
提出 SkillDRE,用预执行与运行时双阶段反馈演化恶意 Agent 技能
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
提出 harm laundering,证明安全训练改写而非消除性别歧视
Wyer、Black 与 Al Moubayed 用 OpenAI GPT 谱系检验:毒性分数下降是否等于歧视减少。 他们的答案是否定的,并把“显性伤害被改写成评测指标看不见的形式”称为 harm laundering。
提出 PMPA,经外部源向 Agent 持久记忆投毒并跨会话泄露隐私
摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。
提出 influence score,量化提示注入检测器各注意力头的有效贡献
这项工作在推理时给提示注入检测分类器的注意力头一个影响分数,用来看分类决策从哪些头来。缺口是电路分析往往要重插桩,只看输出又不知道内部组件的贡献。作者希望同时看到决策在哪一层形成、哪些头在推,以及正确与错误是否对应不同机制。
提出针对 Agent Harness 的上下文特权提升攻击
提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化
用演化算法构造 mind virus 并测量其在多智能体中的传播
提出 ColluSkill,用跨技能组合绕过 Agent 技能扫描器
摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。
构建 ContextWeave,评测办公工作流智能体记忆的下游增益
ContextWeave 是面向语言智能体记忆的纵向基准,用来看召回先前经验能否让后续办公任务做得更好。