论文:安全路由评测在分布偏移下失效,基线选取偏差被低估
提出诚实留出协议,量化安全路由评测的基线选择偏差
- arXiv
- 2610.01535
- 发表
- 层
- 应用层
- 测试
- claude-3-5-sonnet、claude-3-opus、claude-sonnet-4-6 等 12 个
- 攻击越狱
摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。
另有 39 篇论文还没打上分类标签,暂不在筛选结果里。
提出诚实留出协议,量化安全路由评测的基线选择偏差
摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
提出 M-CPE 与 X-CPE 两类上下文特权提升攻击
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出 PIDS-Bench,评测提示注入检测器在过度防御与分布偏移下的表现
PIDS-Bench 是一个冻结的检测器级基准,用来在固定阈值下同时看提示注入检测和良性误报。
提出 LeakGauge,用行为后缀的 prefill 对数概率检测上下文泄露
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
提出 EvoSafeHarness,为冻结模型与目标域自动搜索安全 harness
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
提出任务绑定令牌与策略预言机,在多智能体流水线中拦截未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
提出身份绑定且只收窄的能力令牌,用上下文外钱包约束智能体
代表人类行动的分布式智能体,需要一种不把密钥放进语言模型上下文的授权方式。
提出 ORBIT 框架,评测多智能体系统中的攻击、合谋与多类防御
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
提出残余权限重放攻击,让长期 Agent 跨任务复用未失效授权
提出免训练框架 SED,把智能体有害轨迹蒸馏成可检索安全策略