评测与基准arXiv 2610.03448
研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现
重评 Agent 提示注入检测器,检验基准分数能否预测部署表现
- arXiv
- 2610.03448
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
重评 Agent 提示注入检测器,检验基准分数能否预测部署表现
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
提出 UBA-ORL,借助 BD 与 CM 样本让离线强化学习后门在轨迹删除后激活
UBA-ORL 研究离线强化学习中由合规轨迹删除激活的后门:合法贡献者同时上传共享触发的后门轨迹和伪装轨迹,训练后触发响应被压低,删除伪装批次后再升高。受害系统是使用静态数据集和轨迹级遗忘接口的离线 RL 服务。对手不能看到训练算法、参数、梯度或具体遗忘算法,但能提交可区分批次,并在部署时向观测注入预定触发。
提出工具调用 Agent 的拒绝钱包攻击及主机侧计费约束
这篇工作把工具调用智能体里跨轮保留、并被提供商反复计费的外部工具返回定义为 persistent billable state,并把它的主机侧再次送入决定当作控制点。。